> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Асинхронный синтез речи MiniMax Speech-2.6-turbo

Этот API поддерживает асинхронную генерацию на основе преобразования текста в речь. За одну передачу текстовой генерации поддерживается до 1 миллиона символов, а полный сгенерированный аудиорезультат можно получить асинхронным способом. Поддерживается самостоятельный выбор более 100 системных голосов и клонированных голосов; также поддерживается самостоятельная настройка интонации, скорости речи, громкости, битрейта, частоты дискретизации и выходного формата.

После отправки запроса на синтез речи из длинного текста обратите внимание, что срок действия возвращаемого url составляет 24 часа с момента его возврата. Учитывайте время загрузки информации.

<Tip>Подходит для генерации речи из длинных текстов, например целых книг; ожидание задачи в очереди может занять продолжительное время. Для сценариев генерации коротких фраз, голосового чата, онлайн-социального взаимодействия и т. п. рекомендуется использовать [синхронный вызов синтеза речи](/ru/docs/models/reference-minimax-speech-2.6-turbo).</Tip>

## Заголовки запроса

<ParamField header="Content-Type" type="string" required={true}>
  Перечисляемое значение: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Формат аутентификации Bearer: Bearer \{\{API 秘钥}}.
</ParamField>

## Тело запроса

<ParamField body="text" type="string" required={true}>
  Текст для синтеза, максимальная длина — 50 тысяч символов.
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="properties">
    <ParamField body="speed" type="number" default={1.0}>
      Диапазон \[0.5,2], значение по умолчанию — 1.0

      Скорость генерируемого голоса. Необязательно. Чем больше значение, тем выше скорость речи.
    </ParamField>

    <ParamField body="vol" type="number" default={1.0}>
      Диапазон (0,10], значение по умолчанию — 1.0

      Громкость генерируемого голоса. Необязательно. Чем больше значение, тем выше громкость.
    </ParamField>

    <ParamField body="pitch" type="number" default={0}>
      Диапазон \[-12,12], значение по умолчанию — 0

      Интонация генерируемого голоса. Необязательно (0 — вывод исходного тембра, значение должно быть целым числом).
    </ParamField>

    <ParamField body="voice_id" type="string">
      Идентификатор запрашиваемого голоса.

      Поддерживаются два типа: системные голоса (id) и клонированные голоса (id). Системные голоса (ID) перечислены ниже:

      * Голос неопытного молодого мужчины: `male-qn-qingse`
      * Голос элитного молодого мужчины: `male-qn-jingying`
      * Голос властного молодого мужчины: `male-qn-badao`
      * Голос молодого студента университета: `male-qn-daxuesheng`
      * Голос девушки: `female-shaonv`
      * Голос зрелой старшей женщины: `female-yujie`
      * Голос зрелой женщины: `female-chengshu`
      * Голос милой женщины: `female-tianmei`
      * Мужчина-ведущий: `presenter_male`
      * Женщина-ведущая: `presenter_female`
      * Мужская аудиокнига 1: `audiobook_male_1`
      * Мужская аудиокнига 2: `audiobook_male_2`
      * Женская аудиокнига 1: `audiobook_female_1`
      * Женская аудиокнига 2: `audiobook_female_2`
      * Голос неопытного молодого мужчины-beta: `male-qn-qingse-jingpin`
      * Голос элитного молодого мужчины-beta: `male-qn-jingying-jingpin`
      * Голос властного молодого мужчины-beta: `male-qn-badao-jingpin`
      * Голос молодого студента университета-beta: `male-qn-daxuesheng-jingpin`
      * Голос девушки-beta: `female-shaonv-jingpin`
      * Голос зрелой старшей женщины-beta: `female-yujie-jingpin`
      * Голос зрелой женщины-beta: `female-chengshu-jingpin`
      * Голос милой женщины-beta: `female-tianmei-jingpin`
      * Умный мальчик: `clever_boy`
      * Милый мальчик: `cute_boy`
      * Очаровательная девочка: `lovely_girl`
      * Мультяшная свинка Сяоци: `cartoon_pig`
      * Болезненно одержимый младший брат: `bingjiao_didi`
      * Красивый парень: `junlang_nanyou`
      * Невинный младший ученик: `chunzhen_xuedi`
      * Холодный старший ученик: `lengdan_xiongzhang`
      * Властный молодой господин: `badao_shaoye`
      * Милашка Сяолин: `tianxin_xiaoling`
      * Игривaя милая девушка: `qiaopi_mengmei`
      * Обольстительная зрелая старшая женщина: `wumei_yujie`
      * Нежно-капризная младшая ученица: `diadia_xuemei`
      * Элегантная старшая ученица: `danya_xuejie`
      * Santa Claus: `Santa_Claus`
      * Grinch: `Grinch`
      * Rudolph: `Rudolph`
      * Arnold: `Arnold`
      * Charming Santa: `Charming_Santa`
      * Charming Lady: `Charming_Lady`
      * Sweet Girl: `Sweet_Girl`
      * Cute Elf: `Cute_Elf`
      * Attractive Girl: `Attractive_Girl`
      * Serene Woman: `Serene_Woman`
    </ParamField>

    <ParamField body="emotion" type="string">
      Управляет эмоцией синтезированной речи;

      В настоящее время поддерживаются 7 эмоций: радость, грусть, гнев, страх, отвращение, удивление, нейтральная;

      Диапазон параметра: `["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]`
    </ParamField>

    <ParamField body="text_normalization" type="bool" default="false">
      Этот параметр поддерживает нормализацию английского текста и может повысить производительность в сценариях чтения чисел, но немного увеличивает задержку. Если параметр не предоставлен, значение по умолчанию — false.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="properties">
    <ParamField body="sample_rate" type="number" default={32000}>
      Диапазон 【8000，16000，22050，24000，32000，44100】

      Частота дискретизации генерируемого звука. Необязательно, по умолчанию — 32000.
    </ParamField>

    <ParamField body="bitrate" type="number" default={128000}>
      Диапазон 【32000，64000，128000，256000】

      Битрейт генерируемого звука. Необязательно, значение по умолчанию — 128000. Этот параметр действует только для аудио в формате mp3.
    </ParamField>

    <ParamField body="format" type="string" default="mp3">
      Формат генерируемого аудио. По умолчанию mp3. Доступные варианты: `mp3`, `pcm`, `flac`, `wav`. wav поддерживается только при нестриминговом выводе.
    </ParamField>

    <ParamField body="channel" type="number" default={1}>
      Количество каналов генерируемого аудио. По умолчанию 1: моно, варианты:

      1: моно

      2: стерео
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="properties">
    <ParamField body="tone" type="list">
      Замена текста, символов и соответствующего произношения, требующих специальной разметки.

      Замена произношения (корректировка тона/замена произношения других символов), формат следующий:

      `["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]`

      Тоны заменяются цифрами: первый тон (ровный) — 1, второй тон (восходящий) — 2, третий тон (нисходяще-восходящий) — 3, четвертый тон (нисходящий) — 4, нейтральный тон — 5.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="language_boost" type="string" default="null">
  Усиливает распознавание указанных малораспространенных языков и диалектов. После настройки может улучшить речевое качество в сценариях с указанным малораспространенным языком/диалектом. Если тип малораспространенного языка не очевиден, можно выбрать "auto", и модель самостоятельно определит тип языка. Поддерживаются следующие значения:

  `'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'`
</ParamField>

<ParamField body="voice_modify" type="object">
  Настройки голосового эффектора. Поддерживаемые этим параметром аудиоформаты: mp3, wav, flac

  <Expandable title="properties">
    <ParamField body="pitch" type="integer">
      Регулировка высоты тона (низкий/яркий), диапазон \[-100,100]. Чем ближе значение к -100, тем ниже звук; чем ближе к 100, тем ярче звук
    </ParamField>

    <ParamField body="intensity" type="integer">
      Регулировка интенсивности (сила/мягкость), диапазон \[-100,100]. Чем ближе значение к -100, тем более жесткий и сильный звук; чем ближе к 100, тем более мягкий звук
    </ParamField>

    <ParamField body="timbre" type="integer">
      Регулировка тембра (бархатистый/звонкий), диапазон \[-100,100]. Чем ближе значение к -100, тем более насыщенный звук; чем ближе значение к 100, тем более звонкий звук
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Настройка звукового эффекта. За один раз можно выбрать только один вариант. Доступные значения:

      * `spacious_echo`（просторное эхо）
      * `auditorium_echo`（эхо аудитории）
      * `lofi_telephone`（телефонное искажение）
      * `robotic`（электронный голос）
    </ParamField>
  </Expandable>
</ParamField>

## Параметры ответа

<ResponseField name="task_id" type="string" required={true}>
  task\_id асинхронной задачи. Используйте этот task\_id для запроса [API получения результата задачи](/ru/docs/models/reference-get-async-task-result), чтобы получить результат генерации
</ResponseField>
