> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Асинхронный синтез речи MiniMax Speech 2.8 HD

Используйте этот интерфейс для создания асинхронной задачи синтеза речи. Поддерживается ввод текста или файла: ограничение длины текста — до 50 000 символов, ограничение для файла — до 100 000 символов.

<Tip>
  Это **асинхронный** API, который возвращает только task\_id асинхронной задачи. Используйте этот task\_id для запроса [API получения результата задачи](/ru/docs/models/reference-get-async-task-result), чтобы получить результат генерации.
</Tip>

## Заголовки запроса

<ParamField header="Content-Type" type="string" required={true}>
  Перечисляемое значение: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Формат Bearer-аутентификации: Bearer \{\{API 密钥}}.
</ParamField>

## Тело запроса

<ParamField body="text" type="string">
  Текст для синтеза аудио, ограничение длины — до 50 000 символов. Обязательно указать одно из двух: `text` или `text_file_id`<br /><br />• Теги междометий: только при выборе модели `speech-2.8-hd` или `speech-2.8-turbo` поддерживается вставка тегов междометий в текст. Поддерживаемые междометия: `(laughs)` (смех), `(chuckle)` (тихий смех), `(coughs)` (кашель), `(clear-throat)` (прочистить горло), `(groans)` (стон), `(breath)` (обычный вдох/выдох), `(pant)` (задыхание), `(inhale)` (вдох), `(exhale)` (выдох), `(gasps)` (резкий вдох), `(sniffs)` (шмыганье носом), `(sighs)` (вздох), `(snorts)` (фырканье), `(burps)` (отрыжка), `(lip-smacking)` (чмоканье губами), `(humming)` (напевание), `(hissing)` (шипение), `(emm)` (эм), `(whistles)` (свист), `(sneezes)` (чихание), `(crying)` (всхлипывание), `(applause)` (аплодисменты)
</ParamField>

<ParamField body="text_file_id" type="integer">
  id текстового файла для синтеза аудио. Длина одного файла должна быть меньше 100 000 символов. Поддерживаемые форматы файлов: txt, zip. Обязательно указать одно из двух: `text` или `text_file_id`; после передачи формат проверяется автоматически.<br />• **Файл txt**: ограничение длины \<100000 символов. Поддерживается использование `&lt;#x#&gt;` для обозначения пользовательской паузы. x — длительность паузы (единица: секунды), диапазон \[0.01, 99.99], максимум две цифры после запятой. Обратите внимание: пауза должна быть установлена между двумя фрагментами текста, которые можно произнести, и нельзя использовать несколько тегов паузы подряд<br />• **Файл zip**:<br />• Архив должен содержать файлы txt или json одного формата.<br />• Формат файла json: поддерживаются три поля \[`title`, `content`, `extra`], которые соответственно обозначают заголовок, основной текст и дополнительную информацию. Если присутствуют все три поля, будет создано 3 набора результатов, всего 9 файлов, которые будут сохранены в одной папке. Если какое-либо поле отсутствует или его содержимое пустое, для этого поля соответствующий результат не будет сгенерирован
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="свойства" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Настройка высоты тона (низкий/яркий), диапазон \[-100, 100]: чем ближе значение к -100, тем ниже голос; чем ближе к 100, тем ярче голос

      Диапазон значений: \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Настройка тембра (бархатистый/звонкий), диапазон \[-100, 100]: чем ближе значение к -100, тем более насыщенный голос; чем ближе к 100, тем более звонкий голос

      Диапазон значений: \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Настройка интенсивности (сила/мягкость), диапазон \[-100, 100]: чем ближе значение к -100, тем более энергичный голос; чем ближе к 100, тем более мягкий голос

      Диапазон значений: \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Настройка аудиоэффекта, за один раз можно выбрать только один вариант. Доступные значения:

      1. spacious\_echo (просторное эхо)
      2. auditorium\_echo (трансляция в зале)
      3. lofi\_telephone (телефонное искажение)
      4. robotic (электронный голос)

      Доступные значения: `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="свойства" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Формат генерируемого аудио. Доступный диапазон \[mp3, pcm, flac], значение по умолчанию — `mp3`

      Доступные значения: `mp3`, `pcm`, `flac`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Битрейт генерируемого аудио. Доступный диапазон \[32000, 64000, 128000, 256000], значение по умолчанию — `128000`. Этот параметр действует только для аудио в формате `mp3`
    </ParamField>

    <ParamField body="channel" type="integer" default={2}>
      Количество каналов генерируемого аудио. Доступный диапазон: \[1, 2], где `1` — моно, `2` — стерео; значение по умолчанию — 1
    </ParamField>

    <ParamField body="audio_sample_rate" type="integer" default={32000}>
      Частота дискретизации генерируемого аудио. Доступный диапазон \[8000, 16000, 22050, 24000, 32000, 44100], значение по умолчанию — `32000`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="свойства" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Громкость синтезируемого аудио: чем больше значение, тем выше громкость. Диапазон значений (0, 10], значение по умолчанию — 1.0

      Диапазон значений: \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Интонация синтезируемого аудио, диапазон значений \[-12, 12], значение по умолчанию — 0, где 0 означает вывод с исходным тембром

      Диапазон значений: \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Скорость речи синтезируемого аудио: чем больше значение, тем выше скорость речи. Диапазон значений \[0.5, 2], значение по умолчанию — 1.0

      Диапазон значений: \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Управляет эмоцией синтезируемой речи. Диапазон параметра \["happy", "sad", "angry", "fearful", "disgusted", "surprised", "calm", "fluent", "whisper"], что соответствует 8 эмоциям: радость, грусть, злость, страх, отвращение, удивление, нейтральность, выразительность, шепот
      <br />• Модель автоматически подбирает подходящую эмоцию на основе входного текста, обычно вручную указывать не требуется\
      <br />• Этот параметр действует только для моделей `speech-2.6-hd`, `speech-2.6-turbo`, `speech-01-hd`, `speech-01-turbo`
      <br />• Опции `fluent`, `whisper` действуют только для моделей `speech-2.6-turbo`, `speech-2.6-hd`

      Доступные значения: `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Идентификатор тембра для синтезируемого аудио. Если требуется настроить смешанный тембр, задайте параметр timber\_weights, а этот параметр оставьте пустым. Поддерживаются три типа тембров: системные тембры, клонированные тембры и тембры, созданные из текста. Ниже приведены некоторые из последних системных тембров (ID); можно посмотреть полный список официально поддерживаемых тембров
      <br />• **Китайский**:<br />• moss\_audio\_ce44fc67-7ce3-11f0-8de5-96e35d26fb85<br />• moss\_audio\_aaa1346a-7ce7-11f0-8e61-2e6e3c7ee85d<br />• Chinese (Mandarin)\_Lyrical\_Voice<br />• Chinese (Mandarin)\_HK\_Flight\_Attendant<br />• **Английский**:<br />• English\_Graceful\_Lady<br />• English\_Insightful\_Speaker<br />• English\_radiant\_girl<br />• English\_Persuasive\_Man<br />• moss\_audio\_6dc281eb-713c-11f0-a447-9613c873494c<br />• moss\_audio\_570551b1-735c-11f0-b236-0adeeecad052<br />• moss\_audio\_ad5baf92-735f-11f0-8263-fe5a2fe98ec8<br />• English\_Lucky\_Robot<br />• **Японский**:<br />• Japanese\_Whisper\_Belle<br />• moss\_audio\_24875c4a-7be4-11f0-9359-4e72c55db738<br />• moss\_audio\_7f4ee608-78ea-11f0-bb73-1e2a4cfcd245<br />• moss\_audio\_c1a6a3ac-7be6-11f0-8e8e-36b92fbb4f95
    </ParamField>

    <ParamField body="english_normalization" type="boolean" default={false}>
      Поддерживается нормализация английского текста. После включения может повысить качество в сценариях чтения чисел, но немного увеличит задержку. По умолчанию false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Управляет добавлением аудиоритмической метки в конец синтезируемого аудио. Значение по умолчанию — False. Этот параметр действует только для непотокового синтеза
</ParamField>

<ParamField body="language_boost" type="string">
  Усиливать ли способность распознавания указанных малых языков и диалектов. Значение по умолчанию — `null`; можно установить `auto`, чтобы модель определяла самостоятельно.

  Доступные значения: `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Включите этот параметр, чтобы переходы между частями предложения звучали более естественно. Поддерживается только моделями `speech-2.8-hd` и `speech-2.8-turbo`
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="свойства" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Определяет правила замены транскрипции или произношения для символов или знаков, требующих специальной разметки. В китайском тексте тоны обозначаются цифрами:
      первый тон — `1`, второй тон — `2`, третий тон — `3`, четвертый тон — `4`, нейтральный тон — `5`
      Пример:
      \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Информация об ответе

<ResponseField name="file_id" type="integer" required={false}>
  ID соответствующего аудиофайла, возвращаемый после успешного создания задачи.<br /><br />• После завершения задачи можно выполнить запрос по file\_id. Если при запросе произошла ошибка, это поле не возвращается

  Примечание: возвращаемый URL для скачивания действителен в течение 9 часов (32400 секунд) с момента генерации. После истечения срока файл станет недоступен, а сгенерированная информация будет потеряна, поэтому следите за временем скачивания
</ResponseField>

<ResponseField name="task_id" type="string" required={false}>
  Используйте task\_id для запроса [API получения результата задачи](/ru/docs/models/reference-get-async-task-result), чтобы получить сгенерированный вывод.
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  <Expandable title="свойства" defaultOpen={true}>
    <ResponseField name="status_msg" type="string" required={true}>
      Подробности статуса
    </ResponseField>

    <ResponseField name="status_code" type="integer" required={true}>
      Код статуса<br /><br />• `0`: нормально<br />• `1002`: ограничение частоты запросов<br />• `1004`: сбой аутентификации<br />• `1039`: сработало ограничение TPM<br />• `1042`: недопустимые символы превышают 10%<br />• `2013`: ошибка параметров
    </ResponseField>
  </Expandable>
</ResponseField>

<ResponseField name="task_token" type="string" required={false}>
  Информация о ключе, использованном для выполнения текущей задачи
</ResponseField>

<ResponseField name="usage_characters" type="integer" required={false}>
  Количество оплачиваемых символов
</ResponseField>
