> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax Speech 2.8 Turbo: синхронный синтез речи

Преобразует текст в речь и поддерживает различные голоса, управление эмоциями, настройку скорости речи и другие функции. Ограничение длины текста — менее 10000 символов. Если длина текста превышает 3000 символов, рекомендуется использовать потоковый вывод.

## Заголовки запроса

<ParamField header="Content-Type" type="string" required={true}>
  Перечисляемое значение: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Формат Bearer-аутентификации: Bearer \{\{API 密钥}}.
</ParamField>

## Тело запроса

<ParamField body="text" type="string" required={true}>
  Текст, который необходимо синтезировать в речь. Ограничение длины — менее 10000 символов. Если длина текста превышает 3000 символов, рекомендуется использовать потоковый вывод. Поддерживает переключение абзацев (символы новой строки), управление паузами (метки `&lt;#x#&gt;`), теги междометий/звуковых реакций (например, (laughs), (coughs) и т. д.; поддерживается только speech-2.8-hd/turbo)
</ParamField>

<ParamField body="stream" type="boolean" default={false}>
  Управляет тем, будет ли вывод потоковым. По умолчанию false, то есть потоковый вывод не включен
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Настройка высоты звучания (низкий/яркий), диапазон \[-100, 100]. Чем ближе значение к -100, тем ниже голос; чем ближе к 100, тем ярче голос

      Диапазон значений: \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Настройка тембра (насыщенный/звонкий), диапазон \[-100, 100]. Чем ближе значение к -100, тем более густой и насыщенный голос; чем ближе значение к 100, тем более звонкий голос

      Диапазон значений: \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Настройка интенсивности (сила/мягкость), диапазон \[-100, 100]. Чем ближе значение к -100, тем более твердый и энергичный голос; чем ближе к 100, тем более мягкий голос

      Диапазон значений: \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Настройка звукового эффекта; за один раз можно выбрать только один. Возможные значения: spacious\_echo (просторное эхо), auditorium\_echo (эхо актового зала/трансляции), lofi\_telephone (телефонное искажение), robotic (электронный голос)

      Возможные значения: `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Формат генерируемого аудио; wav поддерживается только при непотоковом выводе

      Возможные значения: `mp3`, `pcm`, `flac`, `wav`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Битрейт генерируемого аудио. Возможный диапазон: \[32000, 64000, 128000, 256000], значение по умолчанию — 128000. Этот параметр действует только для аудио в формате mp3

      Возможные значения: `32000`, `64000`, `128000`, `256000`
    </ParamField>

    <ParamField body="channel" type="integer" default={1}>
      Количество каналов генерируемого аудио. Возможный диапазон: \[1, 2], где 1 — моно, 2 — стерео; значение по умолчанию — 1

      Возможные значения: `1`, `2`
    </ParamField>

    <ParamField body="force_cbr" type="boolean" default={false}>
      Управление постоянным битрейтом аудио (cbr); возможные значения: false, true. Если этот параметр установлен в true, аудио будет кодироваться с постоянным битрейтом. Внимание: параметр действует только если аудио настроено на потоковый вывод и формат аудио — mp3
    </ParamField>

    <ParamField body="sample_rate" type="integer" default={32000}>
      Частота дискретизации генерируемого аудио. Возможный диапазон: \[8000, 16000, 22050, 24000, 32000, 44100], значение по умолчанию — 32000

      Возможные значения: `8000`, `16000`, `22050`, `24000`, `32000`, `44100`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="output_format" type="string" default="hex">
  Параметр, управляющий формой результата вывода. Возможные значения: url, hex; значение по умолчанию — hex. Этот параметр действует только в непотоковом сценарии; в потоковом сценарии поддерживается возврат только в форме hex. Возвращаемый url действителен 24 часа

  Возможные значения: `url`, `hex`
</ParamField>

<ParamField body="voice_setting" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Громкость синтезированного аудио: чем больше значение, тем выше громкость. Диапазон значений: (0, 10], значение по умолчанию — 1.0

      Диапазон значений: \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Интонационная высота синтезированного аудио. Диапазон значений: \[-12, 12], значение по умолчанию — 0, где 0 означает вывод исходного тембра

      Диапазон значений: \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Скорость речи синтезированного аудио: чем больше значение, тем быстрее речь. Диапазон значений: \[0.5, 2], значение по умолчанию — 1.0

      Диапазон значений: \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Управляет эмоцией синтезированной речи. Диапазон параметра соответствует 8 эмоциям: радость (happy), грусть (sad), злость (angry), страх (fearful), отвращение (disgusted), удивление (surprised), нейтральность (calm), живость (fluent), шепот (whisper). Модель автоматически подбирает подходящую эмоцию на основе входного текста, поэтому обычно указывать ее вручную не требуется

      Возможные значения: `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Идентификатор голоса для синтезированного аудио. Если нужно настроить смешанный голос, задайте параметр timber\_weights, а этот параметр оставьте пустым. Поддерживаются три типа: системные голоса, клонированные голоса и голоса, сгенерированные из текста
    </ParamField>

    <ParamField body="latex_read" type="boolean" default={false}>
      Управляет тем, нужно ли озвучивать формулы latex; по умолчанию false. Поддерживается только китайский язык. После включения этого параметра параметр language\_boost будет установлен в Chinese
    </ParamField>

    <ParamField body="text_normalization" type="boolean" default={false}>
      Включать ли нормализацию текста для китайского и английского языков. После включения может улучшить качество в сценариях чтения чисел, но немного увеличит задержку. Значение по умолчанию — false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Управляет добавлением ритмического аудиоидентификатора в конец синтезированного аудио. Значение по умолчанию — false. Этот параметр действует только для непотокового синтеза
</ParamField>

<ParamField body="language_boost" type="string">
  Усиливать ли способность распознавания указанных малораспространенных языков и диалектов. Значение по умолчанию — null; можно установить auto, чтобы модель определяла это самостоятельно

  Возможные значения: `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="stream_options" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="exclude_aggregated_audio" type="boolean" default={false}>
      Задает, содержит ли последний chunk объединенные аудиоданные в формате hex. Значение по умолчанию — false, то есть последний chunk содержит полные объединенные аудиоданные в формате hex
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="timber_weights" type="object[]">
  Настройки смешанного голоса; поддерживается смешивание максимум 4 голосов

  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="weight" type="integer" required={true}>
      Вес каждого голоса в синтезированном аудио; должен заполняться вместе с voice\_id. Диапазон возможных значений: \[1, 100]. Поддерживается смешивание максимум 4 голосов. Чем выше доля одного голоса, тем сильнее синтезированный голос похож на него

      Диапазон значений: \[1, 100]
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Идентификатор голоса для синтезированного аудио; должен заполняться вместе с параметром weight. Поддерживаются три типа: системные голоса, клонированные голоса и голоса, сгенерированные из текста
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="subtitle_enable" type="boolean" default={false}>
  Управляет включением службы субтитров. Значение по умолчанию — false. Этот параметр действует только в сценарии непотокового вывода и только для моделей speech-2.6-hd, speech-2.6-turbo, speech-01-turbo, speech-01-hd
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Включите этот параметр, чтобы стыки между фразами звучали более естественно. Поддерживаются только модели speech-2.8-hd и speech-2.8-turbo
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Определяет правила замены чтения или произношения для текста или символов, которые требуют специальной разметки. В китайском тексте тоны обозначаются цифрами: первый тон — 1, второй — 2, третий — 3, четвертый — 4, нейтральный тон — 5. Пример: \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Информация ответа

<ResponseField name="data" type="object" required={false}>
  Возвращаемый объект синтезированных данных; может быть null, поэтому требуется проверка на непустое значение
</ResponseField>

<ResponseField name="trace_id" type="string" required={false}>
  id текущей сессии, используемый для помощи в локализации проблемы при обращении за консультацией или отправке отзыва
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  Код состояния и сведения о текущем запросе
</ResponseField>

<ResponseField name="extra_info" type="object" required={false}>
  Дополнительная информация об аудио
</ResponseField>
