> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax Speech 2.8 HD синхронный синтез речи

Преобразует текст в речь, поддерживает различные голоса, управление эмоциями, регулировку скорости речи и другие функции. Ограничение длины текста — менее 10000 символов; если длина текста превышает 3000 символов, рекомендуется использовать потоковый вывод.

## Заголовки запроса

<ParamField header="Content-Type" type="string" required={true}>
  Перечисляемое значение: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Формат Bearer-аутентификации: Bearer \{\{API 密钥}}.
</ParamField>

## Тело запроса

<ParamField body="text" type="string" required={true}>
  Текст, который необходимо синтезировать в речь. Ограничение длины — менее 10000 символов; если длина текста превышает 3000 символов, рекомендуется использовать потоковый вывод. Поддерживается переключение абзацев (символы новой строки), управление паузами (метка `&lt;#x#&gt;`), теги междометий/паралингвистических звуков (например, (laughs), (coughs) и т. д.; поддерживаются только speech-2.8-hd/turbo)
</ParamField>

<ParamField body="stream" type="boolean" default={false}>
  Управляет тем, включен ли потоковый вывод. По умолчанию false, то есть потоковый вывод отключен
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Регулировка высоты тона (низкий/яркий), диапазон \[-100, 100]. Чем ближе значение к -100, тем ниже голос; чем ближе к 100, тем голос ярче

      Диапазон значений: \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Регулировка тембра (бархатистый/звонкий), диапазон \[-100, 100]. Чем ближе значение к -100, тем голос более насыщенный; чем ближе к 100, тем голос более звонкий

      Диапазон значений: \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Регулировка интенсивности (сила/мягкость), диапазон \[-100, 100]. Чем ближе значение к -100, тем голос более твердый; чем ближе к 100, тем голос более мягкий

      Диапазон значений: \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Настройка аудиоэффекта; за один раз можно выбрать только один. Доступные значения: spacious\_echo (эхо просторного помещения), auditorium\_echo (трансляция в зале), lofi\_telephone (телефонное искажение), robotic (электронный голос)

      Доступные значения: `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Формат создаваемого аудио; wav поддерживается только при непотоковом выводе

      Доступные значения: `mp3`, `pcm`, `flac`, `wav`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Битрейт создаваемого аудио. Доступный диапазон: \[32000, 64000, 128000, 256000], значение по умолчанию — 128000. Этот параметр действует только для аудио в формате mp3

      Доступные значения: `32000`, `64000`, `128000`, `256000`
    </ParamField>

    <ParamField body="channel" type="integer" default={1}>
      Количество каналов создаваемого аудио. Доступный диапазон: \[1, 2], где 1 — моно, 2 — стерео; значение по умолчанию — 1

      Доступные значения: `1`, `2`
    </ParamField>

    <ParamField body="force_cbr" type="boolean" default={false}>
      Управление постоянным битрейтом аудио (cbr), доступные значения: false, true. Если этот параметр установлен в true, аудио будет кодироваться с постоянным битрейтом. Примечание: этот параметр действует только когда аудио настроено на потоковый вывод и формат аудио — mp3
    </ParamField>

    <ParamField body="sample_rate" type="integer" default={32000}>
      Частота дискретизации создаваемого аудио. Доступный диапазон: \[8000, 16000, 22050, 24000, 32000, 44100], значение по умолчанию — 32000

      Доступные значения: `8000`, `16000`, `22050`, `24000`, `32000`, `44100`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="output_format" type="string" default="hex">
  Параметр, управляющий формой результата вывода. Доступные значения: url, hex; значение по умолчанию — hex. Этот параметр действует только в непотоковом сценарии; в потоковом сценарии поддерживается возврат только в форме hex. Возвращаемый url действителен 24 часа

  Доступные значения: `url`, `hex`
</ParamField>

<ParamField body="voice_setting" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Громкость синтезированного аудио: чем больше значение, тем выше громкость. Диапазон значений: (0, 10], значение по умолчанию — 1.0

      Диапазон значений: \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Интонация синтезированного аудио, диапазон значений \[-12, 12], значение по умолчанию — 0, где 0 означает вывод исходного голоса

      Диапазон значений: \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Скорость синтезированного аудио: чем больше значение, тем быстрее речь. Диапазон значений: \[0.5, 2], значение по умолчанию — 1.0

      Диапазон значений: \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Управляет эмоцией синтезированной речи. Диапазон параметра соответствует 8 эмоциям: радость (happy), грусть (sad), злость (angry), страх (fearful), отвращение (disgusted), удивление (surprised), нейтральность (calm), живость (fluent), шепот (whisper). Модель автоматически подбирает подходящую эмоцию на основе входного текста; обычно вручную указывать не требуется

      Доступные значения: `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Идентификатор голоса для синтезированного аудио. Если требуется настроить смешанный голос, задайте параметр timber\_weights, а этот параметр оставьте пустым. Поддерживаются три типа голосов: системные голоса, клонированные голоса и голоса, созданные из текста
    </ParamField>

    <ParamField body="latex_read" type="boolean" default={false}>
      Управляет тем, нужно ли зачитывать формулы latex; по умолчанию false. Поддерживается только китайский язык; после включения этого параметра параметр language\_boost будет установлен в Chinese
    </ParamField>

    <ParamField body="text_normalization" type="boolean" default={false}>
      Включать ли нормализацию текста на китайском и английском языках. После включения может повысить качество чтения чисел, но немного увеличит задержку; значение по умолчанию — false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Управляет добавлением аудиоритмической метки в конец синтезированного аудио; значение по умолчанию — false. Этот параметр действует только для непотокового синтеза
</ParamField>

<ParamField body="language_boost" type="string">
  Нужно ли усилить распознавание указанных малораспространенных языков и диалектов. Значение по умолчанию — null; можно установить auto, чтобы модель определяла самостоятельно

  Доступные значения: `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="stream_options" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="exclude_aggregated_audio" type="boolean" default={false}>
      Настраивает, содержит ли последний chunk склеенные голосовые данные в формате hex. Значение по умолчанию — false, то есть последний chunk содержит полные склеенные голосовые данные в формате hex
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="timber_weights" type="object[]">
  Настройки смешанного голоса; поддерживается смешивание максимум 4 голосов

  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="weight" type="integer" required={true}>
      Вес каждого голоса в синтезированном аудио; должен заполняться синхронно с voice\_id. Доступный диапазон значений: \[1, 100]; поддерживается смешивание максимум 4 голосов. Чем выше доля отдельного голоса, тем выше сходство синтезированного голоса с этим голосом

      Диапазон значений: \[1, 100]
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Идентификатор голоса для синтезированного аудио; должен заполняться синхронно с параметром weight. Поддерживаются три типа голосов: системные голоса, клонированные голоса и голоса, созданные из текста
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="subtitle_enable" type="boolean" default={false}>
  Управляет включением сервиса субтитров; значение по умолчанию — false. Этот параметр действует только в сценариях непотокового вывода и только для моделей speech-2.6-hd, speech-2.6-turbo, speech-01-turbo, speech-01-hd
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Включите этот параметр, чтобы сделать переходы между подпредложениями более естественными; поддерживается только моделями speech-2.8-hd и speech-2.8-turbo
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Определяет правила замены транскрипции или произношения для текста или символов, требующих специальной разметки. В китайском тексте тоны обозначаются цифрами: первый тон — 1, второй — 2, третий — 3, четвертый — 4, нейтральный тон — 5. Пример: \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Информация об ответе

<ResponseField name="data" type="object" required={false}>
  Возвращаемый объект синтезированных данных; может быть null, требуется проверка на непустое значение
</ResponseField>

<ResponseField name="trace_id" type="string" required={false}>
  id текущей сессии, используется для помощи в локализации проблемы при обращении за консультацией/отправке отзыва
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  Код состояния и сведения текущего запроса
</ResponseField>

<ResponseField name="extra_info" type="object" required={false}>
  Дополнительная информация об аудио
</ResponseField>
