> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax Speech-2.6-turbo синхронный синтез речи

Этот API поддерживает синхронную генерацию речи на основе текста в речь; максимальный объем текста за один запрос — 10000 символов. Поддерживается более 100 системных голосов и самостоятельный выбор клонированных голосов; поддерживается настройка громкости, тона, скорости речи и формата вывода; поддерживаются смешивание голосов по пропорциям и управление фиксированными интервалами; поддерживаются различные аудиоспецификации и форматы, включая: mp3, pcm, flac, wav, а также потоковый вывод.

После отправки запроса на синтез речи для длинного текста обратите внимание, что срок действия возвращаемого url составляет 24 часа с момента возврата url. Пожалуйста, учитывайте время загрузки информации.

<Tip>Подходит для сценариев генерации коротких фраз, голосового чата, онлайн-социального общения и т. п.; имеет низкую задержку, но ограничение длины текста меньше 10000 символов. Для длинных текстов рекомендуется использовать [асинхронный вызов синтеза речи](/ru/docs/models/reference-minimax-speech-2.6-turbo-async).</Tip>

## Заголовки запроса

<ParamField header="Content-Type" type="string" required={true}>
  Перечисляемое значение: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Формат Bearer-аутентификации: Bearer \{\{API 秘钥}}.
</ParamField>

## Тело запроса

<ParamField body="text" type="string" required={true}>
  Текст для синтеза, ограничение длины — меньше 10000 символов; переходы между абзацами заменяются символом новой строки. (Если нужно управлять интервалами в речи, добавьте между символами \<#x#>, где x — секунды, поддерживается диапазон 0.01-99.99, максимум два знака после запятой). Поддерживается настройка пользовательских временных интервалов между фрагментами текста для реализации эффекта пользовательских пауз в озвучивании текста. Обратите внимание, что временной интервал между текстами должен быть задан между двумя фрагментами текста, которые могут быть произнесены, и нельзя задавать несколько последовательных временных интервалов.
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="свойства">
    <ParamField body="speed" type="float" default="1.0">
      Диапазон \[0.5,2], значение по умолчанию — 1.0

      Скорость генерируемого голоса. Необязательный параметр; чем больше значение, тем выше скорость речи.
    </ParamField>

    <ParamField body="vol" type="float" default="1.0">
      Диапазон (0,10], значение по умолчанию — 1.0

      Громкость генерируемого голоса. Необязательный параметр; чем больше значение, тем выше громкость.
    </ParamField>

    <ParamField body="pitch" type="int" default="0">
      Диапазон \[-12,12], значение по умолчанию — 0

      Тон генерируемого голоса. Необязательный параметр; (0 означает вывод исходного тембра, значение должно быть целым числом).
    </ParamField>

    <ParamField body="voice_id" type="string">
      Идентификатор запрашиваемого голоса. Обязателен один из двух параметров: voice\_id или timbre\_weights.

      Поддерживаются два типа голосов: системные голоса (id) и клонированные голоса (id). Системные голоса (ID) перечислены ниже:

      * Юный мужской голос: `male-qn-qingse`
      * Элитный молодой мужской голос: `male-qn-jingying`
      * Властный молодой мужской голос: `male-qn-badao`
      * Голос студента: `male-qn-daxuesheng`
      * Девичий голос: `female-shaonv`
      * Голос уверенной взрослой женщины: `female-yujie`
      * Зрелый женский голос: `female-chengshu`
      * Сладкий женский голос: `female-tianmei`
      * Мужчина-ведущий: `presenter_male`
      * Женщина-ведущая: `presenter_female`
      * Мужской голос для аудиокниг 1: `audiobook_male_1`
      * Мужской голос для аудиокниг 2: `audiobook_male_2`
      * Женский голос для аудиокниг 1: `audiobook_female_1`
      * Женский голос для аудиокниг 2: `audiobook_female_2`
      * Юный мужской голос-beta: `male-qn-qingse-jingpin`
      * Элитный молодой мужской голос-beta: `male-qn-jingying-jingpin`
      * Властный молодой мужской голос-beta: `male-qn-badao-jingpin`
      * Голос студента-beta: `male-qn-daxuesheng-jingpin`
      * Девичий голос-beta: `female-shaonv-jingpin`
      * Голос уверенной взрослой женщины-beta: `female-yujie-jingpin`
      * Зрелый женский голос-beta: `female-chengshu-jingpin`
      * Сладкий женский голос-beta: `female-tianmei-jingpin`
      * Умный мальчик: `clever_boy`
      * Милый мальчик: `cute_boy`
      * Очаровательная девочка: `lovely_girl`
      * Мультяшная свинка Сяоци: `cartoon_pig`
      * Одержимый младший брат: `bingjiao_didi`
      * Красивый парень: `junlang_nanyou`
      * Невинный младшекурсник: `chunzhen_xuedi`
      * Холодный старшекурсник: `lengdan_xiongzhang`
      * Властный молодой господин: `badao_shaoye`
      * Милая Сяолин: `tianxin_xiaoling`
      * Озорная милая девушка: `qiaopi_mengmei`
      * Обольстительная уверенная женщина: `wumei_yujie`
      * Сюсюкающая младшекурсница: `diadia_xuemei`
      * Изысканная старшекурсница: `danya_xuejie`
      * Santa Claus: `Santa_Claus`
      * Grinch: `Grinch`
      * Rudolph: `Rudolph`
      * Arnold: `Arnold`
      * Charming Santa: `Charming_Santa`
      * Charming Lady: `Charming_Lady`
      * Sweet Girl: `Sweet_Girl`
      * Cute Elf: `Cute_Elf`
      * Attractive Girl: `Attractive_Girl`
      * Serene Woman: `Serene_Woman`
    </ParamField>

    <ParamField body="emotion" type="string">
      Управляет эмоцией синтезируемой речи;

      В настоящее время поддерживаются 7 эмоций: радость, грусть, гнев, страх, отвращение, удивление, нейтральная;

      Диапазон параметра: `["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]`
    </ParamField>

    <ParamField body="latex_read" type="bool" default="false">
      Управляет поддержкой чтения формул latex, по умолчанию false.

      Важно:

      1. Формулы в запросе должны быть обрамлены \$\$ в начале и в конце;
      2. Если в формуле в запросе есть "", его нужно экранировать как "\\".

      Пример: базовая формула производной — `$$\\frac{d}{dx}(x^n) = nx^{n-1}$$`
    </ParamField>

    <ParamField body="text_normalization" type="bool" default="false">
      Этот параметр поддерживает нормализацию английского текста и может повысить производительность в сценариях чтения чисел, но немного увеличивает задержку. Если не указан, значение по умолчанию — false.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="свойства">
    <ParamField body="sample_rate" type="int" default="32000">
      Диапазон 【8000，16000，22050，24000，32000，44100】

      Частота дискретизации генерируемого звука. Необязательный параметр, по умолчанию 32000.
    </ParamField>

    <ParamField body="bitrate" type="int" default="128000">
      Диапазон 【32000，64000，128000，256000】

      Битрейт генерируемого звука. Необязательный параметр, значение по умолчанию — 128000. Этот параметр действует только для аудио в формате mp3.
    </ParamField>

    <ParamField body="format" type="string" default="mp3">
      Формат генерируемого аудио. По умолчанию mp3, диапазон \[mp3,pcm,flac,wav]. wav поддерживается только при непотоковом выводе.
    </ParamField>

    <ParamField body="channel" type="int" default="1">
      Количество каналов генерируемого аудио. По умолчанию 1: моно, доступные варианты:

      1: моно

      2: стерео
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="свойства">
    <ParamField body="tone" type="list">
      Замена текста, символов и соответствующей фонетической записи, требующих специальной разметки.

      Замена произношения (настройка тона/замена произношения другими символами), формат:

      `["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]`

      Тоны заменяются цифрами: первый тон (иньпин) — 1, второй тон (янпин) — 2, третий тон (восходящий) — 3, четвертый тон (падающий) — 4, нейтральный тон — 5.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="timbre_weights" type="object[]">
  Обязателен один из двух параметров: voice\_id или timbre\_weights

  <Expandable title="свойства">
    <ParamField body="voice_id" type="string">
      id запрашиваемого голоса. Должен указываться синхронно с параметром weight.
    </ParamField>

    <ParamField body="weight" type="int">
      Диапазон \[1,100]

      Вес. Должен указываться синхронно с voice\_id. Поддерживается смешивание до 4 голосов; значение должно быть целым числом. Чем выше доля отдельного голоса, тем больше синтезированный голос будет на него похож.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="stream" type="boolean" default="false">
  Использовать ли потоковый режим. По умолчанию false, то есть потоковый режим не включен.
</ParamField>

<ParamField body="stream_options" type="object">
  <Expandable title="свойства">
    <ParamField body="exclude_aggregated_audio" type="boolean" default="false">
      Когда этот параметр установлен в True, последний chunk в потоковом режиме не будет содержать hex-данные полной склеенной речи. По умолчанию False, то есть последний chunk содержит hex-данные полной склеенной речи.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="language_boost" type="string" default="null">
  Усиливает способность распознавания указанных малораспространенных языков и диалектов; после настройки может улучшить качество речи в сценариях указанного малораспространенного языка/диалекта. Если тип малораспространенного языка неясен, можно выбрать "auto", и модель самостоятельно определит тип малораспространенного языка. Поддерживаются следующие значения:

  `'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'`
</ParamField>

<ParamField body="output_format" type="string" default="hex">
  Параметр, управляющий формой результата вывода. Возможные значения: `url` `hex`. Значение по умолчанию — `hex`. Этот параметр действует только в непотоковом сценарии; в потоковом сценарии поддерживается возврат только в форме hex. Срок действия возвращаемого url — 24 часа.
</ParamField>

<ParamField body="voice_modify" type="object">
  Настройки голосового эффектора. Этот параметр поддерживает следующие аудиоформаты:

  * Непотоковый режим: mp3, wav, flac
  * Потоковый режим: mp3

  <Expandable title="свойства">
    <ParamField body="pitch" type="integer">
      Регулировка высоты тона (низкий/яркий), диапазон \[-100,100]; чем ближе значение к -100, тем ниже голос; чем ближе к 100, тем ярче голос
    </ParamField>

    <ParamField body="intensity" type="integer">
      Регулировка интенсивности (сила/мягкость), диапазон \[-100,100]; чем ближе значение к -100, тем более жестким становится голос; чем ближе к 100, тем более мягким становится голос
    </ParamField>

    <ParamField body="timbre" type="integer">
      Регулировка тембра (магнитный/звонкий), диапазон \[-100,100]; чем ближе значение к -100, тем более насыщенным становится голос; чем ближе значение к 100, тем более звонким становится голос
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Настройка звукового эффекта; за один раз можно выбрать только один вариант. Возможные значения:

      * `spacious_echo`（просторное эхо）
      * `auditorium_echo`（трансляция в зале）
      * `lofi_telephone`（телефонное искажение）
      * `robotic`（электронный голос）
    </ParamField>
  </Expandable>
</ParamField>

## Информация ответа

<ResponseField name="audio" type="string">
  Синтезированный аудиофрагмент, закодированный в hex, генерируется в соответствии с форматом, определенным во входных данных (`audio_setting.format`) (mp3/pcm/flac). Форма возврата определяется `output_format`; когда `stream` равен true, поддерживается только возврат в форме hex.
</ResponseField>

<ResponseField name="status" type="number">
  Текущий статус аудиопотока, возвращается только когда `stream` равен true. 1 означает, что синтез выполняется, 2 означает завершение синтеза.
</ResponseField>
