> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Fish Audio S2 Pro — преобразование текста в речь

Модель преобразования текста в речь Fish Audio S2 Pro преобразует текст в естественную речь и поддерживает референсные тембры, управление сэмплированием, сегментацию, аудиоформаты и управление просодией.

## Заголовки запроса

<ParamField header="Content-Type" type="string" required={true}>
  Перечисляемое значение: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Формат аутентификации Bearer: Bearer \{\{API 密钥}}.
</ParamField>

## Тело запроса

<ParamField body="text" type="string" required={true}>
  Текст, который нужно преобразовать в речь. Для многоактерного текста S2-Pro можно использовать теги \<|speaker:0|>Привет\<|speaker:1|>Привет.
</ParamField>

<ParamField body="top_p" type="number" default={0.7}>
  Управление разнообразием nucleus sampling.

  Диапазон значений: \[0, 1]
</ParamField>

<ParamField body="format" type="string" default="mp3">
  Формат выходного аудио.

  Возможные значения: `wav`, `pcm`, `mp3`, `opus`
</ParamField>

<ParamField body="latency" type="string" default="normal">
  Уровень задержки.

  Возможные значения: `low`, `normal`, `balanced`
</ParamField>

<ParamField body="prosody" type="object">
  Управление просодией.

  <Expandable title="свойства" defaultOpen={true}>
    <ParamField body="speed" type="number" default={1}>
      Коэффициент скорости речи.
    </ParamField>

    <ParamField body="volume" type="number" default={0}>
      Настройка громкости.
    </ParamField>

    <ParamField body="normalize_loudness" type="boolean" default={true}>
      Нормализовать ли громкость на выходе.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="normalize" type="boolean" default={true}>
  Нормализует текст на китайском и английском языках.
</ParamField>

<ParamField body="references" type="object[]">
  Референсные аудиосэмплы для zero-shot клонирования голоса.

  <Expandable title="свойства" defaultOpen={true}>
    <ParamField body="text" type="string">
      Текст, соответствующий референсному аудио.
    </ParamField>

    <ParamField body="audio" type="string">
      Референсное аудио; передавайте base64 или URL в соответствии с поддержкой поставщика.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="mp3_bitrate" type="integer" default={128}>
  Битрейт MP3, в kbps.

  Возможные значения: `64`, `128`, `192`
</ParamField>

<ParamField body="sample_rate" type="integer" nullable={true}>
  Частота дискретизации выходного аудио в Hz. Если значение пустое, используется значение по умолчанию для формата: для opus — 48000 Hz, для остальных обычно 44100 Hz.
</ParamField>

<ParamField body="temperature" type="number" default={0.7}>
  Управление выразительностью.

  Диапазон значений: \[0, 1]
</ParamField>

<ParamField body="chunk_length" type="integer" default={300}>
  Размер сегмента текста.

  Диапазон значений: \[100, 300]
</ParamField>

<ParamField body="opus_bitrate" type="integer" default={-1000}>
  Битрейт Opus, в bps; -1000 означает автоматический выбор.

  Возможные значения: `-1000`, `24000`, `32000`, `48000`, `64000`
</ParamField>

<ParamField body="reference_id" type="string">
  ID модели тембра; для сценариев с несколькими говорящими можно передать массив, соответствующий индексам speaker.
</ParamField>

<ParamField body="max_new_tokens" type="integer" default={1024}>
  Максимальное количество аудио-токенов для каждого сегмента.
</ParamField>

<ParamField body="min_chunk_length" type="integer" default={50}>
  Минимальное количество символов перед сегментацией.

  Диапазон значений: \[0, 100]
</ParamField>

<ParamField body="repetition_penalty" type="number" default={1.2}>
  Штрафной коэффициент для уменьшения повторов аудиопаттернов.
</ParamField>

<ParamField body="early_stop_threshold" type="number" default={1}>
  Порог досрочной остановки.

  Диапазон значений: \[0, 1]
</ParamField>

<ParamField body="condition_on_previous_chunks" type="boolean" default={true}>
  Использовать предыдущие аудиосегменты как контекст.
</ParamField>

## Информация об ответе

Сгенерированное аудио.

Формат: `binary`
