> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Синтез речи Fish Audio

<Note>
  Для достижения наилучших результатов перед использованием этого API рекомендуется сначала загрузить эталонное аудио с помощью [клонирования аудио](/ru/docs/models/reference-fish-audio-voice-cloning). Это повысит качество речи и снизит задержку.
</Note>

Fish Audio преобразует текст в речь.

Поддерживаемые аудиоформаты:

* WAV / PCM
  * Частота дискретизации: 8kHz, 16kHz, 24kHz, 32kHz, 44.1kHz
  * Частота дискретизации по умолчанию: 44.1kHz
  * 16-bit, моно

* MP3
  * Частота дискретизации: 32kHz, 44.1kHz
  * Частота дискретизации по умолчанию: 44.1kHz
  * Моно
  * Битрейт: 64kbps, 128kbps (по умолчанию), 192kbps

* Opus
  * Частота дискретизации: 48kHz
  * Частота дискретизации по умолчанию: 48kHz
  * Моно
  * Битрейт: -1000 (авто), 24kbps, 32kbps (по умолчанию), 48kbps, 64kbps

## Заголовки запроса

<ParamField header="Content-Type" type="string" required={true}>
  Значение перечисления: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Формат аутентификации Bearer: Bearer \{\{API 密钥}}.
</ParamField>

## Тело запроса

<ParamField body="text" type="string" required={true}>
  Текст, который нужно преобразовать в речь.
</ParamField>

<ParamField body="temperature" type="number" default={0.9}>
  Управляет случайностью генерации речи. Более высокие значения (например, 1.0) делают вывод более случайным, более низкие значения (например, 0.1) делают его более детерминированным. Для модели `s1` мы рекомендуем использовать `0.9`.

  Обязательный диапазон: `0 <= x <= 1`
</ParamField>

<ParamField body="top_p" type="number" default={0.9}>
  Управляет разнообразием с помощью nucleus sampling. Более низкие значения (например, 0.1) делают вывод более сфокусированным, более высокие значения (например, 1.0) допускают большее разнообразие. Для модели `s1` мы рекомендуем использовать `0.9`.

  Обязательный диапазон: `0 <= x <= 1`
</ParamField>

<ParamField body="references" type="ReferenceAudio · object[] | null">
  Эталонное аудио для речи; требуется сериализация MessagePack. Это переопределит reference\_voices и reference\_texts.

  <Expandable title="properties">
    <ParamField body="audio" type="file" required={true}>
      Эталонный аудиофайл.
    </ParamField>

    <ParamField body="text" type="string" required={true}>
      Эталонный текст, соответствующий аудио.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="reference_id" type="string | null">
  ID эталонной модели для речи.
</ParamField>

<ParamField body="prosody" type="ProsodyControl · object">
  Управление просодией для речи.

  <Expandable title="properties">
    <ParamField body="speed" type="number" default={1}>
      Управление скоростью речи.
    </ParamField>

    <ParamField body="volume" type="number" default={0}>
      Управление громкостью речи.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="chunk_length" type="integer" default={200}>
  Длина фрагмента для речи.

  Обязательный диапазон: `100 <= x <= 300`
</ParamField>

<ParamField body="normalize" type="boolean" default={true}>
  Нормализовать ли речь. Это снизит задержку, но может ухудшить обработку чисел и дат.
</ParamField>

<ParamField body="format" type="enum<string>" default="mp3">
  Формат для речи.

  Допустимые значения: `wav`, `pcm`, `mp3`, `opus`
</ParamField>

<ParamField body="sample_rate" type="integer | null">
  Частота дискретизации для речи.
</ParamField>

<ParamField body="mp3_bitrate" type="enum<integer>" default={128}>
  Битрейт MP3 для речи.

  Допустимые значения: `64`, `128`, `192`
</ParamField>

<ParamField body="opus_bitrate" type="enum<integer>" default={32}>
  Битрейт Opus для речи.

  Допустимые значения: `-1000`, `24`, `32`, `48`, `64`
</ParamField>

<ParamField body="latency" type="enum<string>" default="normal">
  Настройка задержки для речи; balanced снизит задержку, но может привести к снижению производительности.

  Допустимые значения: `normal`, `balanced`
</ParamField>

## Информация об ответе

API напрямую вернет аудиопоток в формате, указанном параметром `format` (по умолчанию: mp3).
