Skip to main content
POST
Fish Audio S2 Pro — преобразование текста в речь
Модель преобразования текста в речь Fish Audio S2 Pro преобразует текст в естественную речь и поддерживает управление сэмплированием, сегментацию, аудиоформаты и управление просодией.

Заголовки запроса

string
обязательно
Перечисляемое значение: application/json
string
обязательно
Формат аутентификации Bearer: Bearer {{API 密钥}}.

Тело запроса

string
обязательно
Текст, который нужно преобразовать в речь. Для многоактерного текста S2-Pro можно использовать теги <|speaker:0|>Привет<|speaker:1|>Привет.
number
Управление разнообразием nucleus sampling.Диапазон значений: [0, 1]
string
по умолчанию:"mp3"
Формат выходного аудио.Возможные значения: wav, pcm, mp3, opus
string
по умолчанию:"normal"
Уровень задержки.Возможные значения: low, normal, balanced
object
Управление просодией.
boolean
по умолчанию:true
Нормализует текст на китайском и английском языках.
integer
по умолчанию:128
Битрейт MP3, в kbps.Возможные значения: 64, 128, 192
integer
Частота дискретизации выходного аудио в Hz. Если значение пустое, используется значение по умолчанию для формата: для opus — 48000 Hz, для остальных обычно 44100 Hz.
number
Управление выразительностью.Диапазон значений: [0, 1]
integer
по умолчанию:300
Размер сегмента текста.Диапазон значений: [100, 300]
integer
Битрейт Opus, в bps; -1000 означает автоматический выбор.Возможные значения: -1000, 24000, 32000, 48000, 64000
string
ID модели тембра; для сценариев с несколькими говорящими можно передать массив, соответствующий индексам speaker.
integer
по умолчанию:1024
Максимальное количество аудио-токенов для каждого сегмента.
integer
по умолчанию:50
Минимальное количество символов перед сегментацией.Диапазон значений: [0, 100]
number
Штрафной коэффициент для уменьшения повторов аудиопаттернов.
number
по умолчанию:1
Порог досрочной остановки.Диапазон значений: [0, 1]
boolean
по умолчанию:true
Использовать предыдущие аудиосегменты как контекст.

Информация об ответе

Сгенерированное аудио. Формат: binary