Skip to main content
POST
Fish Audio S2 Pro Texto para fala
O modelo de texto para fala Fish Audio S2 Pro converte texto em fala natural, com suporte a controle de amostragem, segmentação, formatos de áudio e controle de prosódia.

Cabeçalhos da solicitação

string
obrigatório
Valores enumerados: application/json
string
obrigatório
Formato de autenticação Bearer: Bearer {{chave de API}}.

Corpo da solicitação

string
obrigatório
O texto que precisa ser convertido em fala. Para texto com múltiplos locutores no S2-Pro, é possível usar tags como <|speaker:0|>Olá<|speaker:1|>Oi.
number
Controle de diversidade da amostragem por núcleo.Intervalo de valores: [0, 1]
string
padrão:"mp3"
Formato de áudio de saída.Valores opcionais: wav, pcm, mp3, opus
string
padrão:"normal"
Nível de latência.Valores opcionais: low, normal, balanced
object
Controle de prosódia.
boolean
padrão:true
Normaliza textos em chinês e inglês.
integer
padrão:128
Taxa de bits de MP3, em kbps.Valores opcionais: 64, 128, 192
integer
Taxa de amostragem de saída em Hz. Se estiver vazia, usa o valor padrão do formato; para opus é 48000 Hz, e para outros geralmente é 44100 Hz.
number
Controle de expressividade.Intervalo de valores: [0, 1]
integer
padrão:300
Tamanho dos segmentos de texto.Intervalo de valores: [100, 300]
integer
Taxa de bits de Opus, em bps; -1000 indica automático.Valores opcionais: -1000, 24000, 32000, 48000, 64000
string
ID do modelo de timbre; em cenários com múltiplos locutores, é possível passar um array correspondente aos índices de speaker.
integer
padrão:1024
Número máximo de tokens de áudio por segmento.
integer
padrão:50
Número mínimo de caracteres antes da segmentação.Intervalo de valores: [0, 100]
number
Coeficiente de penalidade para reduzir repetições no padrão de áudio.
number
padrão:1
Limiar de parada antecipada.Intervalo de valores: [0, 1]
boolean
padrão:true
Usa os segmentos de áudio anteriores como contexto.

Informações da resposta

Áudio gerado. Formato: binary