Skip to main content
POST
Texto a voz de Fish Audio S2 Pro
El modelo de texto a voz Fish Audio S2 Pro convierte texto en voz natural y admite timbres de referencia, control de muestreo, segmentación, formatos de audio y control de prosodia.

Encabezados de solicitud

string
requerido
Valores enumerados: application/json
string
requerido
Formato de autenticación Bearer: Bearer {{API Key}}.

Cuerpo de la solicitud

string
requerido
Texto que debe convertirse en voz. El texto multihablante de S2-Pro puede usar las etiquetas <|speaker:0|>Hola<|speaker:1|>Hola.
number
Control de diversidad de muestreo por núcleo.Rango de valores: [0, 1]
string
predeterminado:"mp3"
Formato de audio de salida.Valores opcionales: wav, pcm, mp3, opus
string
predeterminado:"normal"
Nivel de latencia.Valores opcionales: low, normal, balanced
object
Control de prosodia.
boolean
predeterminado:true
Normaliza texto en chino e inglés.
object[]
Muestras de audio de referencia para clonación de voz zero-shot.
integer
predeterminado:128
Tasa de bits de MP3, en kbps.Valores opcionales: 64, 128, 192
integer
Frecuencia de muestreo de salida en Hz. Si está vacío, se usa el valor predeterminado del formato; opus es 48000 Hz y los demás suelen ser 44100 Hz.
number
Control de expresividad.Rango de valores: [0, 1]
integer
predeterminado:300
Tamaño de segmentación del texto.Rango de valores: [100, 300]
integer
Tasa de bits de Opus, en bps; -1000 indica automático.Valores opcionales: -1000, 24000, 32000, 48000, 64000
string
ID del modelo de timbre; en escenarios multihablante se puede pasar un arreglo que coincida con los índices de speaker.
integer
predeterminado:1024
Número máximo de tokens de audio por cada segmento.
integer
predeterminado:50
Número mínimo de caracteres antes de segmentar.Rango de valores: [0, 100]
number
Coeficiente de penalización para reducir la repetición de patrones de audio.
number
predeterminado:1
Umbral de detención anticipada.Rango de valores: [0, 1]
boolean
predeterminado:true
Usa segmentos de audio anteriores como contexto.

Información de respuesta

Audio generado. Formato: binary