> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Texto a voz de Fish Audio S2 Pro

El modelo de texto a voz Fish Audio S2 Pro convierte texto en voz natural y admite timbres de referencia, control de muestreo, segmentación, formatos de audio y control de prosodia.

## Encabezados de solicitud

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticación Bearer: Bearer \{\{API Key}}.
</ParamField>

## Cuerpo de la solicitud

<ParamField body="text" type="string" required={true}>
  Texto que debe convertirse en voz. El texto multihablante de S2-Pro puede usar las etiquetas \<|speaker:0|>Hola\<|speaker:1|>Hola.
</ParamField>

<ParamField body="top_p" type="number" default={0.7}>
  Control de diversidad de muestreo por núcleo.

  Rango de valores: \[0, 1]
</ParamField>

<ParamField body="format" type="string" default="mp3">
  Formato de audio de salida.

  Valores opcionales: `wav`, `pcm`, `mp3`, `opus`
</ParamField>

<ParamField body="latency" type="string" default="normal">
  Nivel de latencia.

  Valores opcionales: `low`, `normal`, `balanced`
</ParamField>

<ParamField body="prosody" type="object">
  Control de prosodia.

  <Expandable title="propiedades" defaultOpen={true}>
    <ParamField body="speed" type="number" default={1}>
      Multiplicador de velocidad del habla.
    </ParamField>

    <ParamField body="volume" type="number" default={0}>
      Ajuste de volumen.
    </ParamField>

    <ParamField body="normalize_loudness" type="boolean" default={true}>
      Si se debe normalizar la sonoridad de salida.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="normalize" type="boolean" default={true}>
  Normaliza texto en chino e inglés.
</ParamField>

<ParamField body="references" type="object[]">
  Muestras de audio de referencia para clonación de voz zero-shot.

  <Expandable title="propiedades" defaultOpen={true}>
    <ParamField body="text" type="string">
      Texto correspondiente al audio de referencia.
    </ParamField>

    <ParamField body="audio" type="string">
      Audio de referencia, pasado como base64 o URL según lo admita el proveedor.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="mp3_bitrate" type="integer" default={128}>
  Tasa de bits de MP3, en kbps.

  Valores opcionales: `64`, `128`, `192`
</ParamField>

<ParamField body="sample_rate" type="integer" nullable={true}>
  Frecuencia de muestreo de salida en Hz. Si está vacío, se usa el valor predeterminado del formato; opus es 48000 Hz y los demás suelen ser 44100 Hz.
</ParamField>

<ParamField body="temperature" type="number" default={0.7}>
  Control de expresividad.

  Rango de valores: \[0, 1]
</ParamField>

<ParamField body="chunk_length" type="integer" default={300}>
  Tamaño de segmentación del texto.

  Rango de valores: \[100, 300]
</ParamField>

<ParamField body="opus_bitrate" type="integer" default={-1000}>
  Tasa de bits de Opus, en bps; -1000 indica automático.

  Valores opcionales: `-1000`, `24000`, `32000`, `48000`, `64000`
</ParamField>

<ParamField body="reference_id" type="string">
  ID del modelo de timbre; en escenarios multihablante se puede pasar un arreglo que coincida con los índices de speaker.
</ParamField>

<ParamField body="max_new_tokens" type="integer" default={1024}>
  Número máximo de tokens de audio por cada segmento.
</ParamField>

<ParamField body="min_chunk_length" type="integer" default={50}>
  Número mínimo de caracteres antes de segmentar.

  Rango de valores: \[0, 100]
</ParamField>

<ParamField body="repetition_penalty" type="number" default={1.2}>
  Coeficiente de penalización para reducir la repetición de patrones de audio.
</ParamField>

<ParamField body="early_stop_threshold" type="number" default={1}>
  Umbral de detención anticipada.

  Rango de valores: \[0, 1]
</ParamField>

<ParamField body="condition_on_previous_chunks" type="boolean" default={true}>
  Usa segmentos de audio anteriores como contexto.
</ParamField>

## Información de respuesta

Audio generado.

Formato: `binary`
