> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Síntesis de voz de Fish Audio

<Note>
  Para obtener los mejores resultados, se recomienda usar [clonación de voz](/es/docs/models/reference-fish-audio-voice-cloning) para subir audio de referencia antes de utilizar esta API. Esto mejorará la calidad de la voz y reducirá la latencia.
</Note>

Fish Audio convierte texto en voz.

Formatos de audio compatibles:

* WAV / PCM
  * Frecuencia de muestreo: 8kHz, 16kHz, 24kHz, 32kHz, 44.1kHz
  * Frecuencia de muestreo predeterminada: 44.1kHz
  * 16-bit, mono

* MP3
  * Frecuencia de muestreo: 32kHz, 44.1kHz
  * Frecuencia de muestreo predeterminada: 44.1kHz
  * Mono
  * Tasa de bits: 64kbps, 128kbps (predeterminada), 192kbps

* Opus
  * Frecuencia de muestreo: 48kHz
  * Frecuencia de muestreo predeterminada: 48kHz
  * Mono
  * Tasa de bits: -1000 (automática), 24kbps, 32kbps (predeterminada), 48kbps, 64kbps

## Encabezados de solicitud

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticación Bearer: Bearer \{\{API Key}}.
</ParamField>

## Cuerpo de la solicitud

<ParamField body="text" type="string" required={true}>
  Texto que se convertirá en voz.
</ParamField>

<ParamField body="temperature" type="number" default={0.9}>
  Controla la aleatoriedad de la generación de voz. Los valores más altos (por ejemplo, 1.0) hacen que la salida sea más aleatoria, mientras que los valores más bajos (por ejemplo, 0.1) la hacen más determinista. Recomendamos usar `0.9` para el modelo `s1`.

  Rango requerido: `0 <= x <= 1`
</ParamField>

<ParamField body="top_p" type="number" default={0.9}>
  Controla la diversidad mediante muestreo de núcleo. Los valores más bajos (por ejemplo, 0.1) hacen que la salida esté más enfocada, mientras que los valores más altos (por ejemplo, 1.0) permiten mayor diversidad. Recomendamos usar `0.9` para el modelo `s1`.

  Rango requerido: `0 <= x <= 1`
</ParamField>

<ParamField body="references" type="ReferenceAudio · object[] | null">
  Audio de referencia para la voz; esto requiere serialización MessagePack y sobrescribirá reference\_voices y reference\_texts.

  <Expandable title="propiedades">
    <ParamField body="audio" type="file" required={true}>
      Archivo de audio de referencia.
    </ParamField>

    <ParamField body="text" type="string" required={true}>
      Texto de referencia correspondiente al audio.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="reference_id" type="string | null">
  ID del modelo de referencia utilizado para la voz.
</ParamField>

<ParamField body="prosody" type="ProsodyControl · object">
  Control de prosodia utilizado para la voz.

  <Expandable title="propiedades">
    <ParamField body="speed" type="number" default={1}>
      Control de velocidad de la voz.
    </ParamField>

    <ParamField body="volume" type="number" default={0}>
      Control de volumen de la voz.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="chunk_length" type="integer" default={200}>
  Longitud de fragmentación utilizada para la voz.

  Rango requerido: `100 <= x <= 300`
</ParamField>

<ParamField body="normalize" type="boolean" default={true}>
  Indica si se debe normalizar la voz; esto reducirá la latencia, pero puede disminuir el rendimiento al procesar números y fechas.
</ParamField>

<ParamField body="format" type="enum<string>" default="mp3">
  Formato utilizado para la voz.

  Valores opcionales: `wav`, `pcm`, `mp3`, `opus`
</ParamField>

<ParamField body="sample_rate" type="integer | null">
  Frecuencia de muestreo utilizada para la voz.
</ParamField>

<ParamField body="mp3_bitrate" type="enum<integer>" default={128}>
  Tasa de bits MP3 utilizada para la voz.

  Valores opcionales: `64`, `128`, `192`
</ParamField>

<ParamField body="opus_bitrate" type="enum<integer>" default={32}>
  Tasa de bits Opus utilizada para la voz.

  Valores opcionales: `-1000`, `24`, `32`, `48`, `64`
</ParamField>

<ParamField body="latency" type="enum<string>" default="normal">
  Configuración de latencia utilizada para la voz; balanced reducirá la latencia, pero puede provocar una disminución del rendimiento.

  Valores opcionales: `normal`, `balanced`
</ParamField>

## Información de respuesta

La API devolverá directamente un flujo de audio en el formato especificado por el parámetro `format` (predeterminado: mp3).
