> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Synthèse vocale Fish Audio

<Note>
  Pour obtenir les meilleurs résultats, il est recommandé d’utiliser d’abord le [clonage audio](/fr/docs/models/reference-fish-audio-voice-cloning) pour téléverser un audio de référence avant d’utiliser cette API. Cela améliorera la qualité vocale et réduira la latence.
</Note>

Fish Audio convertit du texte en parole.

Formats audio pris en charge :

* WAV / PCM
  * Fréquence d’échantillonnage : 8kHz, 16kHz, 24kHz, 32kHz, 44.1kHz
  * Fréquence d’échantillonnage par défaut : 44.1kHz
  * 16-bit, mono

* MP3
  * Fréquence d’échantillonnage : 32kHz, 44.1kHz
  * Fréquence d’échantillonnage par défaut : 44.1kHz
  * Mono
  * Débit binaire : 64kbps, 128kbps (par défaut), 192kbps

* Opus
  * Fréquence d’échantillonnage : 48kHz
  * Fréquence d’échantillonnage par défaut : 48kHz
  * Mono
  * Débit binaire : -1000 (automatique), 24kbps, 32kbps (par défaut), 48kbps, 64kbps

## En-têtes de requête

<ParamField header="Content-Type" type="string" required={true}>
  Valeur énumérée : `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Format d’authentification Bearer : Bearer \{\{clé API}}.
</ParamField>

## Corps de la requête

<ParamField body="text" type="string" required={true}>
  Texte à convertir en parole.
</ParamField>

<ParamField body="temperature" type="number" default={0.9}>
  Contrôle le caractère aléatoire de la génération vocale. Des valeurs plus élevées (par exemple 1.0) rendent la sortie plus aléatoire, tandis que des valeurs plus faibles (par exemple 0.1) la rendent plus déterministe. Nous recommandons d’utiliser `0.9` pour le modèle `s1`.

  Plage requise : `0 <= x <= 1`
</ParamField>

<ParamField body="top_p" type="number" default={0.9}>
  Contrôle la diversité via l’échantillonnage par noyau. Des valeurs plus faibles (par exemple 0.1) rendent la sortie plus concentrée, tandis que des valeurs plus élevées (par exemple 1.0) permettent davantage de diversité. Nous recommandons d’utiliser `0.9` pour le modèle `s1`.

  Plage requise : `0 <= x <= 1`
</ParamField>

<ParamField body="references" type="ReferenceAudio · object[] | null">
  Audio de référence à utiliser pour la voix ; cela nécessite une sérialisation MessagePack et remplacera reference\_voices et reference\_texts.

  <Expandable title="propriétés">
    <ParamField body="audio" type="file" required={true}>
      Fichier audio de référence.
    </ParamField>

    <ParamField body="text" type="string" required={true}>
      Texte de référence correspondant à l’audio.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="reference_id" type="string | null">
  ID du modèle de référence à utiliser pour la voix.
</ParamField>

<ParamField body="prosody" type="ProsodyControl · object">
  Contrôle de la prosodie à utiliser pour la voix.

  <Expandable title="propriétés">
    <ParamField body="speed" type="number" default={1}>
      Contrôle de la vitesse de la parole.
    </ParamField>

    <ParamField body="volume" type="number" default={0}>
      Contrôle du volume de la parole.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="chunk_length" type="integer" default={200}>
  Longueur des blocs à utiliser pour la voix.

  Plage requise : `100 <= x <= 300`
</ParamField>

<ParamField body="normalize" type="boolean" default={true}>
  Indique s’il faut normaliser la voix, ce qui réduira la latence, mais peut dégrader les performances de traitement des nombres et des dates.
</ParamField>

<ParamField body="format" type="enum<string>" default="mp3">
  Format à utiliser pour la voix.

  Valeurs possibles : `wav`, `pcm`, `mp3`, `opus`
</ParamField>

<ParamField body="sample_rate" type="integer | null">
  Fréquence d’échantillonnage à utiliser pour la voix.
</ParamField>

<ParamField body="mp3_bitrate" type="enum<integer>" default={128}>
  Débit binaire MP3 à utiliser pour la voix.

  Valeurs possibles : `64`, `128`, `192`
</ParamField>

<ParamField body="opus_bitrate" type="enum<integer>" default={32}>
  Débit binaire Opus à utiliser pour la voix.

  Valeurs possibles : `-1000`, `24`, `32`, `48`, `64`
</ParamField>

<ParamField body="latency" type="enum<string>" default="normal">
  Paramètre de latence à utiliser pour la voix ; balanced réduira la latence, mais peut entraîner une baisse des performances.

  Valeurs possibles : `normal`, `balanced`
</ParamField>

## Informations de réponse

L’API renverra directement un flux audio au format spécifié par le paramètre `format` (par défaut : mp3).
