> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Synthèse vocale Fish Audio S2 Pro

Le modèle de synthèse vocale Fish Audio S2 Pro convertit du texte en parole naturelle et prend en charge les voix de référence, le contrôle de l’échantillonnage, la segmentation, les formats audio et le contrôle de la prosodie.

## En-têtes de requête

<ParamField header="Content-Type" type="string" required={true}>
  Valeur d’énumération : `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Format d’authentification Bearer : Bearer \{\{API Key}}.
</ParamField>

## Corps de la requête

<ParamField body="text" type="string" required={true}>
  Texte à convertir en parole. Le texte multi-locuteur S2-Pro peut utiliser les balises \<|speaker:0|>你好\<|speaker:1|>你好呀.
</ParamField>

<ParamField body="top_p" type="number" default={0.7}>
  Contrôle de la diversité de l’échantillonnage par noyau.

  Plage de valeurs : \[0, 1]
</ParamField>

<ParamField body="format" type="string" default="mp3">
  Format audio de sortie.

  Valeurs possibles : `wav`, `pcm`, `mp3`, `opus`
</ParamField>

<ParamField body="latency" type="string" default="normal">
  Niveau de latence.

  Valeurs possibles : `low`, `normal`, `balanced`
</ParamField>

<ParamField body="prosody" type="object">
  Contrôle de la prosodie.

  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="speed" type="number" default={1}>
      Multiplicateur de vitesse d’élocution.
    </ParamField>

    <ParamField body="volume" type="number" default={0}>
      Réglage du volume.
    </ParamField>

    <ParamField body="normalize_loudness" type="boolean" default={true}>
      Indique s’il faut normaliser la sonie de sortie.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="normalize" type="boolean" default={true}>
  Normalise les textes chinois et anglais.
</ParamField>

<ParamField body="references" type="object[]">
  Échantillons audio de référence pour le clonage vocal zero-shot.

  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="text" type="string">
      Texte correspondant à l’audio de référence.
    </ParamField>

    <ParamField body="audio" type="string">
      Audio de référence, transmis en base64 ou via une URL selon la prise en charge du fournisseur.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="mp3_bitrate" type="integer" default={128}>
  Débit MP3, en kbps.

  Valeurs possibles : `64`, `128`, `192`
</ParamField>

<ParamField body="sample_rate" type="integer" nullable={true}>
  Taux d’échantillonnage de sortie en Hz. Si vide, la valeur par défaut du format est utilisée : 48000 Hz pour opus, généralement 44100 Hz pour les autres formats.
</ParamField>

<ParamField body="temperature" type="number" default={0.7}>
  Contrôle de l’expressivité.

  Plage de valeurs : \[0, 1]
</ParamField>

<ParamField body="chunk_length" type="integer" default={300}>
  Taille de segmentation du texte.

  Plage de valeurs : \[100, 300]
</ParamField>

<ParamField body="opus_bitrate" type="integer" default={-1000}>
  Débit Opus, en bps ; -1000 signifie automatique.

  Valeurs possibles : `-1000`, `24000`, `32000`, `48000`, `64000`
</ParamField>

<ParamField body="reference_id" type="string">
  ID du modèle de voix ; dans les scénarios multi-locuteurs, vous pouvez transmettre un tableau correspondant à l’index speaker.
</ParamField>

<ParamField body="max_new_tokens" type="integer" default={1024}>
  Nombre maximal de tokens audio par segment.
</ParamField>

<ParamField body="min_chunk_length" type="integer" default={50}>
  Nombre minimal de caractères avant segmentation.

  Plage de valeurs : \[0, 100]
</ParamField>

<ParamField body="repetition_penalty" type="number" default={1.2}>
  Coefficient de pénalité réduisant la répétition des motifs audio.
</ParamField>

<ParamField body="early_stop_threshold" type="number" default={1}>
  Seuil d’arrêt anticipé.

  Plage de valeurs : \[0, 1]
</ParamField>

<ParamField body="condition_on_previous_chunks" type="boolean" default={true}>
  Utilise les segments audio précédents comme contexte.
</ParamField>

## Informations de réponse

Audio généré.

Format : `binary`
