> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Synthèse vocale synchrone MiniMax Speech 2.8 Turbo

Convertit du texte en parole, avec prise en charge de plusieurs timbres, du contrôle des émotions, du réglage de la vitesse d’élocution, etc. La longueur du texte doit être inférieure à 10000 caractères. Si la longueur du texte dépasse 3000 caractères, il est recommandé d’utiliser la sortie en streaming.

## En-têtes de requête

<ParamField header="Content-Type" type="string" required={true}>
  Valeur énumérée : `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Format d’authentification Bearer : Bearer \{\{clé API}}.
</ParamField>

## Corps de la requête

<ParamField body="text" type="string" required={true}>
  Texte à synthétiser en parole. La longueur doit être inférieure à 10000 caractères. Si la longueur du texte dépasse 3000 caractères, il est recommandé d’utiliser la sortie en streaming. Prend en charge les changements de paragraphe (sauts de ligne), le contrôle des pauses (marqueur `&lt;#x#&gt;`) et les balises d’interjections/sons vocaux (comme (laughs), (coughs), etc., uniquement prises en charge par speech-2.8-hd/turbo)
</ParamField>

<ParamField body="stream" type="boolean" default={false}>
  Contrôle l’activation de la sortie en streaming. La valeur par défaut est false, c’est-à-dire que le streaming n’est pas activé
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Ajustement de la hauteur (grave/clair), plage \[-100, 100] : plus la valeur est proche de -100, plus la voix est grave ; plus elle est proche de 100, plus la voix est claire

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajustement du timbre (magnétique/cristallin), plage \[-100, 100] : plus la valeur est proche de -100, plus la voix est riche ; plus elle est proche de 100, plus la voix est cristalline

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajustement de l’intensité (puissant/doux), plage \[-100, 100] : plus la valeur est proche de -100, plus la voix est ferme ; plus elle est proche de 100, plus la voix est douce

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Paramètre d’effet sonore. Une seule option peut être sélectionnée à la fois. Valeurs possibles : spacious\_echo (écho d’espace ouvert), auditorium\_echo (diffusion en auditorium), lofi\_telephone (distorsion téléphonique), robotic (voix électronique)

      Valeurs possibles : `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Format de l’audio généré. wav n’est pris en charge qu’en sortie non streaming

      Valeurs possibles : `mp3`, `pcm`, `flac`, `wav`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Débit binaire de l’audio généré. Plage possible \[32000, 64000, 128000, 256000], valeur par défaut 128000. Ce paramètre ne s’applique qu’à l’audio au format mp3

      Valeurs possibles : `32000`, `64000`, `128000`, `256000`
    </ParamField>

    <ParamField body="channel" type="integer" default={1}>
      Nombre de canaux de l’audio généré. Plage possible : \[1, 2], où 1 correspond au mono et 2 au stéréo, valeur par défaut 1

      Valeurs possibles : `1`, `2`
    </ParamField>

    <ParamField body="force_cbr" type="boolean" default={false}>
      Contrôle du débit binaire constant (cbr) pour l’audio, valeurs possibles false et true. Lorsque ce paramètre est défini sur true, l’audio est encodé avec un débit binaire constant. Remarque : ce paramètre ne prend effet que lorsque l’audio est configuré en sortie streaming et que le format audio est mp3
    </ParamField>

    <ParamField body="sample_rate" type="integer" default={32000}>
      Taux d’échantillonnage de l’audio généré. Plage possible \[8000, 16000, 22050, 24000, 32000, 44100], valeur par défaut 32000

      Valeurs possibles : `8000`, `16000`, `22050`, `24000`, `32000`, `44100`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="output_format" type="string" default="hex">
  Paramètre contrôlant le format du résultat de sortie. Les valeurs possibles sont url et hex, valeur par défaut hex. Ce paramètre ne prend effet que dans les scénarios non streaming ; en streaming, seul le retour au format hex est pris en charge. L’url retournée est valable 24 heures

  Valeurs possibles : `url`, `hex`
</ParamField>

<ParamField body="voice_setting" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Volume de l’audio synthétisé : plus la valeur est élevée, plus le volume est fort. Plage de valeurs (0, 10], valeur par défaut 1.0

      Plage de valeurs : \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Tonalité de l’audio synthétisé, plage de valeurs \[-12, 12], valeur par défaut 0, où 0 correspond à la sortie avec le timbre d’origine

      Plage de valeurs : \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Vitesse d’élocution de l’audio synthétisé : plus la valeur est élevée, plus la parole est rapide. Plage de valeurs \[0.5, 2], valeur par défaut 1.0

      Plage de valeurs : \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Contrôle l’émotion de la voix synthétisée. Les valeurs du paramètre correspondent à 8 émotions : joie (happy), tristesse (sad), colère (angry), peur (fearful), dégoût (disgusted), surprise (surprised), neutralité (calm), expressivité (fluent), chuchotement (whisper). Le modèle associe automatiquement une émotion appropriée en fonction du texte d’entrée ; il n’est généralement pas nécessaire de la spécifier manuellement

      Valeurs possibles : `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Identifiant du timbre vocal de l’audio synthétisé. Si vous devez configurer un timbre mixte, définissez le paramètre timber\_weights et laissez ce paramètre vide. Trois types de timbres sont pris en charge : timbres système, timbres clonés et timbres générés à partir de texte
    </ParamField>

    <ParamField body="latex_read" type="boolean" default={false}>
      Contrôle la lecture des formules latex, valeur par défaut false. Uniquement pris en charge en chinois. Après activation de ce paramètre, le paramètre language\_boost est défini sur Chinese
    </ParamField>

    <ParamField body="text_normalization" type="boolean" default={false}>
      Indique s’il faut activer la normalisation des textes chinois et anglais. Une fois activée, elle peut améliorer les performances dans les scénarios de lecture de nombres, mais augmente légèrement la latence. Valeur par défaut false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Contrôle l’ajout d’un marqueur rythmique audio à la fin de l’audio synthétisé, valeur par défaut false. Ce paramètre ne prend effet que pour la synthèse non streaming
</ParamField>

<ParamField body="language_boost" type="string">
  Indique s’il faut renforcer la capacité de reconnaissance pour les langues minoritaires et dialectes spécifiés. La valeur par défaut est null ; vous pouvez définir auto pour laisser le modèle déterminer automatiquement

  Valeurs possibles : `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="stream_options" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="exclude_aggregated_audio" type="boolean" default={false}>
      Définit si le dernier chunk contient les données vocales hex concaténées. La valeur par défaut est false, c’est-à-dire que le dernier chunk contient les données vocales hex complètes concaténées
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="timber_weights" type="object[]">
  Paramètre de timbre mixte, avec prise en charge du mélange de 4 timbres au maximum

  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="weight" type="integer" required={true}>
      Poids de chaque timbre dans l’audio synthétisé, à renseigner en même temps que voice\_id. Plage de valeurs possible \[1, 100]. Le mélange de 4 timbres au maximum est pris en charge. Plus la proportion d’un timbre unique est élevée, plus le timbre synthétisé sera similaire à ce timbre

      Plage de valeurs : \[1, 100]
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Identifiant du timbre vocal de l’audio synthétisé, à renseigner en même temps que le paramètre weight. Trois types de timbres sont pris en charge : timbres système, timbres clonés et timbres générés à partir de texte
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="subtitle_enable" type="boolean" default={false}>
  Contrôle l’activation du service de sous-titres, valeur par défaut false. Ce paramètre n’est valide que dans les scénarios de sortie non streaming et uniquement pour les modèles speech-2.6-hd, speech-2.6-turbo, speech-01-turbo, speech-01-hd
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Activez ce paramètre pour rendre les transitions entre sous-phrases plus naturelles. Pris en charge uniquement par les modèles speech-2.8-hd et speech-2.8-turbo
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Définit les règles de remplacement de la transcription phonétique ou de la prononciation correspondant aux caractères ou symboles nécessitant une annotation spéciale. Dans un texte chinois, les tons sont indiqués par des chiffres : premier ton = 1, deuxième ton = 2, troisième ton = 3, quatrième ton = 4, ton neutre = 5. Exemple : \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Informations de réponse

<ResponseField name="data" type="object" required={false}>
  Objet de données de synthèse retourné, qui peut être null et doit donc faire l’objet d’une vérification de non-nullité
</ResponseField>

<ResponseField name="trace_id" type="string" required={false}>
  id de cette session, utilisé pour aider à localiser le problème lors d’une demande d’assistance ou d’un retour
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  Code d’état et détails de cette requête
</ResponseField>

<ResponseField name="extra_info" type="object" required={false}>
  Informations supplémentaires de l’audio
</ResponseField>
