> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Synthèse vocale synchrone MiniMax Speech 2.8 HD

Convertit du texte en parole, avec prise en charge de plusieurs voix, du contrôle des émotions, du réglage de la vitesse d’élocution, etc. La longueur du texte doit être inférieure à 10000 caractères. Si le texte dépasse 3000 caractères, il est recommandé d’utiliser une sortie en streaming.

## En-têtes de requête

<ParamField header="Content-Type" type="string" required={true}>
  Valeur énumérée : `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Format d’authentification Bearer : Bearer \{\{API Key}}.
</ParamField>

## Corps de la requête

<ParamField body="text" type="string" required={true}>
  Texte à synthétiser en parole. La longueur doit être inférieure à 10000 caractères. Si le texte dépasse 3000 caractères, il est recommandé d’utiliser une sortie en streaming. Prend en charge les changements de paragraphe (sauts de ligne), le contrôle des pauses (marqueur `&lt;#x#&gt;`) et les balises d’interjections (comme (laughs), (coughs), etc., uniquement prises en charge par speech-2.8-hd/turbo)
</ParamField>

<ParamField body="stream" type="boolean" default={false}>
  Contrôle si la sortie est en streaming. Par défaut : false, c’est-à-dire sans streaming
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="propriétés" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Ajustement de la hauteur (grave/brillant), plage \[-100, 100]. Plus la valeur est proche de -100, plus la voix est grave ; plus elle est proche de 100, plus la voix est brillante

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajustement du timbre (magnétique/cristallin), plage \[-100, 100]. Plus la valeur est proche de -100, plus la voix est épaisse ; plus elle est proche de 100, plus la voix est cristalline

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajustement de l’intensité (puissant/doux), plage \[-100, 100]. Plus la valeur est proche de -100, plus la voix est ferme ; plus elle est proche de 100, plus la voix est douce

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Paramètre d’effet sonore. Un seul effet peut être sélectionné à la fois. Valeurs disponibles : spacious\_echo (écho d’espace ouvert), auditorium\_echo (diffusion en auditorium), lofi\_telephone (distorsion téléphonique), robotic (voix électronique)

      Valeurs disponibles : `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="propriétés" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Format de l’audio généré. wav est uniquement pris en charge en sortie non streaming

      Valeurs disponibles : `mp3`, `pcm`, `flac`, `wav`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Débit binaire de l’audio généré. Plage disponible : \[32000, 64000, 128000, 256000], valeur par défaut : 128000. Ce paramètre ne s’applique qu’à l’audio au format mp3

      Valeurs disponibles : `32000`, `64000`, `128000`, `256000`
    </ParamField>

    <ParamField body="channel" type="integer" default={1}>
      Nombre de canaux de l’audio généré. Plage disponible : \[1, 2], où 1 correspond au mono et 2 au stéréo. Valeur par défaut : 1

      Valeurs disponibles : `1`, `2`
    </ParamField>

    <ParamField body="force_cbr" type="boolean" default={false}>
      Contrôle du débit binaire constant (cbr) de l’audio. Valeurs disponibles : false, true. Lorsque ce paramètre est défini sur true, l’audio est encodé avec un débit binaire constant. Remarque : ce paramètre ne prend effet que lorsque l’audio est configuré en sortie streaming et que le format audio est mp3
    </ParamField>

    <ParamField body="sample_rate" type="integer" default={32000}>
      Taux d’échantillonnage de l’audio généré. Plage disponible : \[8000, 16000, 22050, 24000, 32000, 44100], valeur par défaut : 32000

      Valeurs disponibles : `8000`, `16000`, `22050`, `24000`, `32000`, `44100`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="output_format" type="string" default="hex">
  Paramètre contrôlant le format du résultat de sortie. Valeurs disponibles : url, hex ; valeur par défaut : hex. Ce paramètre ne prend effet que dans les scénarios non streaming. Les scénarios streaming ne prennent en charge que le retour au format hex. L’url retournée est valide pendant 24 heures

  Valeurs disponibles : `url`, `hex`
</ParamField>

<ParamField body="voice_setting" type="object">
  <Expandable title="propriétés" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Volume de l’audio synthétisé. Plus la valeur est élevée, plus le volume est fort. Plage de valeurs : (0, 10], valeur par défaut : 1.0

      Plage de valeurs : \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Tonalité de l’audio synthétisé. Plage de valeurs : \[-12, 12], valeur par défaut : 0, où 0 correspond à la sortie avec la voix d’origine

      Plage de valeurs : \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Vitesse d’élocution de l’audio synthétisé. Plus la valeur est élevée, plus la vitesse est rapide. Plage de valeurs : \[0.5, 2], valeur par défaut : 1.0

      Plage de valeurs : \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Contrôle l’émotion de la voix synthétisée. La plage du paramètre correspond aux 8 émotions suivantes : joie (happy), tristesse (sad), colère (angry), peur (fearful), dégoût (disgusted), surprise (surprised), neutre (calm), vivant (fluent), chuchotement (whisper). Le modèle associe automatiquement une émotion adaptée au texte d’entrée ; en général, il n’est pas nécessaire de la spécifier manuellement

      Valeurs disponibles : `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Identifiant de la voix de l’audio synthétisé. Si vous devez définir une voix mixte, renseignez le paramètre timber\_weights et laissez ce paramètre vide. Prend en charge trois types de voix : voix système, voix clonées et voix générées à partir de texte
    </ParamField>

    <ParamField body="latex_read" type="boolean" default={false}>
      Contrôle si les formules latex sont lues à voix haute. Par défaut : false. Ne prend en charge que le chinois. Une fois ce paramètre activé, le paramètre language\_boost sera défini sur Chinese
    </ParamField>

    <ParamField body="text_normalization" type="boolean" default={false}>
      Indique s’il faut activer la normalisation des textes chinois et anglais. Une fois activée, elle peut améliorer les performances dans les scénarios de lecture de nombres, mais augmente légèrement la latence. Valeur par défaut : false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Contrôle l’ajout d’un identifiant rythmique audio à la fin de l’audio synthétisé. Valeur par défaut : false. Ce paramètre ne prend effet que pour la synthèse non streaming
</ParamField>

<ParamField body="language_boost" type="string">
  Indique s’il faut renforcer la capacité de reconnaissance des langues moins répandues et des dialectes spécifiés. Valeur par défaut : null ; peut être défini sur auto pour laisser le modèle déterminer automatiquement

  Valeurs disponibles : `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="stream_options" type="object">
  <Expandable title="propriétés" defaultOpen={true}>
    <ParamField body="exclude_aggregated_audio" type="boolean" default={false}>
      Définit si le dernier chunk contient les données audio hex concaténées. Valeur par défaut : false, ce qui signifie que le dernier chunk contient les données hex complètes de l’audio concaténé
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="timber_weights" type="object[]">
  Paramètres de voix mixte, avec un maximum de 4 voix mélangées

  <Expandable title="propriétés" defaultOpen={true}>
    <ParamField body="weight" type="integer" required={true}>
      Poids occupé par chaque voix dans l’audio synthétisé ; doit être renseigné en même temps que voice\_id. La plage de valeurs disponible est \[1, 100]. Jusqu’à 4 voix peuvent être mélangées. Plus la proportion d’une voix unique est élevée, plus la voix synthétisée sera similaire à cette voix

      Plage de valeurs : \[1, 100]
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Identifiant de la voix de l’audio synthétisé ; doit être renseigné en même temps que le paramètre weight. Prend en charge trois types de voix : voix système, voix clonées et voix générées à partir de texte
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="subtitle_enable" type="boolean" default={false}>
  Contrôle l’activation du service de sous-titres. Valeur par défaut : false. Ce paramètre n’est valide que dans les scénarios de sortie non streaming et uniquement pour les modèles speech-2.6-hd, speech-2.6-turbo, speech-01-turbo, speech-01-hd
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Activez ce paramètre pour rendre les transitions entre propositions plus naturelles. Ne prend en charge que les modèles speech-2.8-hd et speech-2.8-turbo
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="propriétés" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Définit les règles de remplacement de la transcription phonétique ou de la prononciation correspondant aux caractères ou symboles nécessitant une annotation spéciale. Dans les textes chinois, les tons sont indiqués par des chiffres : le premier ton par 1, le deuxième par 2, le troisième par 3, le quatrième par 4 et le ton neutre par 5. Exemple : \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Informations de réponse

<ResponseField name="data" type="object" required={false}>
  Objet de données de synthèse retourné, pouvant être null ; une vérification non nulle est requise
</ResponseField>

<ResponseField name="trace_id" type="string" required={false}>
  id de cette session, utilisé pour aider à localiser le problème lors d’une demande d’assistance ou d’un retour
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  Code d’état et détails de cette requête
</ResponseField>

<ResponseField name="extra_info" type="object" required={false}>
  Informations supplémentaires de l’audio
</ResponseField>
