> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Synthèse vocale asynchrone MiniMax Speech 2.8 HD

Utilisez cette interface pour créer une tâche de synthèse vocale asynchrone. Les entrées texte ou fichier sont prises en charge, avec une limite de longueur de 50 000 caractères pour le texte et de 100 000 caractères pour les fichiers.

<Tip>
  Il s’agit d’une API **asynchrone** qui renvoie uniquement le task\_id de la tâche asynchrone. Vous devez utiliser ce task\_id pour appeler l’[API de consultation du résultat de tâche](/fr/docs/models/reference-get-async-task-result) afin de récupérer le résultat généré.
</Tip>

## En-têtes de requête

<ParamField header="Content-Type" type="string" required={true}>
  Valeur d’énumération : `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Format d’authentification Bearer : Bearer \{\{API Key}}.
</ParamField>

## Corps de la requête

<ParamField body="text" type="string">
  Texte de l’audio à synthétiser, limité à 50 000 caractères maximum. L’un des deux champs `text` ou `text_file_id` est obligatoire.<br /><br />• Balises d’interjections : uniquement lorsque le modèle sélectionné est `speech-2.8-hd` ou `speech-2.8-turbo`, il est possible d’insérer des balises d’interjections dans le texte. Interjections prises en charge : `(laughs)` (rire), `(chuckle)` (petit rire), `(coughs)` (toux), `(clear-throat)` (raclement de gorge), `(groans)` (gémissement), `(breath)` (respiration normale), `(pant)` (halètement), `(inhale)` (inspiration), `(exhale)` (expiration), `(gasps)` (aspiration brusque), `(sniffs)` (reniflement), `(sighs)` (soupir), `(snorts)` (souffle par le nez), `(burps)` (rot), `(lip-smacking)` (bruit de lèvres), `(humming)` (fredonnement), `(hissing)` (sifflement), `(emm)` (euh), `(whistles)` (sifflement), `(sneezes)` (éternuement), `(crying)` (sanglot), `(applause)` (applaudissements)
</ParamField>

<ParamField body="text_file_id" type="integer">
  id du fichier texte de l’audio à synthétiser ; la longueur d’un fichier unique doit être inférieure à 100 000 caractères. Formats de fichier pris en charge : txt, zip. L’un des deux champs `text` ou `text_file_id` est obligatoire ; le format est automatiquement vérifié après transmission.<br />• **Fichier txt** : limite de longueur \<100000 caractères. Prend en charge l’utilisation de `&lt;#x#&gt;` pour marquer une pause personnalisée. x correspond à la durée de la pause (en secondes), dans la plage \[0.01, 99.99], avec au maximum deux décimales. Notez que la pause doit être placée entre deux segments de texte pouvant être prononcés vocalement ; il n’est pas possible d’utiliser plusieurs marqueurs de pause consécutifs.<br />• **Fichier zip** :<br />• L’archive compressée doit contenir des fichiers txt ou json au même format.<br />• Format du fichier json : les trois champs \[`title`, `content`, `extra`] sont pris en charge et représentent respectivement le titre, le corps du texte et les informations supplémentaires. Si les trois champs existent, 3 groupes de résultats sont générés, soit 9 fichiers au total, tous stockés dans un même dossier. Si un champ n’existe pas ou si son contenu est vide, le résultat correspondant à ce champ ne sera pas généré.
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Ajustement de la hauteur (grave/clair), plage \[-100, 100] ; plus la valeur est proche de -100, plus la voix est grave ; plus elle est proche de 100, plus la voix est claire.

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajustement du timbre (magnétique/cristallin), plage \[-100, 100] ; plus la valeur est proche de -100, plus la voix est épaisse ; plus elle est proche de 100, plus la voix est cristalline.

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajustement de l’intensité (puissance/douceur), plage \[-100, 100] ; plus la valeur est proche de -100, plus la voix est ferme ; plus elle est proche de 100, plus la voix est douce.

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Paramètre d’effet sonore ; une seule option peut être sélectionnée à la fois. Valeurs possibles :

      1. spacious\_echo (écho spacieux)
      2. auditorium\_echo (diffusion en auditorium)
      3. lofi\_telephone (distorsion téléphonique)
      4. robotic (voix électronique)

      Valeurs possibles : `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Format de l’audio généré. Plage possible \[mp3, pcm, flac], valeur par défaut : `mp3`

      Valeurs possibles : `mp3`, `pcm`, `flac`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Débit binaire de l’audio généré. Plage possible \[32000, 64000, 128000, 256000], valeur par défaut : `128000`. Ce paramètre ne s’applique qu’à l’audio au format `mp3`.
    </ParamField>

    <ParamField body="channel" type="integer" default={2}>
      Nombre de canaux de l’audio généré. Plage possible : \[1, 2], où `1` correspond au mono et `2` au stéréo ; la valeur par défaut est 1.
    </ParamField>

    <ParamField body="audio_sample_rate" type="integer" default={32000}>
      Taux d’échantillonnage de l’audio généré. Plage possible \[8000, 16000, 22050, 24000, 32000, 44100], valeur par défaut : `32000`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Volume de l’audio synthétisé ; plus la valeur est élevée, plus le volume est élevé. Plage de valeurs (0, 10], valeur par défaut : 1.0

      Plage de valeurs : \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Intonation de l’audio synthétisé, plage de valeurs \[-12, 12], valeur par défaut : 0, où 0 correspond à une sortie avec le timbre d’origine.

      Plage de valeurs : \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Vitesse de parole de l’audio synthétisé ; plus la valeur est élevée, plus la vitesse est rapide. Plage de valeurs \[0.5, 2], valeur par défaut : 1.0

      Plage de valeurs : \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Contrôle l’émotion de la voix synthétisée. Plage de paramètres : \["happy", "sad", "angry", "fearful", "disgusted", "surprised", "calm", "fluent", "whisper"], correspondant respectivement à 8 émotions : joie, tristesse, colère, peur, dégoût, surprise, neutralité, expressivité, chuchotement
      <br />• Le modèle associe automatiquement l’émotion appropriée en fonction du texte d’entrée ; il n’est généralement pas nécessaire de la spécifier manuellement.
      <br />• Ce paramètre ne s’applique qu’aux modèles `speech-2.6-hd`, `speech-2.6-turbo`, `speech-01-hd`, `speech-01-turbo`.
      <br />• Les options `fluent`, `whisper` ne s’appliquent qu’aux modèles `speech-2.6-turbo`, `speech-2.6-hd`.

      Valeurs possibles : `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Identifiant du timbre de l’audio synthétisé. Si vous devez définir un timbre mixte, veuillez définir le paramètre timber\_weights et laisser ce paramètre vide. Trois types de timbres sont pris en charge : timbres système, timbres répliqués et timbres générés à partir de texte. Voici quelques-uns des derniers timbres système (ID) ; vous pouvez consulter l’ensemble des timbres officiellement pris en charge.
      <br />• **Chinois** :<br />• moss\_audio\_ce44fc67-7ce3-11f0-8de5-96e35d26fb85<br />• moss\_audio\_aaa1346a-7ce7-11f0-8e61-2e6e3c7ee85d<br />• Chinese (Mandarin)\_Lyrical\_Voice<br />• Chinese (Mandarin)\_HK\_Flight\_Attendant<br />• **Anglais** :<br />• English\_Graceful\_Lady<br />• English\_Insightful\_Speaker<br />• English\_radiant\_girl<br />• English\_Persuasive\_Man<br />• moss\_audio\_6dc281eb-713c-11f0-a447-9613c873494c<br />• moss\_audio\_570551b1-735c-11f0-b236-0adeeecad052<br />• moss\_audio\_ad5baf92-735f-11f0-8263-fe5a2fe98ec8<br />• English\_Lucky\_Robot<br />• **Japonais** :<br />• Japanese\_Whisper\_Belle<br />• moss\_audio\_24875c4a-7be4-11f0-9359-4e72c55db738<br />• moss\_audio\_7f4ee608-78ea-11f0-bb73-1e2a4cfcd245<br />• moss\_audio\_c1a6a3ac-7be6-11f0-8e8e-36b92fbb4f95
    </ParamField>

    <ParamField body="english_normalization" type="boolean" default={false}>
      Prend en charge la normalisation du texte anglais ; une fois activée, elle peut améliorer les performances dans les scénarios de lecture de nombres, mais augmente légèrement la latence. Valeur par défaut : false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Contrôle l’ajout d’un marqueur rythmique audio à la fin de l’audio synthétisé. Valeur par défaut : False. Ce paramètre ne s’applique qu’à la synthèse non streaming.
</ParamField>

<ParamField body="language_boost" type="string">
  Indique s’il faut renforcer la capacité de reconnaissance des langues minoritaires et dialectes spécifiés. La valeur par défaut est `null` ; vous pouvez définir `auto` pour laisser le modèle décider automatiquement.

  Valeurs possibles : `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Activez ce paramètre pour rendre les jonctions entre propositions plus naturelles ; seuls les modèles `speech-2.8-hd` et `speech-2.8-turbo` sont pris en charge.
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Définit les règles de remplacement de phonétique ou de prononciation correspondant aux caractères ou symboles nécessitant une annotation spéciale. Dans un texte chinois, les tons sont indiqués par des chiffres :
      le premier ton est `1`, le deuxième ton est `2`, le troisième ton est `3`, le quatrième ton est `4`, et le ton neutre est `5`.
      Exemples :
      \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Informations de réponse

<ResponseField name="file_id" type="integer" required={false}>
  ID du fichier audio correspondant renvoyé après la création réussie de la tâche.<br /><br />• Une fois la tâche terminée, il est possible de consulter le résultat via file\_id. Ce champ n’est pas renvoyé en cas d’erreur de requête.

  Remarque : l’URL de téléchargement renvoyée est valide pendant 9 heures (32400 secondes) à partir de sa génération. Une fois expirée, le fichier deviendra invalide et les informations générées seront perdues ; veuillez prêter attention à l’heure des informations de téléchargement.
</ResponseField>

<ResponseField name="task_id" type="string" required={false}>
  Utilisez task\_id pour appeler l’[API de consultation du résultat de tâche](/fr/docs/models/reference-get-async-task-result) afin de récupérer la sortie générée.
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  <Expandable title="properties" defaultOpen={true}>
    <ResponseField name="status_msg" type="string" required={true}>
      Détails de l’état
    </ResponseField>

    <ResponseField name="status_code" type="integer" required={true}>
      Code d’état<br /><br />• `0` : normal<br />• `1002` : limitation de débit<br />• `1004` : échec de l’authentification<br />• `1039` : limitation TPM déclenchée<br />• `1042` : caractères illégaux supérieurs à 10 %<br />• `2013` : erreur de paramètre
    </ResponseField>
  </Expandable>
</ResponseField>

<ResponseField name="task_token" type="string" required={false}>
  Informations de clé utilisées pour finaliser la tâche actuelle
</ResponseField>

<ResponseField name="usage_characters" type="integer" required={false}>
  Nombre de caractères facturés
</ResponseField>
