> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Synthèse vocale asynchrone MiniMax Speech 2.8 Turbo

Utilisez cette interface pour créer une tâche de synthèse vocale asynchrone. Les entrées texte ou fichier sont prises en charge : le texte est limité à 50 000 caractères maximum, et les fichiers à 100 000 caractères maximum.

<Tip>
  Il s’agit d’une API **asynchrone** : elle renvoie uniquement le task\_id de la tâche asynchrone. Vous devez utiliser ce task\_id pour appeler l’[API de requête du résultat de tâche](/fr/docs/models/reference-get-async-task-result) afin de récupérer le résultat généré.
</Tip>

## En-têtes de requête

<ParamField header="Content-Type" type="string" required={true}>
  Valeur d’énumération : `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Format d’authentification Bearer : Bearer \{\{API Key}}.
</ParamField>

## Corps de la requête

<ParamField body="text" type="string">
  Texte de l’audio à synthétiser, limité à 50 000 caractères maximum. L’un des champs `text` ou `text_file_id` est obligatoire<br /><br />• Balises d’interjections : uniquement lorsque le modèle sélectionné est `speech-2.8-hd` ou `speech-2.8-turbo`, l’insertion de balises d’interjections dans le texte est prise en charge. Interjections prises en charge : `(laughs)` (rire), `(chuckle)` (petit rire), `(coughs)` (toux), `(clear-throat)` (raclement de gorge), `(groans)` (gémissement), `(breath)` (respiration normale), `(pant)` (halètement), `(inhale)` (inspiration), `(exhale)` (expiration), `(gasps)` (inspiration brusque), `(sniffs)` (reniflement), `(sighs)` (soupir), `(snorts)` (souffle nasal), `(burps)` (rot), `(lip-smacking)` (claquement de lèvres), `(humming)` (fredonnement), `(hissing)` (sifflement), `(emm)` (euh), `(whistles)` (sifflement), `(sneezes)` (éternuement), `(crying)` (sanglot), `(applause)` (applaudissements)
</ParamField>

<ParamField body="text_file_id" type="integer">
  ID du fichier texte de l’audio à synthétiser. La longueur d’un fichier unique doit être inférieure à 100 000 caractères. Formats de fichier pris en charge : txt, zip. L’un des champs `text` ou `text_file_id` est obligatoire ; une fois fourni, le format est automatiquement vérifié.<br />• **Fichier txt** : longueur limitée à \<100,000 caractères. L’utilisation de `&lt;#x#&gt;` pour marquer des pauses personnalisées est prise en charge. x correspond à la durée de la pause (en secondes), dans la plage \[0.01,99.99], avec au maximum deux décimales. Notez que la pause doit être placée entre deux segments de texte pouvant être prononcés vocalement ; il n’est pas possible d’utiliser plusieurs marqueurs de pause consécutifs<br />• **Fichier zip** :<br />• L’archive compressée doit contenir des fichiers txt ou json du même format.<br />• Format du fichier json : les trois champs \[`title`, `content`, `extra`] sont pris en charge et représentent respectivement le titre, le corps du texte et les informations supplémentaires. Si les trois champs existent, 3 groupes de résultats sont produits, soit 9 fichiers au total, stockés ensemble dans un même dossier. Si un champ n’existe pas ou si son contenu est vide, aucun résultat correspondant à ce champ ne sera généré
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="propriétés" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Ajustement de la hauteur tonale (grave/clair), plage \[-100, 100]. Plus la valeur est proche de -100, plus la voix est grave ; plus elle est proche de 100, plus la voix est claire

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajustement du timbre (magnétique/cristallin), plage \[-100, 100]. Plus la valeur est proche de -100, plus la voix est riche ; plus elle est proche de 100, plus la voix est cristalline

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajustement de l’intensité (puissant/doux), plage \[-100, 100]. Plus la valeur est proche de -100, plus la voix est ferme ; plus elle est proche de 100, plus la voix est douce

      Plage de valeurs : \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Paramètre d’effet sonore ; un seul choix est possible à la fois. Valeurs disponibles :

      1. spacious\_echo (écho d’espace ouvert)
      2. auditorium\_echo (diffusion en auditorium)
      3. lofi\_telephone (distorsion téléphonique)
      4. robotic (voix électronique)

      Valeurs disponibles : `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="propriétés" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Format de l’audio généré. Plage disponible \[mp3, pcm, flac], valeur par défaut : `mp3`

      Valeurs disponibles : `mp3`, `pcm`, `flac`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Débit binaire de l’audio généré. Plage disponible \[32000, 64000, 128000, 256000], valeur par défaut : `128000`. Ce paramètre ne s’applique qu’aux audios au format `mp3`
    </ParamField>

    <ParamField body="channel" type="integer" default={2}>
      Nombre de canaux de l’audio généré. Plage disponible : \[1, 2], où `1` correspond au mono et `2` au stéréo ; la valeur par défaut est 1
    </ParamField>

    <ParamField body="audio_sample_rate" type="integer" default={32000}>
      Taux d’échantillonnage de l’audio généré. Plage disponible \[8000, 16000, 22050, 24000, 32000, 44100], valeur par défaut : `32000`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="propriétés" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Volume de l’audio synthétisé : plus la valeur est élevée, plus le volume est fort. Plage de valeurs (0, 10], valeur par défaut : 1.0

      Plage de valeurs : \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Intonation de l’audio synthétisé, plage de valeurs \[-12, 12], valeur par défaut : 0, où 0 correspond à la sortie avec le timbre d’origine

      Plage de valeurs : \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Vitesse de parole de l’audio synthétisé : plus la valeur est élevée, plus la vitesse est rapide. Plage de valeurs \[0.5, 2], valeur par défaut : 1.0

      Plage de valeurs : \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Contrôle l’émotion de la voix synthétisée. La plage de paramètres est \["happy", "sad", "angry", "fearful", "disgusted", "surprised", "calm", "fluent", "whisper"], correspondant respectivement à 8 émotions : joie, tristesse, colère, peur, dégoût, surprise, neutralité, expressivité, chuchotement
      <br />• Le modèle fait automatiquement correspondre une émotion appropriée en fonction du texte d’entrée ; il n’est généralement pas nécessaire de la spécifier manuellement
      <br />• Ce paramètre ne s’applique qu’aux modèles `speech-2.6-hd`, `speech-2.6-turbo`, `speech-01-hd`, `speech-01-turbo`
      <br />• Les options `fluent`, `whisper` ne s’appliquent qu’aux modèles `speech-2.6-turbo`, `speech-2.6-hd`

      Valeurs disponibles : `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Identifiant du timbre de l’audio synthétisé. Si vous devez définir un timbre mixte, veuillez définir le paramètre timber\_weights et laisser ce paramètre vide. Trois types de timbres sont pris en charge : timbres système, timbres clonés et timbres générés à partir de texte. Voici une partie des derniers timbres système (ID) ; vous pouvez consulter tous les timbres officiellement pris en charge
      <br />• **Chinois** :<br />• moss\_audio\_ce44fc67-7ce3-11f0-8de5-96e35d26fb85<br />• moss\_audio\_aaa1346a-7ce7-11f0-8e61-2e6e3c7ee85d<br />• Chinese (Mandarin)\_Lyrical\_Voice<br />• Chinese (Mandarin)\_HK\_Flight\_Attendant<br />• Anglais :<br />• English\_Graceful\_Lady<br />• English\_Insightful\_Speaker<br />• English\_radiant\_girl<br />• English\_Persuasive\_Man<br />• moss\_audio\_6dc281eb-713c-11f0-a447-9613c873494c<br />• moss\_audio\_570551b1-735c-11f0-b236-0adeeecad052<br />• moss\_audio\_ad5baf92-735f-11f0-8263-fe5a2fe98ec8<br />• English\_Lucky\_Robot<br />• Japonais :<br />• Japanese\_Whisper\_Belle<br />• moss\_audio\_24875c4a-7be4-11f0-9359-4e72c55db738<br />• moss\_audio\_7f4ee608-78ea-11f0-bb73-1e2a4cfcd245<br />• moss\_audio\_c1a6a3ac-7be6-11f0-8e8e-36b92fbb4f95
    </ParamField>

    <ParamField body="english_normalization" type="boolean" default={false}>
      Prend en charge la normalisation des textes en anglais. Une fois activée, elle peut améliorer les performances dans les scénarios de lecture de nombres, mais augmente légèrement la latence. Valeur par défaut : false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Contrôle l’ajout d’un identifiant rythmique audio à la fin de l’audio synthétisé. Valeur par défaut : False. Ce paramètre ne s’applique qu’à la synthèse non diffusée en streaming
</ParamField>

<ParamField body="language_boost" type="string">
  Indique s’il faut renforcer la capacité de reconnaissance pour les langues minoritaires et dialectes spécifiés. La valeur par défaut est `null` ; vous pouvez la définir sur `auto` pour laisser le modèle décider automatiquement.

  Valeurs disponibles : `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Activez ce paramètre pour rendre les transitions entre propositions plus naturelles. Pris en charge uniquement par les modèles `speech-2.8-hd` et `speech-2.8-turbo`
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="propriétés" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Définit les règles de remplacement de transcription phonétique ou de prononciation correspondant aux caractères ou symboles nécessitant une annotation spéciale. Dans les textes chinois, les tons sont représentés par des chiffres :
      le premier ton est `1`, le deuxième ton est `2`, le troisième ton est `3`, le quatrième ton est `4`, et le ton neutre est `5`
      Exemples :
      \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Informations de réponse

<ResponseField name="file_id" type="integer" required={false}>
  ID du fichier audio correspondant renvoyé après la création réussie de la tâche.<br /><br />• Une fois la tâche terminée, il peut être utilisé pour effectuer une requête via file\_id. Lorsque la requête échoue, ce champ n’est pas renvoyé

  Remarque : l’URL de téléchargement renvoyée est valide pendant 9 heures (32400 secondes) à compter de sa génération. Une fois expirée, le fichier deviendra invalide et les informations générées seront perdues ; veillez à télécharger les informations à temps
</ResponseField>

<ResponseField name="task_id" type="string" required={false}>
  Utilisez task\_id pour appeler l’[API de requête du résultat de tâche](/fr/docs/models/reference-get-async-task-result) afin de récupérer la sortie générée.
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  <Expandable title="propriétés" defaultOpen={true}>
    <ResponseField name="status_msg" type="string" required={true}>
      Détails de l’état
    </ResponseField>

    <ResponseField name="status_code" type="integer" required={true}>
      Code d’état<br /><br />• `0` : normal<br />• `1002` : limitation de débit<br />• `1004` : échec de l’authentification<br />• `1039` : limitation de débit TPM déclenchée<br />• `1042` : caractères illégaux supérieurs à 10 %<br />• `2013` : erreur de paramètre
    </ResponseField>
  </Expandable>
</ResponseField>

<ResponseField name="task_token" type="string" required={false}>
  Informations de clé utilisées pour terminer la tâche actuelle
</ResponseField>

<ResponseField name="usage_characters" type="integer" required={false}>
  Nombre de caractères facturés
</ResponseField>
