> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Synthèse vocale asynchrone MiniMax Speech-2.6-hd

Cette API prend en charge la génération asynchrone de synthèse vocale à partir de texte. Une génération de texte unique prend en charge jusqu’à 1 million de caractères pour la transmission, et le résultat audio complet généré peut être récupéré de manière asynchrone. Elle prend en charge plus de 100 voix système et des voix clonées au choix ; elle permet également d’ajuster librement l’intonation, la vitesse, le volume, le débit binaire, la fréquence d’échantillonnage et le format de sortie.

Après avoir soumis une demande de synthèse vocale pour un texte long, veuillez noter que l’URL retournée est valable 24 heures à partir de son retour. Veillez à télécharger les informations à temps.

<Tip>Convient à la génération vocale de textes longs, comme des livres entiers. Le temps d’attente dans la file de tâches peut être relativement long. Pour les phrases courtes, le chat vocal, les interactions sociales en ligne et les scénarios similaires, il est recommandé d’utiliser [l’appel synchrone de synthèse vocale](/fr/docs/models/reference-minimax-speech-2.6-hd).</Tip>

## En-têtes de requête

<ParamField header="Content-Type" type="string" required={true}>
  Valeur d’énumération : `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Format d’authentification Bearer : Bearer \{\{API Key}}.
</ParamField>

## Corps de la requête

<ParamField body="text" type="string" required={true}>
  Texte à synthétiser, limité à un maximum de 50 000 caractères.
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="properties">
    <ParamField body="speed" type="number" default={1.0}>
      Plage \[0.5,2], valeur par défaut : 1.0

      Vitesse de la voix générée. Paramètre facultatif : plus la valeur est élevée, plus la vitesse est rapide.
    </ParamField>

    <ParamField body="vol" type="number" default={1.0}>
      Plage (0,10], valeur par défaut : 1.0

      Volume de la voix générée. Paramètre facultatif : plus la valeur est élevée, plus le volume est fort.
    </ParamField>

    <ParamField body="pitch" type="number" default={0}>
      Plage \[-12,12], valeur par défaut : 0

      Intonation de la voix générée. Paramètre facultatif (0 correspond à la sortie de la voix d’origine ; la valeur doit être un entier).
    </ParamField>

    <ParamField body="voice_id" type="string">
      Identifiant de la voix demandée.

      Deux types sont pris en charge : les voix système (id) et les voix clonées (id). Les voix système (ID) sont les suivantes :

      * Voix de jeune homme timide : `male-qn-qingse`
      * Voix de jeune homme d’élite : `male-qn-jingying`
      * Voix de jeune homme autoritaire : `male-qn-badao`
      * Voix de jeune étudiant universitaire : `male-qn-daxuesheng`
      * Voix de jeune fille : `female-shaonv`
      * Voix de femme distinguée : `female-yujie`
      * Voix de femme mature : `female-chengshu`
      * Voix de femme douce : `female-tianmei`
      * Présentateur masculin : `presenter_male`
      * Présentatrice : `presenter_female`
      * Livre audio masculin 1 : `audiobook_male_1`
      * Livre audio masculin 2 : `audiobook_male_2`
      * Livre audio féminin 1 : `audiobook_female_1`
      * Livre audio féminin 2 : `audiobook_female_2`
      * Voix de jeune homme timide-beta : `male-qn-qingse-jingpin`
      * Voix de jeune homme d’élite-beta : `male-qn-jingying-jingpin`
      * Voix de jeune homme autoritaire-beta : `male-qn-badao-jingpin`
      * Voix de jeune étudiant universitaire-beta : `male-qn-daxuesheng-jingpin`
      * Voix de jeune fille-beta : `female-shaonv-jingpin`
      * Voix de femme distinguée-beta : `female-yujie-jingpin`
      * Voix de femme mature-beta : `female-chengshu-jingpin`
      * Voix de femme douce-beta : `female-tianmei-jingpin`
      * Garçon intelligent : `clever_boy`
      * Garçon mignon : `cute_boy`
      * Petite fille adorable : `lovely_girl`
      * Cochon cartoon Xiaoqi : `cartoon_pig`
      * Petit frère yandere : `bingjiao_didi`
      * Petit ami séduisant : `junlang_nanyou`
      * Jeune camarade innocent : `chunzhen_xuedi`
      * Aîné distant : `lengdan_xiongzhang`
      * Jeune maître autoritaire : `badao_shaoye`
      * Petite Ling douce : `tianxin_xiaoling`
      * Jeune fille espiègle et mignonne : `qiaopi_mengmei`
      * Femme distinguée séduisante : `wumei_yujie`
      * Jeune camarade coquette : `diadia_xuemei`
      * Aînée élégante : `danya_xuejie`
      * Santa Claus : `Santa_Claus`
      * Grinch : `Grinch`
      * Rudolph : `Rudolph`
      * Arnold : `Arnold`
      * Charming Santa : `Charming_Santa`
      * Charming Lady : `Charming_Lady`
      * Sweet Girl : `Sweet_Girl`
      * Cute Elf : `Cute_Elf`
      * Attractive Girl : `Attractive_Girl`
      * Serene Woman : `Serene_Woman`
    </ParamField>

    <ParamField body="emotion" type="string">
      Contrôle l’émotion de la voix synthétisée ;

      7 émotions sont actuellement prises en charge : joie, tristesse, colère, peur, dégoût, surprise, neutre ;

      Plage de paramètres : `["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]`
    </ParamField>

    <ParamField body="text_normalization" type="bool" default="false">
      Ce paramètre prend en charge la normalisation du texte anglais, ce qui peut améliorer les performances dans les scénarios de lecture de nombres, mais augmente légèrement la latence. S’il n’est pas fourni, la valeur par défaut est false.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="properties">
    <ParamField body="sample_rate" type="number" default={32000}>
      Plage \[8000, 16000, 22050, 24000, 32000, 44100]

      Fréquence d’échantillonnage de la voix générée. Facultatif, par défaut : 32000.
    </ParamField>

    <ParamField body="bitrate" type="number" default={128000}>
      Plage \[32000, 64000, 128000, 256000]

      Débit binaire de la voix générée. Facultatif, valeur par défaut : 128000. Ce paramètre ne s’applique qu’aux fichiers audio au format mp3.
    </ParamField>

    <ParamField body="format" type="string" default="mp3">
      Format audio généré. Par défaut : mp3. Options : `mp3`, `pcm`, `flac`, `wav`. wav n’est pris en charge qu’en sortie non streaming.
    </ParamField>

    <ParamField body="channel" type="number" default={1}>
      Nombre de canaux de l’audio généré. Par défaut 1 : mono. Options :

      1 : mono

      2 : stéréo
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="properties">
    <ParamField body="tone" type="list">
      Remplace les textes, symboles et pronunciations correspondantes nécessitant une annotation spéciale.

      Remplacement de la prononciation (ajustement du ton/remplacement de la prononciation d’autres caractères), au format suivant :

      `["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]`

      Les tons sont remplacés par des chiffres : le premier ton (yinping) vaut 1, le deuxième ton (yangping) vaut 2, le troisième ton (shangsheng) vaut 3, le quatrième ton (qusheng) vaut 4, et le ton léger vaut 5.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="language_boost" type="string" default="null">
  Renforce la capacité de reconnaissance des langues minoritaires et dialectes spécifiés. Une fois défini, ce paramètre peut améliorer les performances vocales dans les scénarios de langue minoritaire/dialecte spécifiés. Si le type de langue minoritaire n’est pas clair, vous pouvez choisir "auto" ; le modèle déterminera alors automatiquement le type de langue minoritaire. Les valeurs prises en charge sont les suivantes :

  `'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'`
</ParamField>

<ParamField body="voice_modify" type="object">
  Paramètres d’effets vocaux. Formats audio pris en charge par ce paramètre : mp3, wav, flac

  <Expandable title="properties">
    <ParamField body="pitch" type="integer">
      Ajustement de la hauteur (grave/clair), plage \[-100,100]. Plus la valeur est proche de -100, plus la voix est grave ; plus elle est proche de 100, plus la voix est claire.
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajustement de l’intensité (puissant/doux), plage \[-100,100]. Plus la valeur est proche de -100, plus la voix est ferme ; plus elle est proche de 100, plus la voix est douce.
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajustement du timbre (magnétique/cristallin), plage \[-100,100]. Plus la valeur est proche de -100, plus la voix est profonde ; plus elle est proche de 100, plus la voix est cristalline.
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Paramètre d’effet sonore. Une seule option peut être sélectionnée par requête. Valeurs possibles :

      * `spacious_echo` (écho dans un grand espace)
      * `auditorium_echo` (diffusion en auditorium)
      * `lofi_telephone` (distorsion téléphonique)
      * `robotic` (voix électronique)
    </ParamField>
  </Expandable>
</ParamField>

## Paramètres de réponse

<ResponseField name="task_id" type="string" required={true}>
  Le task\_id de la tâche asynchrone. Vous devez utiliser ce task\_id pour appeler [l’API de consultation du résultat de tâche](/fr/docs/models/reference-get-async-task-result) afin d’obtenir le résultat généré.
</ResponseField>
