> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax Speech-2.6-hd asynchrone Sprachsynthese

Diese API unterstützt die asynchrone Generierung von Sprache auf Basis von Text-to-Speech. Pro Textgenerierungsübertragung werden maximal 1 Million Zeichen unterstützt; das vollständige generierte Audioergebnis kann asynchron abgerufen werden. Unterstützt werden über 100 Systemstimmen sowie frei wählbare geklonte Stimmen; Intonation, Sprechgeschwindigkeit, Lautstärke, Bitrate, Abtastrate und Ausgabeformat können individuell angepasst werden.

Nachdem Sie eine Anfrage zur Sprachsynthese langer Texte eingereicht haben, beachten Sie bitte, dass die zurückgegebene url ab dem Zeitpunkt der Rückgabe 24 Stunden gültig ist. Achten Sie daher auf den Zeitpunkt des Herunterladens der Informationen.

<Tip>Geeignet für die Sprachgenerierung langer Texte wie ganzer Bücher; die Wartezeit in der Aufgabenwarteschlange kann relativ lang sein. Für Szenarien wie die Generierung kurzer Sätze, Sprachchats und Online-Social-Anwendungen wird die Verwendung des [synchronen Aufrufs der Sprachsynthese](/de/docs/models/reference-minimax-speech-2.6-hd) empfohlen.</Tip>

## Anfrage-Header

<ParamField header="Content-Type" type="string" required={true}>
  Enumerationswert: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer-Authentifizierungsformat: Bearer \{\{API Key}}.
</ParamField>

## Anfragebody

<ParamField body="text" type="string" required={true}>
  Der zu synthetisierende Text, begrenzt auf maximal 50.000 Zeichen.
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="properties">
    <ParamField body="speed" type="number" default={1.0}>
      Bereich \[0.5,2], Standardwert ist 1.0

      Die Sprechgeschwindigkeit der generierten Stimme. Optional; je größer der Wert, desto schneller die Sprechgeschwindigkeit.
    </ParamField>

    <ParamField body="vol" type="number" default={1.0}>
      Bereich (0,10], Standardwert ist 1.0

      Die Lautstärke der generierten Stimme. Optional; je größer der Wert, desto höher die Lautstärke.
    </ParamField>

    <ParamField body="pitch" type="number" default={0}>
      Bereich \[-12,12], Standardwert ist 0

      Die Tonhöhe/Intonation der generierten Stimme. Optional (0 bedeutet Ausgabe in der Originalstimme; der Wert muss eine Ganzzahl sein).
    </ParamField>

    <ParamField body="voice_id" type="string">
      Die angeforderte Stimmen-ID.

      Es werden zwei Typen unterstützt: Systemstimmen (id) und geklonte Stimmen (id). Die Systemstimmen (ID) sind wie folgt:

      * Junge, unerfahrene Männerstimme: `male-qn-qingse`
      * Elite-Jugendstimme: `male-qn-jingying`
      * Dominante Jugendstimme: `male-qn-badao`
      * Stimme eines männlichen Studenten: `male-qn-daxuesheng`
      * Mädchenstimme: `female-shaonv`
      * Reife, selbstbewusste Frauenstimme: `female-yujie`
      * Reife Frauenstimme: `female-chengshu`
      * Süße Frauenstimme: `female-tianmei`
      * Männlicher Moderator: `presenter_male`
      * Weibliche Moderatorin: `presenter_female`
      * Männliches Hörbuch 1: `audiobook_male_1`
      * Männliches Hörbuch 2: `audiobook_male_2`
      * Weibliches Hörbuch 1: `audiobook_female_1`
      * Weibliches Hörbuch 2: `audiobook_female_2`
      * Junge, unerfahrene Männerstimme-beta: `male-qn-qingse-jingpin`
      * Elite-Jugendstimme-beta: `male-qn-jingying-jingpin`
      * Dominante Jugendstimme-beta: `male-qn-badao-jingpin`
      * Stimme eines männlichen Studenten-beta: `male-qn-daxuesheng-jingpin`
      * Mädchenstimme-beta: `female-shaonv-jingpin`
      * Reife, selbstbewusste Frauenstimme-beta: `female-yujie-jingpin`
      * Reife Frauenstimme-beta: `female-chengshu-jingpin`
      * Süße Frauenstimme-beta: `female-tianmei-jingpin`
      * Kluger Junge: `clever_boy`
      * Süßer Junge: `cute_boy`
      * Niedliches Mädchen: `lovely_girl`
      * Cartoon-Schwein Xiaoqi: `cartoon_pig`
      * Yandere-Jüngerer-Bruder: `bingjiao_didi`
      * Attraktiver Freund: `junlang_nanyou`
      * Unschuldiger jüngerer Kommilitone: `chunzhen_xuedi`
      * Kühler älterer Kommilitone: `lengdan_xiongzhang`
      * Dominanter junger Herr: `badao_shaoye`
      * Sweetheart Xiaoling: `tianxin_xiaoling`
      * Verspieltes süßes Mädchen: `qiaopi_mengmei`
      * Verführerische, reife Frauenstimme: `wumei_yujie`
      * Kokette jüngere Kommilitonin: `diadia_xuemei`
      * Elegante ältere Kommilitonin: `danya_xuejie`
      * Santa Claus: `Santa_Claus`
      * Grinch: `Grinch`
      * Rudolph: `Rudolph`
      * Arnold: `Arnold`
      * Charming Santa: `Charming_Santa`
      * Charming Lady: `Charming_Lady`
      * Sweet Girl: `Sweet_Girl`
      * Cute Elf: `Cute_Elf`
      * Attractive Girl: `Attractive_Girl`
      * Serene Woman: `Serene_Woman`
    </ParamField>

    <ParamField body="emotion" type="string">
      Steuert die Emotion der synthetisierten Sprache;

      Derzeit werden 7 Emotionen unterstützt: glücklich, traurig, wütend, ängstlich, angewidert, überrascht, neutral;

      Parameterbereich: `["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]`
    </ParamField>

    <ParamField body="text_normalization" type="bool" default="false">
      Dieser Parameter unterstützt die Normalisierung englischer Texte und kann die Leistung in Szenarien zum Vorlesen von Zahlen verbessern, erhöht jedoch geringfügig die Latenz. Wenn nicht angegeben, ist der Standardwert false.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="properties">
    <ParamField body="sample_rate" type="number" default={32000}>
      Bereich 【8000，16000，22050，24000，32000，44100】

      Die Abtastrate der generierten Stimme. Optional, Standardwert ist 32000.
    </ParamField>

    <ParamField body="bitrate" type="number" default={128000}>
      Bereich 【32000，64000，128000，256000】

      Die Bitrate der generierten Stimme. Optional, Standardwert ist 128000. Dieser Parameter wirkt sich nur auf Audio im mp3-Format aus.
    </ParamField>

    <ParamField body="format" type="string" default="mp3">
      Das generierte Audioformat. Standard ist mp3. Optional: `mp3`, `pcm`, `flac`, `wav`. wav wird nur bei nicht-streamender Ausgabe unterstützt.
    </ParamField>

    <ParamField body="channel" type="number" default={1}>
      Die Anzahl der Kanäle des generierten Audios. Standard 1: Mono, optional:

      1: Mono

      2: Stereo
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="properties">
    <ParamField body="tone" type="list">
      Ersetzt Texte, Symbole und die entsprechende Aussprache, die speziell markiert werden müssen.

      Aussprache ersetzen (Ton anpassen/Aussprache anderer Zeichen ersetzen), Format wie folgt:

      `["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]`

      Töne werden durch Zahlen ersetzt: erster Ton (Yinping) ist 1, zweiter Ton (Yangping) ist 2, dritter Ton (Shangsheng) ist 3, vierter Ton (Qusheng) ist 4, neutraler Ton ist 5.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="language_boost" type="string" default="null">
  Verbessert die Erkennungsfähigkeit für angegebene weniger verbreitete Sprachen und Dialekte. Nach der Einstellung kann die Sprachleistung in Szenarien mit der angegebenen weniger verbreiteten Sprache/dem angegebenen Dialekt verbessert werden. Wenn der Typ der weniger verbreiteten Sprache nicht eindeutig ist, kann "auto" gewählt werden; das Modell bestimmt dann selbstständig den Typ der weniger verbreiteten Sprache. Unterstützte Werte:

  `'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'`
</ParamField>

<ParamField body="voice_modify" type="object">
  Einstellungen für den Stimmeffekt. Dieser Parameter unterstützt die Audioformate: mp3, wav, flac

  <Expandable title="properties">
    <ParamField body="pitch" type="integer">
      Tonhöhenanpassung (tief/hell), Bereich \[-100,100]; je näher der Wert an -100 liegt, desto tiefer ist die Stimme; je näher an 100, desto heller ist die Stimme
    </ParamField>

    <ParamField body="intensity" type="integer">
      Intensitätsanpassung (kraftvoll/sanft), Bereich \[-100,100]; je näher der Wert an -100 liegt, desto kräftiger ist die Stimme; je näher an 100, desto weicher ist die Stimme
    </ParamField>

    <ParamField body="timbre" type="integer">
      Klangfarbenanpassung (magnetisch/klar), Bereich \[-100,100]; je näher der Wert an -100 liegt, desto voller ist die Stimme; je näher der Wert an 100 liegt, desto klarer ist die Stimme
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Soundeffekt-Einstellung; pro Anfrage kann nur eine Option ausgewählt werden. Mögliche Werte:

      * `spacious_echo`（weiträumiges Echo）
      * `auditorium_echo`（Auditoriumsansage）
      * `lofi_telephone`（Telefonverzerrung）
      * `robotic`（elektronischer Stimmeffekt）
    </ParamField>
  </Expandable>
</ParamField>

## Antwortparameter

<ResponseField name="task_id" type="string" required={true}>
  Die task\_id der asynchronen Aufgabe. Sie sollten diese task\_id verwenden, um die [API zum Abfragen des Aufgabenergebnisses](/de/docs/models/reference-get-async-task-result) anzufordern und das Generierungsergebnis zu erhalten
</ResponseField>
