> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax Speech-2.6-hd synchrone Sprachsynthese

Diese API unterstützt die synchrone Generierung von Text-zu-Sprache, mit maximal 10000 Zeichen pro Textübertragung. Sie unterstützt 100+ Systemstimmen sowie frei auswählbare geklonte Stimmen; Anpassungen von Lautstärke, Tonhöhe, Sprechgeschwindigkeit und Ausgabeformat; proportionale Stimmmischung und Steuerung fester Intervallzeiten; sowie verschiedene Audiospezifikationen und -formate, darunter: mp3, pcm, flac, wav, mit Unterstützung für Streaming-Ausgabe.

Nach dem Absenden einer Anfrage zur Sprachsynthese für langen Text ist zu beachten, dass die zurückgegebene url ab dem Zeitpunkt der Rückgabe 24 Stunden gültig ist. Bitte achten Sie auf den Zeitpunkt des Downloads der Informationen.

<Tip>Geeignet für Szenarien wie Kurzsatzgenerierung, Sprachchat und Online-Socializing. Die Verarbeitung dauert nur kurz, aber die Textlängenbegrenzung liegt unter 10000 Zeichen. Für lange Texte wird die Verwendung von [asynchroner Sprachsynthese](/de/docs/models/reference-minimax-speech-2.6-hd-async) empfohlen.</Tip>

## Anfrage-Header

<ParamField header="Content-Type" type="string" required={true}>
  Enumerationswert: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer-Authentifizierungsformat: Bearer \{\{API Key}}.
</ParamField>

## Anfragebody

<ParamField body="text" type="string" required={true}>
  Der zu synthetisierende Text, mit einer Längenbegrenzung von weniger als 10000 Zeichen. Absatzwechsel werden durch Zeilenumbrüche ersetzt. (Wenn die Intervallzeit innerhalb der Sprache gesteuert werden soll, fügen Sie zwischen Zeichen \<#x#> ein, wobei x in Sekunden angegeben wird, 0.01-99.99 unterstützt und maximal zwei Dezimalstellen erlaubt sind.) Benutzerdefinierte Sprachintervalle zwischen Texten werden unterstützt, um benutzerdefinierte Pausenzeiten in der Text-zu-Sprache-Ausgabe zu erzielen. Zu beachten ist, dass die Textintervallzeit zwischen zwei aussprechbaren Textabschnitten gesetzt werden muss und nicht mehrere aufeinanderfolgende Zeitintervalle gesetzt werden dürfen.
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="properties">
    <ParamField body="speed" type="float" default="1.0">
      Bereich \[0.5,2], Standardwert ist 1.0

      Die Sprechgeschwindigkeit der generierten Stimme. Optional; je größer der Wert, desto schneller die Sprechgeschwindigkeit.
    </ParamField>

    <ParamField body="vol" type="float" default="1.0">
      Bereich (0,10], Standardwert ist 1.0

      Die Lautstärke der generierten Stimme. Optional; je größer der Wert, desto höher die Lautstärke.
    </ParamField>

    <ParamField body="pitch" type="int" default="0">
      Bereich \[-12,12], Standardwert ist 0

      Die Tonhöhe der generierten Stimme. Optional; (0 entspricht der Ausgabe der Originalstimme, der Wert muss eine Ganzzahl sein).
    </ParamField>

    <ParamField body="voice_id" type="string">
      Die angeforderte Stimmen-ID. Entweder voice\_id oder timbre\_weights ist "erforderlich".

      Unterstützt zwei Arten: Systemstimmen (id) und geklonte Stimmen (id). Die Systemstimmen (ID) sind wie folgt:

      * Unerfahrene junge Männerstimme: `male-qn-qingse`
      * Elite-Jugendstimme: `male-qn-jingying`
      * Dominante junge Männerstimme: `male-qn-badao`
      * Stimme eines jungen Studenten: `male-qn-daxuesheng`
      * Mädchenstimme: `female-shaonv`
      * Reife weibliche Stimme: `female-yujie`
      * Erwachsene Frauenstimme: `female-chengshu`
      * Süße Frauenstimme: `female-tianmei`
      * Männlicher Moderator: `presenter_male`
      * Weibliche Moderatorin: `presenter_female`
      * Männliches Hörbuch 1: `audiobook_male_1`
      * Männliches Hörbuch 2: `audiobook_male_2`
      * Weibliches Hörbuch 1: `audiobook_female_1`
      * Weibliches Hörbuch 2: `audiobook_female_2`
      * Unerfahrene junge Männerstimme-beta: `male-qn-qingse-jingpin`
      * Elite-Jugendstimme-beta: `male-qn-jingying-jingpin`
      * Dominante junge Männerstimme-beta: `male-qn-badao-jingpin`
      * Stimme eines jungen Studenten-beta: `male-qn-daxuesheng-jingpin`
      * Mädchenstimme-beta: `female-shaonv-jingpin`
      * Reife weibliche Stimme-beta: `female-yujie-jingpin`
      * Erwachsene Frauenstimme-beta: `female-chengshu-jingpin`
      * Süße Frauenstimme-beta: `female-tianmei-jingpin`
      * Kluger Junge: `clever_boy`
      * Süßer Junge: `cute_boy`
      * Niedliches Mädchen: `lovely_girl`
      * Cartoon-Schwein Xiaoqi: `cartoon_pig`
      * Yandere-jüngerer Bruder: `bingjiao_didi`
      * Gutaussehender Freund: `junlang_nanyou`
      * Unschuldiger jüngerer Mitschüler: `chunzhen_xuedi`
      * Kühler älterer Mitschüler: `lengdan_xiongzhang`
      * Dominanter junger Herr: `badao_shaoye`
      * Süße Xiaoling: `tianxin_xiaoling`
      * Verspieltes niedliches Mädchen: `qiaopi_mengmei`
      * Verführerische reife Frauenstimme: `wumei_yujie`
      * Süßlich sprechende jüngere Mitschülerin: `diadia_xuemei`
      * Elegante ältere Mitschülerin: `danya_xuejie`
      * Santa Claus: `Santa_Claus`
      * Grinch: `Grinch`
      * Rudolph: `Rudolph`
      * Arnold: `Arnold`
      * Charming Santa: `Charming_Santa`
      * Charming Lady: `Charming_Lady`
      * Sweet Girl: `Sweet_Girl`
      * Cute Elf: `Cute_Elf`
      * Attractive Girl: `Attractive_Girl`
      * Serene Woman: `Serene_Woman`
    </ParamField>

    <ParamField body="emotion" type="string">
      Steuert die Emotion der synthetisierten Sprache;

      Derzeit werden 7 Emotionen unterstützt: glücklich, traurig, wütend, ängstlich, angewidert, überrascht, neutral;

      Parameterbereich: `["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]`
    </ParamField>

    <ParamField body="latex_read" type="bool" default="false">
      Steuert, ob das Vorlesen von latex-Formeln unterstützt wird. Standardmäßig false.

      Zu beachten:

      1. Formeln in der Anfrage müssen am Anfang und Ende der Formel mit \$\$ versehen werden;
      2. Wenn Formeln in der Anfrage "" enthalten, muss dies zu "\\" escaped werden.

      Beispiel: Die Grundformel der Ableitung lautet `$$\\frac{d}{dx}(x^n) = nx^{n-1}$$`
    </ParamField>

    <ParamField body="text_normalization" type="bool" default="false">
      Dieser Parameter unterstützt die Normalisierung englischer Texte und kann die Leistung in Szenarien zum Vorlesen von Zahlen verbessern, erhöht jedoch geringfügig die Latenz. Wenn nicht angegeben, ist der Standardwert false.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="properties">
    <ParamField body="sample_rate" type="int" default="32000">
      Bereich 【8000，16000，22050，24000，32000，44100】

      Die Abtastrate der generierten Stimme. Optional, Standardwert ist 32000.
    </ParamField>

    <ParamField body="bitrate" type="int" default="128000">
      Bereich 【32000，64000，128000，256000】

      Die Bitrate der generierten Stimme. Optional, Standardwert ist 128000. Dieser Parameter wirkt sich nur auf Audio im mp3-Format aus.
    </ParamField>

    <ParamField body="format" type="string" default="mp3">
      Das generierte Audioformat. Standardmäßig mp3, Bereich \[mp3,pcm,flac,wav]. wav wird nur bei Nicht-Streaming-Ausgabe unterstützt.
    </ParamField>

    <ParamField body="channel" type="int" default="1">
      Die Anzahl der Kanäle des generierten Audios. Standard 1: Mono, optional:

      1: Mono

      2: Stereo
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="properties">
    <ParamField body="tone" type="list">
      Ersetzt Text, Symbole und die entsprechende Aussprache, die eine besondere Markierung benötigen.

      Aussprache ersetzen (Ton anpassen/andere Zeichenaussprache ersetzen), Format wie folgt:

      `["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]`

      Töne werden durch Zahlen ersetzt: erster Ton (Yinping) ist 1, zweiter Ton (Yangping) ist 2, dritter Ton (fallend-steigend) ist 3, vierter Ton (fallend) ist 4, neutraler Ton ist 5.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="timbre_weights" type="object[]">
  Entweder dies oder voice\_id ist erforderlich

  <Expandable title="properties">
    <ParamField body="voice_id" type="string">
      Die angeforderte Stimmen-id. Muss gemeinsam mit dem Parameter weight angegeben werden.
    </ParamField>

    <ParamField body="weight" type="int">
      Bereich \[1,100]

      Gewichtung; muss gemeinsam mit voice\_id angegeben werden. Es werden maximal 4 Stimmen gemischt unterstützt. Der Wert muss eine Ganzzahl sein; je höher der Anteil einer einzelnen Stimme, desto ähnlicher ist die synthetisierte Stimme dieser Stimme.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="stream" type="boolean" default="false">
  Ob Streaming verwendet wird. Standardmäßig false, d. h. Streaming ist nicht aktiviert.
</ParamField>

<ParamField body="stream_options" type="object">
  <Expandable title="properties">
    <ParamField body="exclude_aggregated_audio" type="boolean" default="false">
      Wenn dieser Parameter auf True gesetzt ist, enthält der letzte Chunk im Streaming nicht die zusammengefügten vollständigen Sprachdaten im hex-Format. Standardmäßig False, d. h. der letzte Chunk enthält die zusammengefügten vollständigen Sprachdaten im hex-Format.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="language_boost" type="string" default="null">
  Verbessert die Erkennung für bestimmte kleinere Sprachen und Dialekte. Nach der Einstellung kann die Sprachleistung in Szenarien mit der angegebenen Kleinsprache/dem angegebenen Dialekt verbessert werden. Wenn der Typ der Kleinsprache nicht eindeutig ist, kann "auto" gewählt werden; das Modell bestimmt den Typ der Kleinsprache selbstständig. Unterstützte Werte:

  `'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'`
</ParamField>

<ParamField body="output_format" type="string" default="hex">
  Parameter zur Steuerung der Ausgabeform des Ergebnisses. Mögliche Werte sind `url` `hex`. Standardwert ist `hex`. Dieser Parameter gilt nur für Nicht-Streaming-Szenarien; in Streaming-Szenarien wird ausschließlich die Rückgabe in hex-Form unterstützt. Die zurückgegebene url ist 24 Stunden gültig.
</ParamField>

<ParamField body="voice_modify" type="object">
  Einstellung für Stimmeffekte; dieser Parameter unterstützt die folgenden Audioformate:

  * Nicht-Streaming: mp3, wav, flac
  * Streaming: mp3

  <Expandable title="properties">
    <ParamField body="pitch" type="integer">
      Tonhöhenanpassung (tief/hell), Bereich \[-100,100]. Werte nahe -100 machen die Stimme tiefer; Werte nahe 100 machen die Stimme heller.
    </ParamField>

    <ParamField body="intensity" type="integer">
      Intensitätsanpassung (kraftvoll/weich), Bereich \[-100,100]. Werte nahe -100 machen die Stimme kräftiger; Werte nahe 100 machen die Stimme sanfter.
    </ParamField>

    <ParamField body="timbre" type="integer">
      Klangfarbenanpassung (magnetisch/klar), Bereich \[-100,100]. Werte nahe -100 machen die Stimme voller; Werte nahe 100 machen die Stimme klarer.
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Soundeffekt-Einstellung; pro Anfrage kann nur eine Option gewählt werden. Mögliche Werte:

      * `spacious_echo`（weiter Hall）
      * `auditorium_echo`（Aula-Durchsage）
      * `lofi_telephone`（Telefonverzerrung）
      * `robotic`（elektronische Stimme）
    </ParamField>
  </Expandable>
</ParamField>

## Antwortinformationen

<ResponseField name="audio" type="string">
  Das synthetisierte Audiosegment, hex-codiert und gemäß dem in der Eingabe definierten Format (`audio_setting.format`) generiert (mp3/pcm/flac). Die Rückgabeform richtet sich nach der Definition von `output_format`; wenn `stream` true ist, wird nur die Rückgabeform hex unterstützt.
</ResponseField>

<ResponseField name="status" type="number">
  Aktueller Status des Audiostreams, wird nur zurückgegeben, wenn `stream` true ist. 1 bedeutet Synthese läuft, 2 bedeutet Synthese abgeschlossen.
</ResponseField>
