> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax Speech-2.6-turbo synchrone Sprachsynthese

Diese API unterstützt die synchrone Generierung von Text-zu-Sprache; die maximale Textlänge pro Übertragung beträgt 10000 Zeichen. Sie unterstützt 100+ Systemstimmen sowie die freie Auswahl geklonter Stimmen; Anpassungen von Lautstärke, Tonhöhe, Sprechgeschwindigkeit und Ausgabeformat; proportionales Mischen von Stimmen und die Steuerung fester Intervalle; außerdem verschiedene Audiospezifikationen und -formate, darunter: mp3, pcm, flac, wav, sowie Streaming-Ausgabe.

Nach dem Einreichen einer Anfrage zur Sprachsynthese für längere Texte ist zu beachten, dass die zurückgegebene url ab dem Zeitpunkt der Rückgabe 24 Stunden gültig ist. Bitte achten Sie auf den Zeitpunkt des Herunterladens der Informationen.

<Tip>Geeignet für Szenarien wie die Generierung kurzer Sätze, Sprachchats und Online-Social-Anwendungen. Die Verarbeitung ist schnell, die Textlänge ist jedoch auf weniger als 10000 Zeichen begrenzt. Für längere Texte wird die [asynchrone Sprachsynthese](/de/docs/models/reference-minimax-speech-2.6-turbo-async) empfohlen.</Tip>

## Request-Header

<ParamField header="Content-Type" type="string" required={true}>
  Enumerationswert: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer-Authentifizierungsformat: Bearer \{\{API Key}}.
</ParamField>

## Request-Body

<ParamField body="text" type="string" required={true}>
  Der zu synthetisierende Text. Die Länge muss unter 10000 Zeichen liegen; Absatzwechsel werden durch Zeilenumbrüche ersetzt. (Wenn Sie Pausen innerhalb der Sprache steuern möchten, fügen Sie zwischen Zeichen \<#x#> ein; x ist in Sekunden angegeben, unterstützt werden 0.01-99.99 mit maximal zwei Dezimalstellen.) Unterstützt benutzerdefinierte Zeitintervalle zwischen Textabschnitten, um benutzerdefinierte Sprechpausen zu realisieren. Beachten Sie, dass das Textintervall zwischen zwei aussprechbaren Textabschnitten gesetzt werden muss und nicht mehrere aufeinanderfolgende Zeitintervalle gesetzt werden dürfen.
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="Eigenschaften">
    <ParamField body="speed" type="float" default="1.0">
      Bereich \[0.5,2], Standardwert ist 1.0

      Die Sprechgeschwindigkeit der generierten Stimme. Optional; je größer der Wert, desto schneller die Sprechgeschwindigkeit.
    </ParamField>

    <ParamField body="vol" type="float" default="1.0">
      Bereich (0,10], Standardwert ist 1.0

      Die Lautstärke der generierten Stimme. Optional; je größer der Wert, desto höher die Lautstärke.
    </ParamField>

    <ParamField body="pitch" type="int" default="0">
      Bereich \[-12,12], Standardwert ist 0

      Die Tonhöhe der generierten Stimme. Optional; (0 gibt die Originalstimme aus, der Wert muss eine Ganzzahl sein).
    </ParamField>

    <ParamField body="voice_id" type="string">
      Die angeforderte Stimmen-ID. Entweder voice\_id oder timbre\_weights ist "erforderlich".

      Unterstützt zwei Arten: Systemstimmen (id) und geklonte Stimmen (id). Die Systemstimmen (ID) lauten:

      * Schüchterne junge Männerstimme: `male-qn-qingse`
      * Elite-Jugendstimme: `male-qn-jingying`
      * Dominante junge Männerstimme: `male-qn-badao`
      * Stimme eines jungen Studenten: `male-qn-daxuesheng`
      * Mädchenstimme: `female-shaonv`
      * Reife ältere Schwester-Stimme: `female-yujie`
      * Reife Frauenstimme: `female-chengshu`
      * Süße Frauenstimme: `female-tianmei`
      * Männlicher Moderator: `presenter_male`
      * Weibliche Moderatorin: `presenter_female`
      * Männliches Hörbuch 1: `audiobook_male_1`
      * Männliches Hörbuch 2: `audiobook_male_2`
      * Weibliches Hörbuch 1: `audiobook_female_1`
      * Weibliches Hörbuch 2: `audiobook_female_2`
      * Schüchterne junge Männerstimme-beta: `male-qn-qingse-jingpin`
      * Elite-Jugendstimme-beta: `male-qn-jingying-jingpin`
      * Dominante junge Männerstimme-beta: `male-qn-badao-jingpin`
      * Stimme eines jungen Studenten-beta: `male-qn-daxuesheng-jingpin`
      * Mädchenstimme-beta: `female-shaonv-jingpin`
      * Reife ältere Schwester-Stimme-beta: `female-yujie-jingpin`
      * Reife Frauenstimme-beta: `female-chengshu-jingpin`
      * Süße Frauenstimme-beta: `female-tianmei-jingpin`
      * Kluger Junge: `clever_boy`
      * Süßer Junge: `cute_boy`
      * Liebenswertes Mädchen: `lovely_girl`
      * Cartoon-Schwein Xiaoqi: `cartoon_pig`
      * Yandere-jüngerer Bruder: `bingjiao_didi`
      * Attraktiver Freund: `junlang_nanyou`
      * Unschuldiger jüngerer Mitschüler: `chunzhen_xuedi`
      * Kühler älterer Mitschüler: `lengdan_xiongzhang`
      * Dominanter junger Herr: `badao_shaoye`
      * Sweetheart Xiaoling: `tianxin_xiaoling`
      * Verspieltes, niedliches Mädchen: `qiaopi_mengmei`
      * Verführerische ältere Schwester-Stimme: `wumei_yujie`
      * Süßliche jüngere Mitschülerin: `diadia_xuemei`
      * Elegante ältere Mitschülerin: `danya_xuejie`
      * Santa Claus: `Santa_Claus`
      * Grinch: `Grinch`
      * Rudolph: `Rudolph`
      * Arnold: `Arnold`
      * Charming Santa: `Charming_Santa`
      * Charming Lady: `Charming_Lady`
      * Sweet Girl: `Sweet_Girl`
      * Cute Elf: `Cute_Elf`
      * Attractive Girl: `Attractive_Girl`
      * Serene Woman: `Serene_Woman`
    </ParamField>

    <ParamField body="emotion" type="string">
      Steuert die Emotion der synthetisierten Sprache;

      Derzeit werden 7 Emotionen unterstützt: Freude, Traurigkeit, Wut, Angst, Ekel, Überraschung, neutral;

      Parameterbereich: `["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]`
    </ParamField>

    <ParamField body="latex_read" type="bool" default="false">
      Steuert, ob das Vorlesen von latex-Formeln unterstützt wird; der Standardwert ist false.

      Zu beachten:

      1. Formeln in der Anfrage müssen am Anfang und Ende der Formel mit \$\$ versehen werden;
      2. Wenn Formeln in der Anfrage "" enthalten, muss dies zu "\\" escaped werden.

      Beispiel: Die grundlegende Formel der Ableitung ist `$$\\frac{d}{dx}(x^n) = nx^{n-1}$$`
    </ParamField>

    <ParamField body="text_normalization" type="bool" default="false">
      Dieser Parameter unterstützt die Normalisierung englischer Texte und kann die Leistung in Szenarien mit Zahlenvorlesen verbessern, erhöht jedoch die Latenz geringfügig. Wenn nicht angegeben, ist der Standardwert false.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="Eigenschaften">
    <ParamField body="sample_rate" type="int" default="32000">
      Bereich 【8000，16000，22050，24000，32000，44100】

      Die Abtastrate der generierten Stimme. Optional, Standardwert ist 32000.
    </ParamField>

    <ParamField body="bitrate" type="int" default="128000">
      Bereich 【32000，64000，128000，256000】

      Die Bitrate der generierten Stimme. Optional, Standardwert ist 128000. Dieser Parameter ist nur für Audio im mp3-Format wirksam.
    </ParamField>

    <ParamField body="format" type="string" default="mp3">
      Das generierte Audioformat. Standard ist mp3, Bereich \[mp3,pcm,flac,wav]. wav wird nur bei nicht gestreamter Ausgabe unterstützt.
    </ParamField>

    <ParamField body="channel" type="int" default="1">
      Anzahl der Kanäle des generierten Audios. Standard 1: Mono, optional:

      1: Mono

      2: Stereo
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="Eigenschaften">
    <ParamField body="tone" type="list">
      Ersetzt Texte, Symbole und die entsprechenden Aussprachen, die speziell markiert werden müssen.

      Aussprache ersetzen (Ton anpassen/andere Zeichenaussprache ersetzen), Format wie folgt:

      `["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]`

      Töne werden durch Zahlen ersetzt: erster Ton (Yinping) ist 1, zweiter Ton (Yangping) ist 2, dritter Ton (Shangsheng) ist 3, vierter Ton (Qusheng) ist 4), neutraler Ton ist 5.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="timbre_weights" type="object[]">
  Entweder voice\_id oder timbre\_weights ist erforderlich

  <Expandable title="Eigenschaften">
    <ParamField body="voice_id" type="string">
      Die angeforderte Stimmen-id. Muss zusammen mit dem Parameter weight ausgefüllt werden.
    </ParamField>

    <ParamField body="weight" type="int">
      Bereich \[1,100]

      Gewichtung; muss zusammen mit voice\_id ausgefüllt werden. Es werden maximal 4 gemischte Stimmen unterstützt. Der Wert muss eine Ganzzahl sein; je höher der Anteil einer einzelnen Stimme, desto ähnlicher ist die synthetisierte Stimme dieser Stimme.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="stream" type="boolean" default="false">
  Ob Streaming verwendet wird. Standard ist false, d. h. Streaming ist nicht aktiviert.
</ParamField>

<ParamField body="stream_options" type="object">
  <Expandable title="Eigenschaften">
    <ParamField body="exclude_aggregated_audio" type="boolean" default="false">
      Wenn dieser Parameter auf True gesetzt ist, enthält der letzte chunk beim Streaming nicht die zusammengefügten vollständigen Sprachdaten im hex-Format. Standard ist False, d. h. der letzte chunk enthält die zusammengefügten vollständigen Sprachdaten im hex-Format.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="language_boost" type="string" default="null">
  Verbessert die Erkennung bestimmter kleinerer Sprachen und Dialekte. Nach der Einstellung kann die Sprachleistung in Szenarien mit der angegebenen kleineren Sprache/dem angegebenen Dialekt verbessert werden. Wenn der Typ der kleineren Sprache nicht eindeutig ist, kann "auto" gewählt werden; das Modell bestimmt dann den Typ der kleineren Sprache selbstständig. Unterstützt die folgenden Werte:

  `'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'`
</ParamField>

<ParamField body="output_format" type="string" default="hex">
  Parameter zur Steuerung der Form des Ausgabeergebnisses. Mögliche Werte sind `url` `hex`. Standardwert ist `hex`. Dieser Parameter ist nur in nicht gestreamten Szenarien wirksam; Streaming-Szenarien unterstützen nur die Rückgabe in hex-Form. Die zurückgegebene url ist 24 Stunden gültig.
</ParamField>

<ParamField body="voice_modify" type="object">
  Einstellungen für Stimmeffekte. Dieser Parameter unterstützt die folgenden Audioformate:

  * Nicht gestreamt: mp3, wav, flac
  * Gestreamt: mp3

  <Expandable title="Eigenschaften">
    <ParamField body="pitch" type="integer">
      Tonhöhenanpassung (tief/hell), Bereich \[-100,100]. Je näher der Wert an -100 liegt, desto tiefer klingt die Stimme; je näher an 100, desto heller klingt die Stimme
    </ParamField>

    <ParamField body="intensity" type="integer">
      Intensitätsanpassung (kraftvoll/weich), Bereich \[-100,100]. Je näher der Wert an -100 liegt, desto kräftiger klingt die Stimme; je näher an 100, desto weicher klingt sie
    </ParamField>

    <ParamField body="timbre" type="integer">
      Klangfarbenanpassung (magnetisch/klar), Bereich \[-100,100]. Je näher der Wert an -100 liegt, desto voller klingt die Stimme; je näher der Wert an 100 liegt, desto klarer klingt sie
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Soundeffekt-Einstellung; pro Anfrage kann nur eine Option ausgewählt werden. Mögliche Werte:

      * `spacious_echo`（weiter Echoeffekt）
      * `auditorium_echo`（Aula-Übertragung）
      * `lofi_telephone`（Telefonverzerrung）
      * `robotic`（elektronischer Sound）
    </ParamField>
  </Expandable>
</ParamField>

## Antwortinformationen

<ResponseField name="audio" type="string">
  Das synthetisierte Audiosegment, hex-codiert und gemäß dem in der Eingabe definierten Format (`audio_setting.format`) generiert (mp3/pcm/flac). Die Rückgabeform richtet sich nach der Definition von `output_format`; wenn `stream` true ist, wird nur die Rückgabe in hex-Form unterstützt.
</ResponseField>

<ResponseField name="status" type="number">
  Aktueller Status des Audiostreams, wird nur zurückgegeben, wenn `stream` true ist. 1 bedeutet Synthese läuft, 2 bedeutet Synthese beendet.
</ResponseField>
