> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax Speech 2.8 HD – Asynchrone Sprachsynthese

Verwenden Sie diese Schnittstelle, um eine asynchrone Sprachsynthese-Aufgabe zu erstellen. Text- oder Dateieingaben werden unterstützt; die Textlänge ist auf maximal 50.000 Zeichen begrenzt, Dateien auf maximal 100.000 Zeichen.

<Tip>
  Dies ist eine **asynchrone** API und gibt nur die task\_id der asynchronen Aufgabe zurück. Verwenden Sie diese task\_id, um die [API zum Abfragen des Aufgabenergebnisses](/de/docs/models/reference-get-async-task-result) aufzurufen und das generierte Ergebnis abzurufen.
</Tip>

## Anfrageheader

<ParamField header="Content-Type" type="string" required={true}>
  Enumerationswert: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer-Authentifizierungsformat: Bearer \{\{API Key}}.
</ParamField>

## Anfragetext

<ParamField body="text" type="string">
  Der Text, aus dem Audio synthetisiert werden soll; maximal 50.000 Zeichen. Entweder `text` oder `text_file_id` ist erforderlich.<br /><br />• Interjektions-Tags: Nur wenn das Modell `speech-2.8-hd` oder `speech-2.8-turbo` ausgewählt ist, wird das Einfügen von Interjektions-Tags in den Text unterstützt. Unterstützte Interjektionen: `(laughs)` (Lachen), `(chuckle)` (Kichern), `(coughs)` (Husten), `(clear-throat)` (Räuspern), `(groans)` (Stöhnen), `(breath)` (normales Atmen), `(pant)` (Hecheln), `(inhale)` (Einatmen), `(exhale)` (Ausatmen), `(gasps)` (nach Luft schnappen), `(sniffs)` (Schniefen), `(sighs)` (Seufzen), `(snorts)` (Schnauben), `(burps)` (Rülpsen), `(lip-smacking)` (Schmatzen), `(humming)` (Summen), `(hissing)` (Zischen), `(emm)` (ähm), `(whistles)` (Pfeifen), `(sneezes)` (Niesen), `(crying)` (Schluchzen), `(applause)` (Applaus)
</ParamField>

<ParamField body="text_file_id" type="integer">
  Die ID der Textdatei, aus der Audio synthetisiert werden soll. Die Länge einer einzelnen Datei muss unter 100.000 Zeichen liegen. Unterstützte Dateiformate: txt, zip. Entweder `text` oder `text_file_id` ist erforderlich; nach der Übergabe wird das Format automatisch geprüft.<br />• **txt-Datei**: Längenbegrenzung \<100000 Zeichen. Unterstützt die Verwendung von `&lt;#x#&gt;` zur Markierung benutzerdefinierter Pausen. x ist die Pausendauer (Einheit: Sekunden) im Bereich \[0.01, 99.99] mit maximal zwei Dezimalstellen. Beachten Sie, dass Pausen zwischen zwei aussprechbaren Textabschnitten gesetzt werden müssen; mehrere Pausenmarkierungen dürfen nicht direkt hintereinander verwendet werden.<br />• **zip-Datei**:<br />• Das Archiv muss txt- oder json-Dateien desselben Formats enthalten.<br />• json-Dateiformat: Unterstützt die drei Felder \[`title`, `content`, `extra`], die jeweils Titel, Haupttext und Zusatzinformationen darstellen. Wenn alle drei Felder vorhanden sind, werden 3 Ergebnisgruppen mit insgesamt 9 Dateien erzeugt und einheitlich in einem Ordner abgelegt. Wenn ein Feld nicht vorhanden ist oder der Inhalt leer ist, wird für dieses Feld kein entsprechendes Ergebnis generiert.
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="Eigenschaften" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Anpassung der Tonhöhe (dumpf/hell), Bereich \[-100, 100]. Je näher der Wert an -100 liegt, desto tiefer wirkt die Stimme; je näher an 100, desto heller.

      Wertebereich: \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Anpassung der Klangfarbe (magnetisch/klar), Bereich \[-100, 100]. Je näher der Wert an -100 liegt, desto voller wirkt die Stimme; je näher an 100, desto klarer.

      Wertebereich: \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Anpassung der Intensität (kraftvoll/weich), Bereich \[-100, 100]. Je näher der Wert an -100 liegt, desto kräftiger wirkt die Stimme; je näher an 100, desto sanfter.

      Wertebereich: \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Einstellung von Soundeffekten; pro Aufruf kann nur eine Option ausgewählt werden. Mögliche Werte:

      1. spacious\_echo (weiter Hall)
      2. auditorium\_echo (Aula-/Hallendurchsage)
      3. lofi\_telephone (Telefonverzerrung)
      4. robotic (elektronischer Stimmeffekt)

      Zulässige Werte: `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="Eigenschaften" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Format des generierten Audios. Mögliche Werte: \[mp3, pcm, flac], Standardwert ist `mp3`

      Zulässige Werte: `mp3`, `pcm`, `flac`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Bitrate des generierten Audios. Mögliche Werte: \[32000, 64000, 128000, 256000], Standardwert ist `128000`. Dieser Parameter gilt nur für Audio im Format `mp3`.
    </ParamField>

    <ParamField body="channel" type="integer" default={2}>
      Anzahl der Kanäle des generierten Audios. Mögliche Werte: \[1, 2], wobei `1` für Mono und `2` für Stereo steht. Standardwert ist 1.
    </ParamField>

    <ParamField body="audio_sample_rate" type="integer" default={32000}>
      Abtastrate des generierten Audios. Mögliche Werte: \[8000, 16000, 22050, 24000, 32000, 44100], Standardwert ist `32000`.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="Eigenschaften" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Lautstärke des synthetisierten Audios. Je größer der Wert, desto höher die Lautstärke. Wertebereich (0, 10], Standardwert ist 1.0.

      Wertebereich: \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Intonation des synthetisierten Audios. Wertebereich \[-12, 12], Standardwert ist 0, wobei 0 die Ausgabe in der ursprünglichen Klangfarbe bedeutet.

      Wertebereich: \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Sprechgeschwindigkeit des synthetisierten Audios. Je größer der Wert, desto schneller die Sprechgeschwindigkeit. Wertebereich \[0.5, 2], Standardwert ist 1.0.

      Wertebereich: \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Steuert die Emotion der synthetisierten Sprache. Parameterbereich: \["happy", "sad", "angry", "fearful", "disgusted", "surprised", "calm", "fluent", "whisper"], entsprechend den Emotionen: fröhlich, traurig, wütend, ängstlich, angewidert, überrascht, neutral, lebendig, flüsternd
      <br />• Das Modell wählt automatisch eine passende Emotion basierend auf dem Eingabetext aus; in der Regel ist keine manuelle Angabe erforderlich.
      <br />• Dieser Parameter wirkt nur für die Modelle `speech-2.6-hd`, `speech-2.6-turbo`, `speech-01-hd`, `speech-01-turbo`.
      <br />• Die Optionen `fluent`, `whisper` wirken nur für die Modelle `speech-2.6-turbo`, `speech-2.6-hd`.

      Zulässige Werte: `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Klangfarben-ID des synthetisierten Audios. Wenn eine gemischte Klangfarbe festgelegt werden soll, setzen Sie den Parameter timber\_weights und lassen Sie diesen Parameter leer. Es werden drei Arten von Klangfarben unterstützt: Systemklangfarben, replizierte Klangfarben und per Text erzeugte Klangfarben. Nachfolgend finden Sie einige der neuesten Systemklangfarben (ID); Sie können alle offiziell unterstützten Klangfarben einsehen.
      <br />• **Chinesisch**:<br />• moss\_audio\_ce44fc67-7ce3-11f0-8de5-96e35d26fb85<br />• moss\_audio\_aaa1346a-7ce7-11f0-8e61-2e6e3c7ee85d<br />• Chinese (Mandarin)\_Lyrical\_Voice<br />• Chinese (Mandarin)\_HK\_Flight\_Attendant<br />• **Englisch**:<br />• English\_Graceful\_Lady<br />• English\_Insightful\_Speaker<br />• English\_radiant\_girl<br />• English\_Persuasive\_Man<br />• moss\_audio\_6dc281eb-713c-11f0-a447-9613c873494c<br />• moss\_audio\_570551b1-735c-11f0-b236-0adeeecad052<br />• moss\_audio\_ad5baf92-735f-11f0-8263-fe5a2fe98ec8<br />• English\_Lucky\_Robot<br />• **Japanisch**:<br />• Japanese\_Whisper\_Belle<br />• moss\_audio\_24875c4a-7be4-11f0-9359-4e72c55db738<br />• moss\_audio\_7f4ee608-78ea-11f0-bb73-1e2a4cfcd245<br />• moss\_audio\_c1a6a3ac-7be6-11f0-8e8e-36b92fbb4f95
    </ParamField>

    <ParamField body="english_normalization" type="boolean" default={false}>
      Unterstützt die Normalisierung englischer Texte. Nach der Aktivierung kann die Leistung in Szenarien mit Zahlenvorlesung verbessert werden, allerdings erhöht sich die Latenz geringfügig. Standardwert: false.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Steuert, ob am Ende des synthetisierten Audios eine Audio-Rhythmuskennung hinzugefügt wird. Standardwert ist False. Dieser Parameter wirkt nur bei nicht-streamender Synthese.
</ParamField>

<ParamField body="language_boost" type="string">
  Gibt an, ob die Erkennungsfähigkeit für bestimmte weniger verbreitete Sprachen und Dialekte verbessert werden soll. Standardwert ist `null`; kann auf `auto` gesetzt werden, damit das Modell selbstständig entscheidet.

  Zulässige Werte: `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Aktivieren Sie diesen Parameter, damit Übergänge zwischen Teilsätzen natürlicher wirken. Unterstützt nur die Modelle `speech-2.8-hd` und `speech-2.8-turbo`.
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="Eigenschaften" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Definiert Regeln für phonetische Annotationen oder Ausspracheersetzungen für Wörter oder Symbole, die speziell gekennzeichnet werden müssen. In chinesischen Texten werden Töne durch Zahlen dargestellt:
      erster Ton als `1`, zweiter Ton als `2`, dritter Ton als `3`, vierter Ton als `4`, neutraler Ton als `5`.
      Beispiele:
      \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Antwortinformationen

<ResponseField name="file_id" type="integer" required={false}>
  Die ID der entsprechenden Audiodatei, die nach erfolgreicher Erstellung der Aufgabe zurückgegeben wird.<br /><br />• Nachdem die Aufgabe abgeschlossen ist, kann sie über file\_id abgefragt werden. Bei einem Anfragefehler wird dieses Feld nicht zurückgegeben.

  Hinweis: Die zurückgegebene Download-URL ist ab ihrer Generierung 9 Stunden (32400 Sekunden) lang gültig. Nach Ablauf wird die Datei ungültig, und die generierten Informationen gehen verloren. Achten Sie daher auf den Zeitpunkt der Download-Informationen.
</ResponseField>

<ResponseField name="task_id" type="string" required={false}>
  Verwenden Sie task\_id, um die [API zum Abfragen des Aufgabenergebnisses](/de/docs/models/reference-get-async-task-result) aufzurufen und die generierte Ausgabe abzurufen.
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  <Expandable title="Eigenschaften" defaultOpen={true}>
    <ResponseField name="status_msg" type="string" required={true}>
      Statusdetails
    </ResponseField>

    <ResponseField name="status_code" type="integer" required={true}>
      Statuscode<br /><br />• `0`: Normal<br />• `1002`: Ratenbegrenzung<br />• `1004`: Authentifizierung fehlgeschlagen<br />• `1039`: TPM-Ratenbegrenzung ausgelöst<br />• `1042`: Ungültige Zeichen über 10 %<br />• `2013`: Parameterfehler
    </ResponseField>
  </Expandable>
</ResponseField>

<ResponseField name="task_token" type="string" required={false}>
  Schlüsselinfo, die zum Abschließen der aktuellen Aufgabe verwendet wurde
</ResponseField>

<ResponseField name="usage_characters" type="integer" required={false}>
  Anzahl der abrechnungsrelevanten Zeichen
</ResponseField>
