> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabs Text-to-Speech Multilingual V2

Konvertiert Text mit der von Ihnen gewählten Stimme in Sprache und gibt Audio zurück.

## Request-Header

<ParamField header="Content-Type" type="string" required={true}>
  Enum-Wert: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer-Authentifizierungsformat: Bearer \{\{API-Schlüssel}}.
</ParamField>

## Request-Body

<ParamField body="seed" type="integer">
  Falls angegeben, versucht das System, möglichst deterministisch zu samplen. Wiederholte Anfragen mit demselben seed und denselben Parametern sollten dasselbe Ergebnis zurückgeben, eine vollständige Deterministik ist jedoch nicht garantiert.

  Wertebereich: \[0, 4294967295]
</ParamField>

<ParamField body="text" type="string" required={true}>
  Der Text, der in Sprache konvertiert werden soll.
</ParamField>

<ParamField body="voice_id" type="string" required={true}>
  Die zu verwendende Sprach-ID.
</ParamField>

<ParamField body="next_text" type="string">
  Der Text nach dem Text der aktuellen Anfrage. Wird verwendet, um die Sprachkohärenz beim Zusammenfügen mehrerer Generierungen zu verbessern.
</ParamField>

<ParamField body="language_code" type="string">
  Sprachcode (ISO 639-1) für Modell und Textnormalisierung. Wenn das Modell diesen Sprachcode nicht unterstützt, wird ein Fehler zurückgegeben.
</ParamField>

<ParamField body="output_format" type="string" default="mp3_44100_128">
  Ausgabeformat des generierten Audios. Das Format ist codec\_sample\_rate\_bitrate. Eine MP3-Bitrate von 192 kbps erfordert ein Creator-Konto oder höher, eine PCM-Abtastrate von 44,1 kHz erfordert ein Pro-Konto oder höher.

  Mögliche Werte: `mp3_22050_32`, `mp3_24000_48`, `mp3_44100_32`, `mp3_44100_64`, `mp3_44100_96`, `mp3_44100_128`, `mp3_44100_192`, `pcm_8000`, `pcm_16000`, `pcm_22050`, `pcm_24000`, `pcm_32000`, `pcm_44100`, `pcm_48000`, `ulaw_8000`, `alaw_8000`, `opus_48000_32`, `opus_48000_64`, `opus_48000_96`, `opus_48000_128`, `opus_48000_192`
</ParamField>

<ParamField body="previous_text" type="string">
  Der Text vor dem Text der aktuellen Anfrage. Wird verwendet, um die Sprachkohärenz beim Zusammenfügen mehrerer Generierungen zu verbessern.
</ParamField>

<ParamField body="use_pvc_as_ivc" type="boolean" default={false}>
  Wenn true, wird die IVC-Version der Stimme anstelle der PVC-Version verwendet. Dies ist eine vorübergehende Lösung für die höhere Latenz der PVC-Version.
</ParamField>

<ParamField body="voice_settings" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="speed" type="number" default={1}>
      Passt die Geschwindigkeit der Sprache an. 1.0 ist die Standardgeschwindigkeit; Werte kleiner als 1.0 verlangsamen das Sprechtempo, Werte größer als 1.0 beschleunigen es.
    </ParamField>

    <ParamField body="style" type="number" default={0}>
      Bestimmt, wie stark der Sprachstil überzeichnet wird. Versucht, den Stil des ursprünglichen Sprechers zu verstärken. Bei einem Wert ungleich 0 werden mehr Rechenressourcen verbraucht, und die Latenz kann steigen.
    </ParamField>

    <ParamField body="stability" type="number" default={0.5}>
      Bestimmt die Stabilität der Sprachgenerierung und die Zufälligkeit zwischen einzelnen Generierungen. Niedrigere Werte ermöglichen ein breiteres emotionales Spektrum, höhere Werte können zu monotoner Sprache führen.
    </ParamField>

    <ParamField body="similarity_boost" type="number" default={0.75}>
      Bestimmt, wie genau die KI versucht, die ursprüngliche Stimme nachzubilden.
    </ParamField>

    <ParamField body="use_speaker_boost" type="boolean" default={true}>
      Verstärkt die Ähnlichkeit mit dem ursprünglichen Sprecher. Erfordert etwas mehr Rechenleistung und erhöht die Latenz.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="next_request_ids" type="string[]">
  Liste der request\_id nachfolgender Samples. Wird verwendet, um die Sprachkohärenz beim erneuten Generieren von Samples zu erhalten. Es können maximal 3 request\_id übergeben werden.

  Array-Länge: 0 - 3
</ParamField>

<ParamField body="previous_request_ids" type="string[]">
  Liste der request\_id bereits generierter Samples vor der aktuellen Generierung. Kann verwendet werden, um die Sprachkohärenz zu verbessern. Es können maximal 3 request\_id übergeben werden.

  Array-Länge: 0 - 3
</ParamField>

<ParamField body="apply_text_normalization" type="string" default="auto">
  Steuert die Textnormalisierung. 'auto' wird vom System entschieden, 'on' normalisiert immer, 'off' überspringt sie.

  Mögliche Werte: `auto`, `on`, `off`
</ParamField>

<ParamField body="apply_language_text_normalization" type="boolean" default={false}>
  Steuert die sprachspezifische Textnormalisierung für bestimmte unterstützte Sprachen, um eine natürlichere Aussprache zu erreichen. Warnung: Kann die Latenz erheblich erhöhen. Derzeit wird nur Japanisch unterstützt.
</ParamField>

<ParamField body="pronunciation_dictionary_locators" type="object[]">
  Liste der Aussprachewörterbuch-Locators (id, version\_id), die auf den Text angewendet werden sollen. Sie werden der Reihe nach angewendet. Pro Anfrage sind maximal 3 Locators zulässig.

  Array-Länge: 0 - 3

  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="version_id" type="string">
      Die ID der Aussprachewörterbuch-Version. Wenn nicht angegeben, wird die neueste Version verwendet.
    </ParamField>

    <ParamField body="pronunciation_dictionary_id" type="string" required={true}>
      Die ID des Aussprachewörterbuchs.
    </ParamField>
  </Expandable>
</ParamField>

## Antwortinformationen

Generierte Audiodatei

Format: `binary`
