> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabs Text-to-Speech Flash V2

Konvertiert Text mit der von Ihnen gewählten Stimme in Sprache und gibt Audio zurück.

## Anfrageheader

<ParamField header="Content-Type" type="string" required={true}>
  Enumerationswert: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer-Authentifizierungsformat: Bearer \{\{API-Schlüssel}}.
</ParamField>

## Anfragetext

<ParamField body="seed" type="integer">
  Falls angegeben, versucht das System, so deterministisch wie möglich zu sampeln. Wiederholte Anfragen mit demselben seed und denselben Parametern sollten dasselbe Ergebnis zurückgeben, eine vollständige Deterministik wird jedoch nicht garantiert.

  Wertebereich: \[0, 4294967295]
</ParamField>

<ParamField body="text" type="string" required={true}>
  Der Text, der in Sprache konvertiert werden soll.
</ParamField>

<ParamField body="stream" type="boolean">
  Ob der Stream-Modus aktiviert werden soll.
</ParamField>

<ParamField body="voice_id" type="string" required={true}>
  Die zu verwendende Sprach-ID.
</ParamField>

<ParamField body="next_text" type="string">
  Der Text nach dem Text der aktuellen Anfrage. Wird verwendet, um die Sprachkohärenz beim Zusammenfügen mehrerer Generierungen zu verbessern.
</ParamField>

<ParamField body="language_code" type="string">
  Sprachcode (ISO 639-1), der für das Modell und die Textnormalisierung verwendet wird. Wenn das Modell diesen Sprachcode nicht unterstützt, wird ein Fehler zurückgegeben.
</ParamField>

<ParamField body="output_format" type="string" default="mp3_44100_128">
  Ausgabeformat des generierten Audios. Das Format lautet codec\_sample\_rate\_bitrate. Eine Bitrate von 192 kbps für MP3 erfordert ein Creator-Konto oder höher; eine Abtastrate von 44,1 kHz für PCM erfordert ein Pro-Konto oder höher.

  Optionale Werte: `mp3_22050_32`, `mp3_24000_48`, `mp3_44100_32`, `mp3_44100_64`, `mp3_44100_96`, `mp3_44100_128`, `mp3_44100_192`, `pcm_8000`, `pcm_16000`, `pcm_22050`, `pcm_24000`, `pcm_32000`, `pcm_44100`, `pcm_48000`, `ulaw_8000`, `alaw_8000`, `opus_48000_32`, `opus_48000_64`, `opus_48000_96`, `opus_48000_128`, `opus_48000_192`
</ParamField>

<ParamField body="previous_text" type="string">
  Der Text vor dem Text der aktuellen Anfrage. Wird verwendet, um die Sprachkohärenz beim Zusammenfügen mehrerer Generierungen zu verbessern.
</ParamField>

<ParamField body="use_pvc_as_ivc" type="boolean" default={false}>
  Wenn true, wird die IVC-Version der Stimme anstelle der PVC-Version verwendet. Dies ist eine temporäre Lösung für die höhere Latenz der PVC-Version.
</ParamField>

<ParamField body="voice_settings" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="speed" type="number" default={1}>
      Passt die Geschwindigkeit der Stimme an. 1.0 ist die Standardgeschwindigkeit; Werte kleiner als 1.0 verlangsamen das Sprechtempo, Werte größer als 1.0 beschleunigen es.
    </ParamField>

    <ParamField body="style" type="number" default={0}>
      Bestimmt, wie stark der Sprachstil überzeichnet wird. Versucht, den Stil des ursprünglichen Sprechers zu verstärken. Bei einem Wert ungleich 0 werden mehr Rechenressourcen verbraucht und die Latenz kann steigen.
    </ParamField>

    <ParamField body="stability" type="number" default={0.5}>
      Bestimmt die Stabilität der Sprachgenerierung und die Zufälligkeit zwischen einzelnen Generierungen. Niedrigere Werte sorgen für eine größere emotionale Bandbreite, höhere Werte können zu monotoner Sprache führen.
    </ParamField>

    <ParamField body="similarity_boost" type="number" default={0.75}>
      Bestimmt, wie eng sich die KI beim Versuch, die ursprüngliche Stimme nachzubilden, an diese annähert.
    </ParamField>

    <ParamField body="use_speaker_boost" type="boolean" default={true}>
      Erhöht die Ähnlichkeit mit dem ursprünglichen Sprecher. Benötigt etwas mehr Rechenleistung und erhöht die Latenz.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="next_request_ids" type="string[]">
  Liste der request\_id nachfolgender Samples. Wird verwendet, um die Sprachkohärenz beim erneuten Generieren von Samples beizubehalten. Es können maximal 3 request\_id übergeben werden.

  Array-Länge: 0 - 3
</ParamField>

<ParamField body="previous_request_ids" type="string[]">
  Liste der request\_id von Samples, die vor der aktuellen Generierung bereits generiert wurden. Kann verwendet werden, um die Sprachkohärenz zu verbessern. Es können maximal 3 request\_id übergeben werden.

  Array-Länge: 0 - 3
</ParamField>

<ParamField body="apply_text_normalization" type="string" default="auto">
  Steuert die Textnormalisierung. 'auto' wird vom System entschieden, 'on' normalisiert immer, 'off' überspringt sie.

  Optionale Werte: `auto`, `on`, `off`
</ParamField>

<ParamField body="apply_language_text_normalization" type="boolean" default={false}>
  Steuert die sprachspezifische Textnormalisierung für bestimmte unterstützte Sprachen, um eine natürlichere Aussprache zu erzielen. Warnung: Dies kann die Latenz deutlich erhöhen. Derzeit wird nur Japanisch unterstützt.
</ParamField>

<ParamField body="pronunciation_dictionary_locators" type="object[]">
  Liste der Aussprachewörterbuch-Locators (id, version\_id), die auf den Text angewendet werden sollen. Sie werden der Reihe nach angewendet. Pro Anfrage sind maximal 3 Locators möglich.

  Array-Länge: 0 - 3

  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="version_id" type="string">
      Die ID der Version des Aussprachewörterbuchs. Wenn nicht angegeben, wird die neueste Version verwendet.
    </ParamField>

    <ParamField body="pronunciation_dictionary_id" type="string" required={true}>
      Die ID des Aussprachewörterbuchs.
    </ParamField>
  </Expandable>
</ParamField>

## Antwortinformationen

Generierte Audiodatei

Format: `binary`
