> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabs Sprache-zu-Text V2

Transkribiert Audio- oder Videodateien. Wenn use\_multi\_channel true ist und die hochgeladene Audiodatei mehrere Kanäle hat, wird ein 'transcripts'-Objekt zurückgegeben, mit einer Transkription pro Kanal. Andernfalls wird ein einzelnes Transkriptionsergebnis zurückgegeben.

## Anfrageheader

<ParamField header="Content-Type" type="string" required={true}>
  Enum-Wert: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer-Authentifizierungsformat: Bearer \{\{API Key}}.
</ParamField>

## Anfragetext

<ParamField body="seed" type="integer" nullable={true}>
  Wenn angegeben, bemüht sich das System, deterministisch zu sampeln. Anfragen mit demselben seed und denselben Parametern sollten dasselbe Ergebnis zurückgeben, absolute Deterministik wird jedoch nicht garantiert. Muss eine Ganzzahl zwischen 0 und 2147483647 sein.

  Wertebereich: \[0, 2147483647]
</ParamField>

<ParamField body="diarize" type="boolean" default={false}>
  Ob der aktuelle Sprecher in der hochgeladenen Datei gekennzeichnet werden soll.
</ParamField>

<ParamField body="file_format" type="string" default="other">
  Eingabe-Audioformat. Möglich sind 'pcm\_s16le\_16' oder 'other'. pcm\_s16le\_16 erfordert Audio mit 16 kHz Abtastrate, 16-Bit-Integer, Mono und Little-Endian-Format und bietet eine geringere Latenz als codierte Wellenformen.

  Mögliche Werte: `pcm_s16le_16`, `other`
</ParamField>

<ParamField body="temperature" type="number" nullable={true}>
  Steuert die Zufälligkeit der Transkriptionsausgabe. Der Wertebereich liegt zwischen 0.0 und 2.0; höhere Werte führen zu vielfältigeren und weniger deterministischen Ergebnissen. Wenn ausgelassen, wird die Standardtemperatur des ausgewählten Modells verwendet (in der Regel 0).

  Wertebereich: \[0, 2]
</ParamField>

<ParamField body="num_speakers" type="integer" nullable={true}>
  Die maximale Anzahl von Sprechern in der hochgeladenen Datei. Kann zur Unterstützung der Sprechertrennung verwendet werden; unterstützt bis zu 32 Sprecher.

  Wertebereich: \[1, 32]
</ParamField>

<ParamField body="language_code" type="string" nullable={true}>
  Gibt den ISO-639-1- oder ISO-639-3-Sprachcode der Audiodatei an. Eine vorherige Angabe kann die Transkriptionsleistung mitunter verbessern. Standardmäßig null; die Sprache wird automatisch erkannt.
</ParamField>

<ParamField body="tag_audio_events" type="boolean" default={true}>
  Ob Audioereignisse wie (laughter) oder (footsteps) in der Transkription markiert werden sollen.
</ParamField>

<ParamField body="cloud_storage_url" type="string" required={true} nullable={true}>
  HTTPS-Link der zu transkribierenden Datei. Entweder file oder cloud\_storage\_url muss angegeben werden. Die Datei muss per HTTPS erreichbar und kleiner als 2 GB sein. Unterstützt werden alle gültigen HTTPS-Adressen, einschließlich Cloud-Speicher (AWS S3, GCS, Cloudflare R2 usw.), CDN oder andere HTTPS-Quellen, sowie vorsignierte Links mit Token oder Authentifizierung über URL-Abfrageparameter.
</ParamField>

<ParamField body="use_multi_channel" type="boolean" default={false}>
  Ob die Audiodatei mehrkanalig ist und jeder Kanal nur einen einzelnen Sprecher enthält. Nach Aktivierung wird jeder Kanal unabhängig transkribiert und das Ergebnis zusammengeführt. Jedes Wort in der Ausgabe enthält ein channel\_index-Feld; unterstützt werden bis zu 5 Kanäle.
</ParamField>

<ParamField body="diarization_threshold" type="number" nullable={true}>
  Schwellenwert für die Sprechertrennung (diarization). Bei einem größeren Wert ist die Wahrscheinlichkeit geringer, dass eine Person in mehrere Personen aufgeteilt wird, aber höher, dass verschiedene Personen zu einer Person zusammengeführt werden (weniger erkannte Sprecher). Bei einem kleineren Wert steigt die Wahrscheinlichkeit, dass eine Person in mehrere Personen aufgeteilt wird, während die Wahrscheinlichkeit sinkt, dass verschiedene Personen zusammengeführt werden (mehr Sprecher). Kann nur gesetzt werden, wenn diarize=True und num\_speakers=None. Standardmäßig None; der Schwellenwert wird anhand der Modell-ID ausgewählt (in der Regel 0,22).

  Wertebereich: \[0.1, 0.4]
</ParamField>

<ParamField body="timestamps_granularity" type="string" default="word">
  Granularität der Zeitstempel in der Transkription. 'word' bietet Zeitstempel auf Wortebene, 'character' bietet Zeitstempel für jedes einzelne Zeichen.

  Mögliche Werte: `none`, `word`, `character`
</ParamField>

## Antwortinformationen

<Note>
  Die Antwort kann einer der folgenden Antworttypen sein:
</Note>

<Accordion title="Antworttyp 1">
  <ResponseField name="text" type="string" required={true}>
    Der ursprüngliche transkribierte Text.
  </ResponseField>

  <ResponseField name="words" type="object[]" required={true}>
    Liste der Wörter und ihrer Zeitinformationen.

    <Expandable title="Eigenschaften" defaultOpen={true}>
      <ResponseField name="end" type="number" required={false}>
        Endzeit dieses Wortes oder Geräuschs in der Audiodatei (Sekunden).
      </ResponseField>

      <ResponseField name="text" type="string" required={true}>
        Inhalt des transkribierten Wortes oder Geräuschs.
      </ResponseField>

      <ResponseField name="type" type="string" required={true}>
        Typ dieses Wortes oder Geräuschs. 'audio\_event' wird für Nicht-Wort-Geräusche wie Lachen oder Schritte verwendet.

        Mögliche Werte: `word`, `spacing`, `audio_event`
      </ResponseField>

      <ResponseField name="start" type="number" required={false}>
        Startzeit dieses Wortes oder Geräuschs in der Audiodatei (Sekunden).
      </ResponseField>

      <ResponseField name="logprob" type="number" required={true}>
        Logarithmische Wahrscheinlichkeit bei der Vorhersage dieses Wortes. Der logprob-Bereich ist \[-infinity, 0]; höhere Werte bedeuten, dass das Modell bei der Vorhersage zuversichtlicher ist.
      </ResponseField>

      <ResponseField name="characters" type="object[]" required={false}>
        Zeichen, aus denen das Wort besteht, und ihre entsprechenden Zeitinformationen.

        <Expandable title="Eigenschaften" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Endzeit des Zeichens in der Audiodatei (Sekunden).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Inhalt des transkribierten Zeichens.
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Startzeit des Zeichens in der Audiodatei (Sekunden).
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="speaker_id" type="string" required={false}>
        Eindeutige Kennung des Sprechers, dem dieses Wort entspricht.
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="channel_index" type="integer" required={false}>
    Kanalindex, dem diese Transkription entspricht (wirksam bei mehrkanaligem Audio).
  </ResponseField>

  <ResponseField name="language_code" type="string" required={true}>
    Erkannter Sprachcode (z. B. 'eng' für Englisch).
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    Eindeutige Transkriptions-ID dieser Antwort.
  </ResponseField>

  <ResponseField name="language_probability" type="number" required={true}>
    Konfidenz der Spracherkennung (zwischen 0 und 1).
  </ResponseField>
</Accordion>

<Accordion title="Antworttyp 2">
  <ResponseField name="transcripts" type="object[]" required={true}>
    Liste der Transkriptionen für jeden Audiokanal. Jede Transkription enthält den Text des zugehörigen Kanals sowie Details auf Wortebene.

    <Expandable title="Eigenschaften" defaultOpen={true}>
      <ResponseField name="text" type="string" required={true}>
        Der ursprüngliche transkribierte Text.
      </ResponseField>

      <ResponseField name="words" type="object[]" required={true}>
        Liste der Wörter und ihrer Zeitinformationen.

        <Expandable title="Eigenschaften" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Endzeit dieses Wortes oder Geräuschs in der Audiodatei (Sekunden).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Inhalt des transkribierten Wortes oder Geräuschs.
          </ResponseField>

          <ResponseField name="type" type="string" required={true}>
            Typ dieses Wortes oder Geräuschs. 'audio\_event' wird für Nicht-Wort-Geräusche wie Lachen oder Schritte verwendet.

            Mögliche Werte: `word`, `spacing`, `audio_event`
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Startzeit dieses Wortes oder Geräuschs in der Audiodatei (Sekunden).
          </ResponseField>

          <ResponseField name="logprob" type="number" required={true}>
            Logarithmische Wahrscheinlichkeit bei der Vorhersage dieses Wortes. Der logprob-Bereich ist \[-infinity, 0]; höhere Werte bedeuten, dass das Modell bei der Vorhersage zuversichtlicher ist.
          </ResponseField>

          <ResponseField name="characters" type="object[]" required={false}>
            Zeichen, aus denen das Wort besteht, und ihre entsprechenden Zeitinformationen.

            <Expandable title="Eigenschaften" defaultOpen={true}>
              <ResponseField name="end" type="number" required={false}>
                Endzeit des Zeichens in der Audiodatei (Sekunden).
              </ResponseField>

              <ResponseField name="text" type="string" required={true}>
                Inhalt des transkribierten Zeichens.
              </ResponseField>

              <ResponseField name="start" type="number" required={false}>
                Startzeit des Zeichens in der Audiodatei (Sekunden).
              </ResponseField>
            </Expandable>
          </ResponseField>

          <ResponseField name="speaker_id" type="string" required={false}>
            Eindeutige Kennung des Sprechers, dem dieses Wort entspricht.
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="channel_index" type="integer" required={false}>
        Kanalindex, dem diese Transkription entspricht (wirksam bei mehrkanaligem Audio).
      </ResponseField>

      <ResponseField name="language_code" type="string" required={true}>
        Erkannter Sprachcode (z. B. 'eng' für Englisch).
      </ResponseField>

      <ResponseField name="transcription_id" type="string" required={false}>
        Eindeutige Transkriptions-ID dieser Antwort.
      </ResponseField>

      <ResponseField name="language_probability" type="number" required={true}>
        Konfidenz der Spracherkennung (zwischen 0 und 1).
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    Eindeutige Transkriptions-ID dieser Antwort.
  </ResponseField>
</Accordion>
