> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Fish Audio Sprachsynthese

<Note>
  Für optimale Ergebnisse empfehlen wir, vor der Verwendung dieser API zunächst Referenzaudio mit [Audio-Klonen](/de/docs/models/reference-fish-audio-voice-cloning) hochzuladen. Dies verbessert die Sprachqualität und reduziert die Latenz.
</Note>

Fish Audio wandelt Text in Sprache um.

Unterstützte Audioformate:

* WAV / PCM
  * Abtastrate: 8kHz, 16kHz, 24kHz, 32kHz, 44.1kHz
  * Standard-Abtastrate: 44.1kHz
  * 16-bit, Mono

* MP3
  * Abtastrate: 32kHz, 44.1kHz
  * Standard-Abtastrate: 44.1kHz
  * Mono
  * Bitrate: 64kbps, 128kbps (Standard), 192kbps

* Opus
  * Abtastrate: 48kHz
  * Standard-Abtastrate: 48kHz
  * Mono
  * Bitrate: -1000 (automatisch), 24kbps, 32kbps (Standard), 48kbps, 64kbps

## Anfrageheader

<ParamField header="Content-Type" type="string" required={true}>
  Enumerationswert: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer-Authentifizierungsformat: Bearer \{\{API Key}}.
</ParamField>

## Anfragetext

<ParamField body="text" type="string" required={true}>
  Der Text, der in Sprache umgewandelt werden soll.
</ParamField>

<ParamField body="temperature" type="number" default={0.9}>
  Steuert die Zufälligkeit der Sprachgenerierung. Höhere Werte (z. B. 1.0) machen die Ausgabe zufälliger, niedrigere Werte (z. B. 0.1) machen sie deterministischer. Wir empfehlen für das Modell `s1` die Verwendung von `0.9`.

  Erforderlicher Bereich: `0 <= x <= 1`
</ParamField>

<ParamField body="top_p" type="number" default={0.9}>
  Steuert die Vielfalt durch Nucleus-Sampling. Niedrigere Werte (z. B. 0.1) machen die Ausgabe fokussierter, höhere Werte (z. B. 1.0) erlauben mehr Vielfalt. Wir empfehlen für das Modell `s1` die Verwendung von `0.9`.

  Erforderlicher Bereich: `0 <= x <= 1`
</ParamField>

<ParamField body="references" type="ReferenceAudio · object[] | null">
  Referenzaudio für die Stimme. Dies erfordert MessagePack-Serialisierung und überschreibt reference\_voices und reference\_texts.

  <Expandable title="Eigenschaften">
    <ParamField body="audio" type="file" required={true}>
      Referenz-Audiodatei.
    </ParamField>

    <ParamField body="text" type="string" required={true}>
      Der zum Audio gehörende Referenztext.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="reference_id" type="string | null">
  Referenzmodell-ID für die Stimme.
</ParamField>

<ParamField body="prosody" type="ProsodyControl · object">
  Prosodiesteuerung für die Stimme.

  <Expandable title="Eigenschaften">
    <ParamField body="speed" type="number" default={1}>
      Steuerung der Sprechgeschwindigkeit.
    </ParamField>

    <ParamField body="volume" type="number" default={0}>
      Steuerung der Sprachlautstärke.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="chunk_length" type="integer" default={200}>
  Chunk-Länge für die Sprache.

  Erforderlicher Bereich: `100 <= x <= 300`
</ParamField>

<ParamField body="normalize" type="boolean" default={true}>
  Ob die Sprache normalisiert werden soll. Dies reduziert die Latenz, kann jedoch die Verarbeitungsleistung für Zahlen und Datumsangaben verringern.
</ParamField>

<ParamField body="format" type="enum<string>" default="mp3">
  Format für die Sprache.

  Optionale Werte: `wav`, `pcm`, `mp3`, `opus`
</ParamField>

<ParamField body="sample_rate" type="integer | null">
  Abtastrate für die Sprache.
</ParamField>

<ParamField body="mp3_bitrate" type="enum<integer>" default={128}>
  MP3-Bitrate für die Sprache.

  Optionale Werte: `64`, `128`, `192`
</ParamField>

<ParamField body="opus_bitrate" type="enum<integer>" default={32}>
  Opus-Bitrate für die Sprache.

  Optionale Werte: `-1000`, `24`, `32`, `48`, `64`
</ParamField>

<ParamField body="latency" type="enum<string>" default="normal">
  Latenzeinstellung für die Sprache. balanced reduziert die Latenz, kann jedoch zu Leistungseinbußen führen.

  Optionale Werte: `normal`, `balanced`
</ParamField>

## Antwortinformationen

Die API gibt direkt einen Audiostream in dem durch den Parameter `format` angegebenen Format zurück (Standard: mp3).
