> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Fish Audio S2 Pro Text to Speech

Das Fish Audio S2 Pro Text-to-Speech-Modell wandelt Text in natürliche Sprache um und unterstützt Referenzstimmen, Sampling-Steuerung, Segmentierung, Audioformate und Prosodie-Steuerung.

## Anfrage-Header

<ParamField header="Content-Type" type="string" required={true}>
  Enum-Wert: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer-Authentifizierungsformat: Bearer \{\{API-Schlüssel}}.
</ParamField>

## Anfragebody

<ParamField body="text" type="string" required={true}>
  Der Text, der in Sprache umgewandelt werden soll. Für S2-Pro-Mehrsprecher-Text können die Tags \<|speaker:0|>Hallo\<|speaker:1|>Hallo zusammen verwendet werden.
</ParamField>

<ParamField body="top_p" type="number" default={0.7}>
  Steuerung der Diversität beim Nucleus Sampling.

  Wertebereich: \[0, 1]
</ParamField>

<ParamField body="format" type="string" default="mp3">
  Ausgabe-Audioformat.

  Optionale Werte: `wav`, `pcm`, `mp3`, `opus`
</ParamField>

<ParamField body="latency" type="string" default="normal">
  Latenzstufe.

  Optionale Werte: `low`, `normal`, `balanced`
</ParamField>

<ParamField body="prosody" type="object">
  Prosodie-Steuerung.

  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="speed" type="number" default={1}>
      Sprechgeschwindigkeits-Multiplikator.
    </ParamField>

    <ParamField body="volume" type="number" default={0}>
      Lautstärkeanpassung.
    </ParamField>

    <ParamField body="normalize_loudness" type="boolean" default={true}>
      Gibt an, ob die Ausgabelautstärke normalisiert wird.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="normalize" type="boolean" default={true}>
  Normalisiert chinesischen und englischen Text.
</ParamField>

<ParamField body="references" type="object[]">
  Referenz-Audiosamples für Zero-Shot-Stimmklonen.

  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="text" type="string">
      Der Text, der dem Referenzaudio entspricht.
    </ParamField>

    <ParamField body="audio" type="string">
      Referenzaudio, je nach Anbieterunterstützung als base64 oder URL übergeben.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="mp3_bitrate" type="integer" default={128}>
  MP3-Bitrate in kbps.

  Optionale Werte: `64`, `128`, `192`
</ParamField>

<ParamField body="sample_rate" type="integer" nullable={true}>
  Ausgabe-Samplerate in Hz. Wenn leer, wird der Standardwert des Formats verwendet; opus ist 48000 Hz, andere üblicherweise 44100 Hz.
</ParamField>

<ParamField body="temperature" type="number" default={0.7}>
  Steuerung der Ausdrucksstärke.

  Wertebereich: \[0, 1]
</ParamField>

<ParamField body="chunk_length" type="integer" default={300}>
  Textsegmentgröße.

  Wertebereich: \[100, 300]
</ParamField>

<ParamField body="opus_bitrate" type="integer" default={-1000}>
  Opus-Bitrate in bps; -1000 bedeutet automatisch.

  Optionale Werte: `-1000`, `24000`, `32000`, `48000`, `64000`
</ParamField>

<ParamField body="reference_id" type="string">
  Stimmenmodell-ID; in Mehrsprecher-Szenarien kann ein Array übergeben werden, das den speaker-Indizes entspricht.
</ParamField>

<ParamField body="max_new_tokens" type="integer" default={1024}>
  Maximale Anzahl an Audio-Token pro Segment.
</ParamField>

<ParamField body="min_chunk_length" type="integer" default={50}>
  Mindestanzahl an Zeichen vor der Segmentierung.

  Wertebereich: \[0, 100]
</ParamField>

<ParamField body="repetition_penalty" type="number" default={1.2}>
  Strafkoeffizient zur Reduzierung von Wiederholungen im Audiomuster.
</ParamField>

<ParamField body="early_stop_threshold" type="number" default={1}>
  Schwellenwert für vorzeitiges Stoppen.

  Wertebereich: \[0, 1]
</ParamField>

<ParamField body="condition_on_previous_chunks" type="boolean" default={true}>
  Verwendet vorherige Audiosegmente als Kontext.
</ParamField>

## Antwortinformationen

Generiertes Audio.

Format: `binary`
