Skip to main content
POST
Fish Audio S2 Pro Text to Speech
Das Fish Audio S2 Pro Text-to-Speech-Modell wandelt Text in natürliche Sprache um und unterstützt Referenzstimmen, Sampling-Steuerung, Segmentierung, Audioformate und Prosodie-Steuerung.

Anfrage-Header

string
erforderlich
Enum-Wert: application/json
string
erforderlich
Bearer-Authentifizierungsformat: Bearer {{API-Schlüssel}}.

Anfragebody

string
erforderlich
Der Text, der in Sprache umgewandelt werden soll. Für S2-Pro-Mehrsprecher-Text können die Tags <|speaker:0|>Hallo<|speaker:1|>Hallo zusammen verwendet werden.
number
Steuerung der Diversität beim Nucleus Sampling.Wertebereich: [0, 1]
string
Standard:"mp3"
Ausgabe-Audioformat.Optionale Werte: wav, pcm, mp3, opus
string
Standard:"normal"
Latenzstufe.Optionale Werte: low, normal, balanced
object
Prosodie-Steuerung.
boolean
Standard:true
Normalisiert chinesischen und englischen Text.
object[]
Referenz-Audiosamples für Zero-Shot-Stimmklonen.
integer
Standard:128
MP3-Bitrate in kbps.Optionale Werte: 64, 128, 192
integer
Ausgabe-Samplerate in Hz. Wenn leer, wird der Standardwert des Formats verwendet; opus ist 48000 Hz, andere üblicherweise 44100 Hz.
number
Steuerung der Ausdrucksstärke.Wertebereich: [0, 1]
integer
Standard:300
Textsegmentgröße.Wertebereich: [100, 300]
integer
Opus-Bitrate in bps; -1000 bedeutet automatisch.Optionale Werte: -1000, 24000, 32000, 48000, 64000
string
Stimmenmodell-ID; in Mehrsprecher-Szenarien kann ein Array übergeben werden, das den speaker-Indizes entspricht.
integer
Standard:1024
Maximale Anzahl an Audio-Token pro Segment.
integer
Standard:50
Mindestanzahl an Zeichen vor der Segmentierung.Wertebereich: [0, 100]
number
Strafkoeffizient zur Reduzierung von Wiederholungen im Audiomuster.
number
Standard:1
Schwellenwert für vorzeitiges Stoppen.Wertebereich: [0, 1]
boolean
Standard:true
Verwendet vorherige Audiosegmente als Kontext.

Antwortinformationen

Generiertes Audio. Format: binary