Fish Audio Sprachsynthese
Audio
Fish Audio Sprachsynthese
POST
Fish Audio Sprachsynthese
Für optimale Ergebnisse empfehlen wir, vor der Verwendung dieser API zunächst Referenzaudio mit Audio-Klonen hochzuladen. Dies verbessert die Sprachqualität und reduziert die Latenz.
-
WAV / PCM
- Abtastrate: 8kHz, 16kHz, 24kHz, 32kHz, 44.1kHz
- Standard-Abtastrate: 44.1kHz
- 16-bit, Mono
-
MP3
- Abtastrate: 32kHz, 44.1kHz
- Standard-Abtastrate: 44.1kHz
- Mono
- Bitrate: 64kbps, 128kbps (Standard), 192kbps
-
Opus
- Abtastrate: 48kHz
- Standard-Abtastrate: 48kHz
- Mono
- Bitrate: -1000 (automatisch), 24kbps, 32kbps (Standard), 48kbps, 64kbps
Anfrageheader
string
erforderlich
Enumerationswert:
application/jsonstring
erforderlich
Bearer-Authentifizierungsformat: Bearer {{API Key}}.
Anfragetext
string
erforderlich
Der Text, der in Sprache umgewandelt werden soll.
number
Steuert die Zufälligkeit der Sprachgenerierung. Höhere Werte (z. B. 1.0) machen die Ausgabe zufälliger, niedrigere Werte (z. B. 0.1) machen sie deterministischer. Wir empfehlen für das Modell
s1 die Verwendung von 0.9.Erforderlicher Bereich: 0 <= x <= 1number
Steuert die Vielfalt durch Nucleus-Sampling. Niedrigere Werte (z. B. 0.1) machen die Ausgabe fokussierter, höhere Werte (z. B. 1.0) erlauben mehr Vielfalt. Wir empfehlen für das Modell
s1 die Verwendung von 0.9.Erforderlicher Bereich: 0 <= x <= 1ReferenceAudio · object[] | null
Referenzaudio für die Stimme. Dies erfordert MessagePack-Serialisierung und überschreibt reference_voices und reference_texts.
string | null
Referenzmodell-ID für die Stimme.
ProsodyControl · object
Prosodiesteuerung für die Stimme.
integer
Standard:200
Chunk-Länge für die Sprache.Erforderlicher Bereich:
100 <= x <= 300boolean
Standard:true
Ob die Sprache normalisiert werden soll. Dies reduziert die Latenz, kann jedoch die Verarbeitungsleistung für Zahlen und Datumsangaben verringern.
enum<string>
Standard:"mp3"
Format für die Sprache.Optionale Werte:
wav, pcm, mp3, opusinteger | null
Abtastrate für die Sprache.
enum<integer>
Standard:128
MP3-Bitrate für die Sprache.Optionale Werte:
64, 128, 192enum<integer>
Standard:32
Opus-Bitrate für die Sprache.Optionale Werte:
-1000, 24, 32, 48, 64enum<string>
Standard:"normal"
Latenzeinstellung für die Sprache. balanced reduziert die Latenz, kann jedoch zu Leistungseinbußen führen.Optionale Werte:
normal, balancedAntwortinformationen
Die API gibt direkt einen Audiostream in dem durch den Parameterformat angegebenen Format zurück (Standard: mp3).