Zum Hauptinhalt springen
POST
/
v3
/
minimax-speech-2.6-turbo
MiniMax Speech-2.6-turbo synchrone Sprachsynthese
curl --request POST \
  --url https://api.highwayapi.ai/v3/minimax-speech-2.6-turbo \
  --header 'Authorization: <authorization>' \
  --header 'Content-Type: <content-type>' \
  --data '
{
  "text": "<string>",
  "voice_setting": {
    "speed": 123,
    "vol": 123,
    "pitch": 123,
    "voice_id": "<string>",
    "emotion": "<string>",
    "latex_read": true,
    "text_normalization": true
  },
  "audio_setting": {
    "sample_rate": 123,
    "bitrate": 123,
    "format": "<string>",
    "channel": 123
  },
  "pronunciation_dict": {
    "tone": [
      {}
    ]
  },
  "timbre_weights": [
    {
      "voice_id": "<string>",
      "weight": 123
    }
  ],
  "stream": true,
  "stream_options": {
    "exclude_aggregated_audio": true
  },
  "language_boost": "<string>",
  "output_format": "<string>",
  "voice_modify": {
    "pitch": 123,
    "intensity": 123,
    "timbre": 123,
    "sound_effects": "<string>"
  }
}
'
{
  "audio": "<string>",
  "status": 123
}
Diese API unterstützt die synchrone Generierung von Text-zu-Sprache; die maximale Textlänge pro Übertragung beträgt 10000 Zeichen. Sie unterstützt 100+ Systemstimmen sowie die freie Auswahl geklonter Stimmen; Anpassungen von Lautstärke, Tonhöhe, Sprechgeschwindigkeit und Ausgabeformat; proportionales Mischen von Stimmen und die Steuerung fester Intervalle; außerdem verschiedene Audiospezifikationen und -formate, darunter: mp3, pcm, flac, wav, sowie Streaming-Ausgabe. Nach dem Einreichen einer Anfrage zur Sprachsynthese für längere Texte ist zu beachten, dass die zurückgegebene url ab dem Zeitpunkt der Rückgabe 24 Stunden gültig ist. Bitte achten Sie auf den Zeitpunkt des Herunterladens der Informationen.
Geeignet für Szenarien wie die Generierung kurzer Sätze, Sprachchats und Online-Social-Anwendungen. Die Verarbeitung ist schnell, die Textlänge ist jedoch auf weniger als 10000 Zeichen begrenzt. Für längere Texte wird die asynchrone Sprachsynthese empfohlen.

Request-Header

Content-Type
string
erforderlich
Enumerationswert: application/json
Authorization
string
erforderlich
Bearer-Authentifizierungsformat: Bearer {{API Key}}.

Request-Body

text
string
erforderlich
Der zu synthetisierende Text. Die Länge muss unter 10000 Zeichen liegen; Absatzwechsel werden durch Zeilenumbrüche ersetzt. (Wenn Sie Pausen innerhalb der Sprache steuern möchten, fügen Sie zwischen Zeichen <#x#> ein; x ist in Sekunden angegeben, unterstützt werden 0.01-99.99 mit maximal zwei Dezimalstellen.) Unterstützt benutzerdefinierte Zeitintervalle zwischen Textabschnitten, um benutzerdefinierte Sprechpausen zu realisieren. Beachten Sie, dass das Textintervall zwischen zwei aussprechbaren Textabschnitten gesetzt werden muss und nicht mehrere aufeinanderfolgende Zeitintervalle gesetzt werden dürfen.
voice_setting
object
erforderlich
audio_setting
object
pronunciation_dict
object
timbre_weights
object[]
Entweder voice_id oder timbre_weights ist erforderlich
stream
boolean
Standard:"false"
Ob Streaming verwendet wird. Standard ist false, d. h. Streaming ist nicht aktiviert.
stream_options
object
language_boost
string
Standard:"null"
Verbessert die Erkennung bestimmter kleinerer Sprachen und Dialekte. Nach der Einstellung kann die Sprachleistung in Szenarien mit der angegebenen kleineren Sprache/dem angegebenen Dialekt verbessert werden. Wenn der Typ der kleineren Sprache nicht eindeutig ist, kann “auto” gewählt werden; das Modell bestimmt dann den Typ der kleineren Sprache selbstständig. Unterstützt die folgenden Werte:'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'
output_format
string
Standard:"hex"
Parameter zur Steuerung der Form des Ausgabeergebnisses. Mögliche Werte sind url hex. Standardwert ist hex. Dieser Parameter ist nur in nicht gestreamten Szenarien wirksam; Streaming-Szenarien unterstützen nur die Rückgabe in hex-Form. Die zurückgegebene url ist 24 Stunden gültig.
voice_modify
object
Einstellungen für Stimmeffekte. Dieser Parameter unterstützt die folgenden Audioformate:
  • Nicht gestreamt: mp3, wav, flac
  • Gestreamt: mp3

Antwortinformationen

audio
string
Das synthetisierte Audiosegment, hex-codiert und gemäß dem in der Eingabe definierten Format (audio_setting.format) generiert (mp3/pcm/flac). Die Rückgabeform richtet sich nach der Definition von output_format; wenn stream true ist, wird nur die Rückgabe in hex-Form unterstützt.
status
number
Aktueller Status des Audiostreams, wird nur zurückgegeben, wenn stream true ist. 1 bedeutet Synthese läuft, 2 bedeutet Synthese beendet.