TTA Speech 02 Turbo API | MiniMax hochwertige Sprachsynthese

MiniMax Speech-02-turbo synchrone Sprachsynthese

curl --request POST \
  --url https://api.highwayapi.ai/v3/minimax-speech-02-turbo \
  --header 'Authorization: <authorization>' \
  --header 'Content-Type: <content-type>' \
  --data '
{
  "text": "<string>",
  "voice_setting": {
    "speed": 123,
    "vol": 123,
    "pitch": 123,
    "voice_id": "<string>",
    "emotion": "<string>",
    "latex_read": true,
    "text_normalization": true
  },
  "audio_setting": {
    "sample_rate": 123,
    "bitrate": 123,
    "format": "<string>",
    "channel": 123
  },
  "pronunciation_dict": {
    "tone": [
      {}
    ]
  },
  "timbre_weights": [
    {
      "voice_id": "<string>",
      "weight": 123
    }
  ],
  "stream": true,
  "stream_options": {
    "exclude_aggregated_audio": true
  },
  "language_boost": "<string>",
  "output_format": "<string>",
  "voice_modify": {
    "pitch": 123,
    "intensity": 123,
    "timbre": 123,
    "sound_effects": "<string>"
  }
}
'

{
  "audio": "<string>",
  "status": 123
}

POST

minimax-speech-02-turbo

MiniMax Speech-02-turbo synchrone Sprachsynthese

curl --request POST \
  --url https://api.highwayapi.ai/v3/minimax-speech-02-turbo \
  --header 'Authorization: <authorization>' \
  --header 'Content-Type: <content-type>' \
  --data '
{
  "text": "<string>",
  "voice_setting": {
    "speed": 123,
    "vol": 123,
    "pitch": 123,
    "voice_id": "<string>",
    "emotion": "<string>",
    "latex_read": true,
    "text_normalization": true
  },
  "audio_setting": {
    "sample_rate": 123,
    "bitrate": 123,
    "format": "<string>",
    "channel": 123
  },
  "pronunciation_dict": {
    "tone": [
      {}
    ]
  },
  "timbre_weights": [
    {
      "voice_id": "<string>",
      "weight": 123
    }
  ],
  "stream": true,
  "stream_options": {
    "exclude_aggregated_audio": true
  },
  "language_boost": "<string>",
  "output_format": "<string>",
  "voice_modify": {
    "pitch": 123,
    "intensity": 123,
    "timbre": 123,
    "sound_effects": "<string>"
  }
}
'

{
  "audio": "<string>",
  "status": 123
}

Diese API unterstützt die synchrone Generierung von Text-zu-Sprache; pro Textübertragung sind maximal 10000 Zeichen möglich. Sie unterstützt die freie Auswahl aus über 100 Systemstimmen sowie geklonten Stimmen; Anpassungen von Lautstärke, Tonlage, Sprechgeschwindigkeit und Ausgabeformat; proportionale Stimmmischung und Steuerung fester Zeitintervalle; mehrere Audiospezifikationen und -formate, darunter: mp3, pcm, flac, wav, sowie Streaming-Ausgabe. Nach dem Einreichen einer Anfrage zur Sprachsynthese langer Texte ist zu beachten, dass die zurückgegebene url ab dem Zeitpunkt der Rückgabe 24 Stunden gültig ist. Bitte achten Sie auf den Zeitpunkt des Herunterladens.

Geeignet für Szenarien wie die Generierung kurzer Sätze, Sprach-Chat und Online-Social-Anwendungen. Die Verarbeitung ist schnell, aber die Textlänge ist auf weniger als 10000 Zeichen begrenzt. Für lange Texte wird die asynchrone Sprachsynthese empfohlen.

Anfrageheader

Content-Type

string

erforderlich

Enumerationswert: application/json

Authorization

string

erforderlich

Bearer-Authentifizierungsformat: Bearer {{API Key}}.

Anfragetext

text

string

erforderlich

Der zu synthetisierende Text, mit einer Längenbegrenzung von weniger als 10000 Zeichen. Absatzwechsel werden durch Zeilenumbrüche ersetzt. (Wenn Sie die Pausenzeit in der Sprache steuern möchten, fügen Sie zwischen Zeichen <#x#> ein; x ist in Sekunden angegeben, unterstützt 0.01-99.99 mit maximal zwei Dezimalstellen). Unterstützt benutzerdefinierte Sprachintervalle zwischen Textabschnitten, um benutzerdefinierte Pausen in der Sprachausgabe zu erzielen. Beachten Sie, dass das Textintervall zwischen zwei aussprechbaren Textsegmenten gesetzt werden muss und nicht mehrere aufeinanderfolgende Zeitintervalle gesetzt werden dürfen.

voice_setting

object

erforderlich

Anzeigen properties

speed

float

Standard:"1.0"

Bereich [0.5,2], Standardwert ist 1.0Die Sprechgeschwindigkeit der generierten Stimme. Optional; je größer der Wert, desto schneller die Sprechgeschwindigkeit.

vol

float

Standard:"1.0"

Bereich (0,10], Standardwert ist 1.0Die Lautstärke der generierten Stimme. Optional; je größer der Wert, desto höher die Lautstärke.

pitch

int

Standard:"0"

Bereich [-12,12], Standardwert ist 0Die Tonlage der generierten Stimme. Optional; (0 steht für die Ausgabe der Originalstimme, der Wert muss eine Ganzzahl sein).

voice_id

string

Die angeforderte Stimmen-ID. Entweder voice_id oder timbre_weights ist “erforderlich”.Es werden zwei Arten unterstützt: Systemstimmen (id) und geklonte Stimmen (id). Die Systemstimmen (ID) lauten wie folgt:

Schüchterne junge Männerstimme: male-qn-qingse
Elite-Jugendstimme: male-qn-jingying
Dominante junge Männerstimme: male-qn-badao
Stimme eines jungen Studenten: male-qn-daxuesheng
Mädchenstimme: female-shaonv
Reife ältere Schwester-Stimme: female-yujie
Reife Frauenstimme: female-chengshu
Süße Frauenstimme: female-tianmei
Männlicher Moderator: presenter_male
Weibliche Moderatorin: presenter_female
Männliches Hörbuch 1: audiobook_male_1
Männliches Hörbuch 2: audiobook_male_2
Weibliches Hörbuch 1: audiobook_female_1
Weibliches Hörbuch 2: audiobook_female_2
Schüchterne junge Männerstimme-beta: male-qn-qingse-jingpin
Elite-Jugendstimme-beta: male-qn-jingying-jingpin
Dominante junge Männerstimme-beta: male-qn-badao-jingpin
Stimme eines jungen Studenten-beta: male-qn-daxuesheng-jingpin
Mädchenstimme-beta: female-shaonv-jingpin
Reife ältere Schwester-Stimme-beta: female-yujie-jingpin
Reife Frauenstimme-beta: female-chengshu-jingpin
Süße Frauenstimme-beta: female-tianmei-jingpin
Kluger Junge: clever_boy
Niedlicher Junge: cute_boy
Liebenswertes Mädchen: lovely_girl
Cartoon-Schwein Xiaoqi: cartoon_pig
Krankhaft anhänglicher jüngerer Bruder: bingjiao_didi
Gutaussehender Freund: junlang_nanyou
Naiver jüngerer Mitschüler: chunzhen_xuedi
Distanziert wirkender älterer Mitschüler: lengdan_xiongzhang
Dominanter junger Herr: badao_shaoye
Sweetheart Xiaoling: tianxin_xiaoling
Verspieltes niedliches Mädchen: qiaopi_mengmei
Verführerische reife Frauenstimme: wumei_yujie
Süßlich sprechende jüngere Mitschülerin: diadia_xuemei
Elegante ältere Mitschülerin: danya_xuejie
Santa Claus: Santa_Claus
Grinch: Grinch
Rudolph: Rudolph
Arnold: Arnold
Charming Santa: Charming_Santa
Charming Lady: Charming_Lady
Sweet Girl: Sweet_Girl
Cute Elf: Cute_Elf
Attractive Girl: Attractive_Girl
Serene Woman: Serene_Woman

emotion

string

Steuert die Emotion der synthetisierten Sprache;Derzeit werden 7 Emotionen unterstützt: fröhlich, traurig, wütend, ängstlich, angewidert, überrascht, neutral;Parameterbereich: ["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]

latex_read

bool

Standard:"false"

Steuert, ob das Vorlesen von latex-Formeln unterstützt wird; Standard ist false.Zu beachten:

Formeln in der Anfrage müssen am Anfang und Ende mit $$ versehen werden;
Wenn eine Formel in der Anfrage "" enthält, muss es zu ”\” escaped werden.

Beispiel: Die Grundformel für Ableitungen lautet $$\\frac{d}{dx}(x^n) = nx^{n-1}$$

text_normalization

bool

Standard:"false"

Dieser Parameter unterstützt die Normalisierung englischer Texte und kann die Leistung in Szenarien mit Zahlenvorlesen verbessern, erhöht jedoch die Latenz geringfügig. Wenn nicht angegeben, ist der Standardwert false.

audio_setting

object

Anzeigen properties

sample_rate

int

Standard:"32000"

Bereich 【8000，16000，22050，24000，32000，44100】Die Abtastrate der generierten Stimme. Optional, Standard ist 32000.

bitrate

int

Standard:"128000"

Bereich 【32000，64000，128000，256000】Die Bitrate der generierten Stimme. Optional, Standardwert ist 128000. Dieser Parameter gilt nur für Audio im mp3-Format.

format

string

Standard:"mp3"

Das generierte Audioformat. Standard ist mp3, Bereich [mp3,pcm,flac,wav]. wav wird nur bei nicht-streamender Ausgabe unterstützt.

channel

int

Standard:"1"

Anzahl der Kanäle des generierten Audios. Standard 1: Mono, optional:1: Mono2: Stereo

pronunciation_dict

object

Anzeigen properties

tone

list

Ersetzt Text, Symbole und entsprechende phonetische Markierungen, die speziell ausgezeichnet werden müssen.Aussprache ersetzen (Ton anpassen/Aussprache anderer Zeichen ersetzen), Format wie folgt:["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]Töne werden durch Zahlen ersetzt: erster Ton (Yinping) ist 1, zweiter Ton (Yangping) ist 2, dritter Ton (Shangsheng) ist 3, vierter Ton (Qusheng) ist 4, neutraler Ton ist 5.

timbre_weights

object[]

Entweder timbre_weights oder voice_id ist erforderlich

Anzeigen properties

voice_id

string

Die angeforderte Stimmen-id. Muss gemeinsam mit dem Parameter weight ausgefüllt werden.

weight

int

Bereich [1,100]Gewichtung; muss gemeinsam mit voice_id ausgefüllt werden. Es werden maximal 4 gemischte Stimmen unterstützt. Der Wert muss eine Ganzzahl sein; je höher der Anteil einer einzelnen Stimme, desto ähnlicher ist die synthetisierte Stimme dieser Stimme.

stream

boolean

Standard:"false"

Ob Streaming verwendet wird. Standard ist false, d. h. Streaming ist nicht aktiviert.

stream_options

object

Anzeigen properties

exclude_aggregated_audio

boolean

Standard:"false"

Wenn dieser Parameter auf True gesetzt ist, enthält der letzte Chunk im Streaming nicht die vollständigen, zusammengefügten Sprachdaten im hex-Format. Standard ist False, d. h. der letzte Chunk enthält die vollständigen, zusammengefügten Sprachdaten im hex-Format.

language_boost

string

Standard:"null"

Verbessert die Erkennungsfähigkeit für bestimmte weniger verbreitete Sprachen und Dialekte. Nach der Einstellung kann die Sprachleistung in Szenarien mit der angegebenen Sprache/dem angegebenen Dialekt verbessert werden. Wenn der Typ der weniger verbreiteten Sprache nicht eindeutig ist, kann “auto” gewählt werden; das Modell bestimmt den Sprachtyp selbstständig. Unterstützte Werte:

'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'

output_format

string

Standard:"hex"

Parameter zur Steuerung der Form des Ausgabeergebnisses. Optionale Werte sind url hex. Standardwert ist hex. Dieser Parameter gilt nur in nicht-streamenden Szenarien; in Streaming-Szenarien wird nur die Rückgabe im hex-Format unterstützt. Die zurückgegebene url ist 24 Stunden gültig.

voice_modify

object

Einstellungen für Stimmeffekte; dieser Parameter unterstützt die folgenden Audioformate:

Nicht-Streaming: mp3, wav, flac
Streaming: mp3

Anzeigen properties

pitch

integer

Tonhöhenanpassung (tief/hell), Bereich [-100,100]; je näher der Wert an -100 liegt, desto tiefer klingt die Stimme; je näher an 100, desto heller klingt sie

intensity

integer

Intensitätsanpassung (kraftvoll/sanft), Bereich [-100,100]; je näher der Wert an -100 liegt, desto kräftiger klingt die Stimme; je näher an 100, desto sanfter klingt sie

timbre

integer

Klangfarbenanpassung (magnetisch/klar), Bereich [-100,100]; je näher der Wert an -100 liegt, desto voller klingt die Stimme; je näher der Wert an 100 liegt, desto klarer klingt sie

sound_effects

string

Soundeffekt-Einstellung; pro Anfrage kann nur eine Option ausgewählt werden. Optionale Werte:

spacious_echo (weiter Hall)
auditorium_echo (Aula-Durchsage)
lofi_telephone (Telefonverzerrung)
robotic (elektronische Stimme)

Antwortinformationen

audio

string

Das synthetisierte Audiosegment, hex-kodiert und gemäß dem in der Eingabe definierten Format (audio_setting.format) generiert (mp3/pcm/flac). Die Rückgabeform richtet sich nach der Definition von output_format; wenn stream true ist, wird nur die Rückgabe im hex-Format unterstützt.

status

number

Der aktuelle Status des Audiostreams, wird nur zurückgegeben, wenn stream true ist. 1 bedeutet, dass die Synthese läuft, 2 bedeutet, dass die Synthese abgeschlossen ist.

MiniMax Speech-02-hd asynchrone Sprachsynthese

Zurück

MiniMax Speech-02-turbo asynchrone Sprachsynthese

Weiter

​Anfrageheader

​Anfragetext

​Antwortinformationen

Anfrageheader

Anfragetext

Antwortinformationen