API TTA Speech 02 Turbo ASYNC | Synthèse vocale haute qualité MiniMax

Synthèse vocale asynchrone MiniMax Speech-02-turbo

curl --request POST \
  --url https://api.highwayapi.ai/v3/async/minimax-speech-02-turbo \
  --header 'Authorization: <authorization>' \
  --header 'Content-Type: <content-type>' \
  --data '
{
  "text": "<string>",
  "voice_setting": {
    "speed": 123,
    "vol": 123,
    "pitch": 123,
    "voice_id": "<string>",
    "emotion": "<string>",
    "text_normalization": true
  },
  "audio_setting": {
    "sample_rate": 123,
    "bitrate": 123,
    "format": "<string>",
    "channel": 123
  },
  "pronunciation_dict": {
    "tone": [
      {}
    ]
  },
  "language_boost": "<string>",
  "voice_modify": {
    "pitch": 123,
    "intensity": 123,
    "timbre": 123,
    "sound_effects": "<string>"
  }
}
'

{
  "task_id": "<string>"
}

POST

async

minimax-speech-02-turbo

Synthèse vocale asynchrone MiniMax Speech-02-turbo

curl --request POST \
  --url https://api.highwayapi.ai/v3/async/minimax-speech-02-turbo \
  --header 'Authorization: <authorization>' \
  --header 'Content-Type: <content-type>' \
  --data '
{
  "text": "<string>",
  "voice_setting": {
    "speed": 123,
    "vol": 123,
    "pitch": 123,
    "voice_id": "<string>",
    "emotion": "<string>",
    "text_normalization": true
  },
  "audio_setting": {
    "sample_rate": 123,
    "bitrate": 123,
    "format": "<string>",
    "channel": 123
  },
  "pronunciation_dict": {
    "tone": [
      {}
    ]
  },
  "language_boost": "<string>",
  "voice_modify": {
    "pitch": 123,
    "intensity": 123,
    "timbre": 123,
    "sound_effects": "<string>"
  }
}
'

{
  "task_id": "<string>"
}

Cette API prend en charge la génération asynchrone de synthèse vocale à partir de texte. Une génération unique de texte peut prendre en charge jusqu’à 1 million de caractères transmis, et le résultat audio complet généré peut être récupéré de manière asynchrone. Elle prend en charge plus de 100 voix système ainsi que la sélection autonome de voix clonées ; elle permet également d’ajuster librement l’intonation, la vitesse, le volume, le débit binaire, la fréquence d’échantillonnage et le format de sortie. Après avoir soumis une requête de synthèse vocale pour un texte long, veuillez noter que l’URL retournée est valide pendant 24 heures à partir du moment où l’URL est retournée. Veillez à télécharger les informations dans les délais.

Adapté à la génération vocale de textes longs, comme des livres entiers. Le temps d’attente en file d’attente peut être relativement long. Pour les scénarios tels que la génération de phrases courtes, le chat vocal ou les interactions sociales en ligne, il est recommandé d’utiliser l’appel synchrone de synthèse vocale.

En-têtes de requête

Content-Type

string

requis

Valeur énumérée : application/json

Authorization

string

requis

Format d’authentification Bearer : Bearer {{API Key}}.

Corps de la requête

text

string

requis

Texte à synthétiser, limité à 50 000 caractères maximum.

voice_setting

object

requis

Afficher properties

speed

number

Plage [0.5,2], valeur par défaut : 1.0Vitesse de la voix générée. Facultatif. Plus la valeur est élevée, plus la vitesse est rapide.

vol

number

Plage (0,10], valeur par défaut : 1.0Volume de la voix générée. Facultatif. Plus la valeur est élevée, plus le volume est élevé.

pitch

number

défaut:0

Plage [-12,12], valeur par défaut : 0Intonation de la voix générée. Facultatif. (0 correspond à la sortie de la voix d’origine ; la valeur doit être un entier).

voice_id

string

Identifiant de la voix demandée.Deux types sont pris en charge : voix système (id) et voix clonées (id). Les voix système (ID) sont les suivantes :

Voix de jeune homme timide : male-qn-qingse
Voix de jeune homme d’élite : male-qn-jingying
Voix de jeune homme autoritaire : male-qn-badao
Voix de jeune étudiant universitaire : male-qn-daxuesheng
Voix de jeune fille : female-shaonv
Voix de femme mature et assurée : female-yujie
Voix de femme mature : female-chengshu
Voix de femme douce : female-tianmei
Présentateur masculin : presenter_male
Présentatrice : presenter_female
Livre audio masculin 1 : audiobook_male_1
Livre audio masculin 2 : audiobook_male_2
Livre audio féminin 1 : audiobook_female_1
Livre audio féminin 2 : audiobook_female_2
Voix de jeune homme timide-beta : male-qn-qingse-jingpin
Voix de jeune homme d’élite-beta : male-qn-jingying-jingpin
Voix de jeune homme autoritaire-beta : male-qn-badao-jingpin
Voix de jeune étudiant universitaire-beta : male-qn-daxuesheng-jingpin
Voix de jeune fille-beta : female-shaonv-jingpin
Voix de femme mature et assurée-beta : female-yujie-jingpin
Voix de femme mature-beta : female-chengshu-jingpin
Voix de femme douce-beta : female-tianmei-jingpin
Garçon intelligent : clever_boy
Garçon mignon : cute_boy
Fillette adorable : lovely_girl
Cochon cartoon Xiaoqi : cartoon_pig
Petit frère possessif : bingjiao_didi
Petit ami séduisant : junlang_nanyou
Jeune camarade innocent : chunzhen_xuedi
Aîné distant : lengdan_xiongzhang
Jeune maître autoritaire : badao_shaoye
Sweetheart Xiaoling : tianxin_xiaoling
Jeune fille espiègle et mignonne : qiaopi_mengmei
Femme séduisante et assurée : wumei_yujie
Jeune camarade minaudière : diadia_xuemei
Aînée élégante : danya_xuejie
Santa Claus : Santa_Claus
Grinch : Grinch
Rudolph : Rudolph
Arnold : Arnold
Charming Santa : Charming_Santa
Charming Lady : Charming_Lady
Sweet Girl : Sweet_Girl
Cute Elf : Cute_Elf
Attractive Girl : Attractive_Girl
Serene Woman : Serene_Woman

emotion

string

Contrôle l’émotion de la voix synthétisée ;7 émotions sont actuellement prises en charge : joie, tristesse, colère, peur, dégoût, surprise, neutre ;Plage de paramètres : ["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]

text_normalization

bool

défaut:"false"

Ce paramètre prend en charge la normalisation des textes en anglais et peut améliorer les performances dans les scénarios de lecture de nombres, mais il augmente légèrement la latence. S’il n’est pas fourni, la valeur par défaut est false.

audio_setting

object

Afficher properties

sample_rate

number

défaut:32000

Plage 【8000，16000，22050，24000，32000，44100】Fréquence d’échantillonnage de la voix générée. Facultatif, valeur par défaut : 32000.

bitrate

number

défaut:128000

Plage 【32000，64000，128000，256000】Débit binaire de la voix générée. Facultatif, valeur par défaut : 128000. Ce paramètre n’est effectif que pour l’audio au format mp3.

format

string

défaut:"mp3"

Format audio généré. Par défaut : mp3. Options : mp3, pcm, flac, wav. wav n’est pris en charge que pour les sorties non streaming.

channel

number

défaut:1

Nombre de canaux de l’audio généré. Par défaut 1 : mono. Options :1 : mono2 : stéréo

pronunciation_dict

object

Afficher properties

tone

list

Remplace le texte, les symboles et les prononciations correspondantes nécessitant une annotation spéciale.Remplacement de prononciation (ajustement du ton/remplacement de la prononciation d’autres caractères), au format suivant :["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]Les tons sont indiqués par des chiffres : le premier ton (yinping) est 1, le deuxième ton (yangping) est 2, le troisième ton (shangsheng) est 3, le quatrième ton (qusheng) est 4, et le ton neutre est 5.

language_boost

string

défaut:"null"

Améliore la capacité de reconnaissance pour des langues minoritaires et dialectes spécifiques. Une fois défini, ce paramètre peut améliorer les performances vocales dans les scénarios correspondant à la langue minoritaire/au dialecte spécifié. Si le type de langue minoritaire n’est pas clair, vous pouvez choisir “auto” ; le modèle déterminera alors automatiquement le type de langue minoritaire. Valeurs prises en charge :

'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'

voice_modify

object

Paramètres des effets vocaux. Formats audio pris en charge par ce paramètre : mp3, wav, flac

Afficher properties

pitch

integer

Ajustement de la hauteur (grave/brillant), plage [-100,100]. Plus la valeur est proche de -100, plus la voix est grave ; plus elle est proche de 100, plus la voix est brillante

intensity

integer

Ajustement de l’intensité (puissance/douceur), plage [-100,100]. Plus la valeur est proche de -100, plus la voix est ferme ; plus elle est proche de 100, plus la voix est douce

timbre

integer

Ajustement du timbre (magnétique/cristallin), plage [-100,100]. Plus la valeur est proche de -100, plus la voix est ronde et profonde ; plus la valeur est proche de 100, plus la voix est cristalline

sound_effects

string

Paramètres d’effets sonores. Un seul effet peut être choisi à la fois. Valeurs disponibles :

spacious_echo（écho spacieux）
auditorium_echo（diffusion de salle）
lofi_telephone（distorsion téléphonique）
robotic（voix électronique）

Paramètres des informations de réponse

task_id

string

requis

Le task_id de la tâche asynchrone. Vous devez utiliser ce task_id pour appeler l’API de requête du résultat de tâche afin d’obtenir le résultat généré

Synthèse vocale synchrone MiniMax Speech-02-turbo

Synthèse vocale synchrone MiniMax Speech-2.5-hd-preview

​En-têtes de requête

​Corps de la requête

​Paramètres des informations de réponse

En-têtes de requête

Corps de la requête

Paramètres des informations de réponse