Synthèse vocale synchrone MiniMax Speech-2.6-hd
curl --request POST \
--url https://api.highwayapi.ai/v3/minimax-speech-2.6-hd \
--header 'Authorization: <authorization>' \
--header 'Content-Type: <content-type>' \
--data '
{
"text": "<string>",
"voice_setting": {
"speed": 123,
"vol": 123,
"pitch": 123,
"voice_id": "<string>",
"emotion": "<string>",
"latex_read": true,
"text_normalization": true
},
"audio_setting": {
"sample_rate": 123,
"bitrate": 123,
"format": "<string>",
"channel": 123
},
"pronunciation_dict": {
"tone": [
{}
]
},
"timbre_weights": [
{
"voice_id": "<string>",
"weight": 123
}
],
"stream": true,
"stream_options": {
"exclude_aggregated_audio": true
},
"language_boost": "<string>",
"output_format": "<string>",
"voice_modify": {
"pitch": 123,
"intensity": 123,
"timbre": 123,
"sound_effects": "<string>"
}
}
'import requests
url = "https://api.highwayapi.ai/v3/minimax-speech-2.6-hd"
payload = {
"text": "<string>",
"voice_setting": {
"speed": 123,
"vol": 123,
"pitch": 123,
"voice_id": "<string>",
"emotion": "<string>",
"latex_read": True,
"text_normalization": True
},
"audio_setting": {
"sample_rate": 123,
"bitrate": 123,
"format": "<string>",
"channel": 123
},
"pronunciation_dict": { "tone": [{}] },
"timbre_weights": [
{
"voice_id": "<string>",
"weight": 123
}
],
"stream": True,
"stream_options": { "exclude_aggregated_audio": True },
"language_boost": "<string>",
"output_format": "<string>",
"voice_modify": {
"pitch": 123,
"intensity": 123,
"timbre": 123,
"sound_effects": "<string>"
}
}
headers = {
"Content-Type": "<content-type>",
"Authorization": "<authorization>"
}
response = requests.post(url, json=payload, headers=headers)
print(response.text)const options = {
method: 'POST',
headers: {'Content-Type': '<content-type>', Authorization: '<authorization>'},
body: JSON.stringify({
text: '<string>',
voice_setting: {
speed: 123,
vol: 123,
pitch: 123,
voice_id: '<string>',
emotion: '<string>',
latex_read: true,
text_normalization: true
},
audio_setting: {sample_rate: 123, bitrate: 123, format: '<string>', channel: 123},
pronunciation_dict: {tone: [{}]},
timbre_weights: [{voice_id: '<string>', weight: 123}],
stream: true,
stream_options: {exclude_aggregated_audio: true},
language_boost: '<string>',
output_format: '<string>',
voice_modify: {pitch: 123, intensity: 123, timbre: 123, sound_effects: '<string>'}
})
};
fetch('https://api.highwayapi.ai/v3/minimax-speech-2.6-hd', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://api.highwayapi.ai/v3/minimax-speech-2.6-hd",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "POST",
CURLOPT_POSTFIELDS => json_encode([
'text' => '<string>',
'voice_setting' => [
'speed' => 123,
'vol' => 123,
'pitch' => 123,
'voice_id' => '<string>',
'emotion' => '<string>',
'latex_read' => true,
'text_normalization' => true
],
'audio_setting' => [
'sample_rate' => 123,
'bitrate' => 123,
'format' => '<string>',
'channel' => 123
],
'pronunciation_dict' => [
'tone' => [
[
]
]
],
'timbre_weights' => [
[
'voice_id' => '<string>',
'weight' => 123
]
],
'stream' => true,
'stream_options' => [
'exclude_aggregated_audio' => true
],
'language_boost' => '<string>',
'output_format' => '<string>',
'voice_modify' => [
'pitch' => 123,
'intensity' => 123,
'timbre' => 123,
'sound_effects' => '<string>'
]
]),
CURLOPT_HTTPHEADER => [
"Authorization: <authorization>",
"Content-Type: <content-type>"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"strings"
"net/http"
"io"
)
func main() {
url := "https://api.highwayapi.ai/v3/minimax-speech-2.6-hd"
payload := strings.NewReader("{\n \"text\": \"<string>\",\n \"voice_setting\": {\n \"speed\": 123,\n \"vol\": 123,\n \"pitch\": 123,\n \"voice_id\": \"<string>\",\n \"emotion\": \"<string>\",\n \"latex_read\": true,\n \"text_normalization\": true\n },\n \"audio_setting\": {\n \"sample_rate\": 123,\n \"bitrate\": 123,\n \"format\": \"<string>\",\n \"channel\": 123\n },\n \"pronunciation_dict\": {\n \"tone\": [\n {}\n ]\n },\n \"timbre_weights\": [\n {\n \"voice_id\": \"<string>\",\n \"weight\": 123\n }\n ],\n \"stream\": true,\n \"stream_options\": {\n \"exclude_aggregated_audio\": true\n },\n \"language_boost\": \"<string>\",\n \"output_format\": \"<string>\",\n \"voice_modify\": {\n \"pitch\": 123,\n \"intensity\": 123,\n \"timbre\": 123,\n \"sound_effects\": \"<string>\"\n }\n}")
req, _ := http.NewRequest("POST", url, payload)
req.Header.Add("Content-Type", "<content-type>")
req.Header.Add("Authorization", "<authorization>")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.post("https://api.highwayapi.ai/v3/minimax-speech-2.6-hd")
.header("Content-Type", "<content-type>")
.header("Authorization", "<authorization>")
.body("{\n \"text\": \"<string>\",\n \"voice_setting\": {\n \"speed\": 123,\n \"vol\": 123,\n \"pitch\": 123,\n \"voice_id\": \"<string>\",\n \"emotion\": \"<string>\",\n \"latex_read\": true,\n \"text_normalization\": true\n },\n \"audio_setting\": {\n \"sample_rate\": 123,\n \"bitrate\": 123,\n \"format\": \"<string>\",\n \"channel\": 123\n },\n \"pronunciation_dict\": {\n \"tone\": [\n {}\n ]\n },\n \"timbre_weights\": [\n {\n \"voice_id\": \"<string>\",\n \"weight\": 123\n }\n ],\n \"stream\": true,\n \"stream_options\": {\n \"exclude_aggregated_audio\": true\n },\n \"language_boost\": \"<string>\",\n \"output_format\": \"<string>\",\n \"voice_modify\": {\n \"pitch\": 123,\n \"intensity\": 123,\n \"timbre\": 123,\n \"sound_effects\": \"<string>\"\n }\n}")
.asString();require 'uri'
require 'net/http'
url = URI("https://api.highwayapi.ai/v3/minimax-speech-2.6-hd")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Post.new(url)
request["Content-Type"] = '<content-type>'
request["Authorization"] = '<authorization>'
request.body = "{\n \"text\": \"<string>\",\n \"voice_setting\": {\n \"speed\": 123,\n \"vol\": 123,\n \"pitch\": 123,\n \"voice_id\": \"<string>\",\n \"emotion\": \"<string>\",\n \"latex_read\": true,\n \"text_normalization\": true\n },\n \"audio_setting\": {\n \"sample_rate\": 123,\n \"bitrate\": 123,\n \"format\": \"<string>\",\n \"channel\": 123\n },\n \"pronunciation_dict\": {\n \"tone\": [\n {}\n ]\n },\n \"timbre_weights\": [\n {\n \"voice_id\": \"<string>\",\n \"weight\": 123\n }\n ],\n \"stream\": true,\n \"stream_options\": {\n \"exclude_aggregated_audio\": true\n },\n \"language_boost\": \"<string>\",\n \"output_format\": \"<string>\",\n \"voice_modify\": {\n \"pitch\": 123,\n \"intensity\": 123,\n \"timbre\": 123,\n \"sound_effects\": \"<string>\"\n }\n}"
response = http.request(request)
puts response.read_body{
"audio": "<string>",
"status": 123
}Audio
Synthèse vocale synchrone MiniMax Speech-2.6-hd
POST
/
v3
/
minimax-speech-2.6-hd
Synthèse vocale synchrone MiniMax Speech-2.6-hd
curl --request POST \
--url https://api.highwayapi.ai/v3/minimax-speech-2.6-hd \
--header 'Authorization: <authorization>' \
--header 'Content-Type: <content-type>' \
--data '
{
"text": "<string>",
"voice_setting": {
"speed": 123,
"vol": 123,
"pitch": 123,
"voice_id": "<string>",
"emotion": "<string>",
"latex_read": true,
"text_normalization": true
},
"audio_setting": {
"sample_rate": 123,
"bitrate": 123,
"format": "<string>",
"channel": 123
},
"pronunciation_dict": {
"tone": [
{}
]
},
"timbre_weights": [
{
"voice_id": "<string>",
"weight": 123
}
],
"stream": true,
"stream_options": {
"exclude_aggregated_audio": true
},
"language_boost": "<string>",
"output_format": "<string>",
"voice_modify": {
"pitch": 123,
"intensity": 123,
"timbre": 123,
"sound_effects": "<string>"
}
}
'import requests
url = "https://api.highwayapi.ai/v3/minimax-speech-2.6-hd"
payload = {
"text": "<string>",
"voice_setting": {
"speed": 123,
"vol": 123,
"pitch": 123,
"voice_id": "<string>",
"emotion": "<string>",
"latex_read": True,
"text_normalization": True
},
"audio_setting": {
"sample_rate": 123,
"bitrate": 123,
"format": "<string>",
"channel": 123
},
"pronunciation_dict": { "tone": [{}] },
"timbre_weights": [
{
"voice_id": "<string>",
"weight": 123
}
],
"stream": True,
"stream_options": { "exclude_aggregated_audio": True },
"language_boost": "<string>",
"output_format": "<string>",
"voice_modify": {
"pitch": 123,
"intensity": 123,
"timbre": 123,
"sound_effects": "<string>"
}
}
headers = {
"Content-Type": "<content-type>",
"Authorization": "<authorization>"
}
response = requests.post(url, json=payload, headers=headers)
print(response.text)const options = {
method: 'POST',
headers: {'Content-Type': '<content-type>', Authorization: '<authorization>'},
body: JSON.stringify({
text: '<string>',
voice_setting: {
speed: 123,
vol: 123,
pitch: 123,
voice_id: '<string>',
emotion: '<string>',
latex_read: true,
text_normalization: true
},
audio_setting: {sample_rate: 123, bitrate: 123, format: '<string>', channel: 123},
pronunciation_dict: {tone: [{}]},
timbre_weights: [{voice_id: '<string>', weight: 123}],
stream: true,
stream_options: {exclude_aggregated_audio: true},
language_boost: '<string>',
output_format: '<string>',
voice_modify: {pitch: 123, intensity: 123, timbre: 123, sound_effects: '<string>'}
})
};
fetch('https://api.highwayapi.ai/v3/minimax-speech-2.6-hd', options)
.then(res => res.json())
.then(res => console.log(res))
.catch(err => console.error(err));<?php
$curl = curl_init();
curl_setopt_array($curl, [
CURLOPT_URL => "https://api.highwayapi.ai/v3/minimax-speech-2.6-hd",
CURLOPT_RETURNTRANSFER => true,
CURLOPT_ENCODING => "",
CURLOPT_MAXREDIRS => 10,
CURLOPT_TIMEOUT => 30,
CURLOPT_HTTP_VERSION => CURL_HTTP_VERSION_1_1,
CURLOPT_CUSTOMREQUEST => "POST",
CURLOPT_POSTFIELDS => json_encode([
'text' => '<string>',
'voice_setting' => [
'speed' => 123,
'vol' => 123,
'pitch' => 123,
'voice_id' => '<string>',
'emotion' => '<string>',
'latex_read' => true,
'text_normalization' => true
],
'audio_setting' => [
'sample_rate' => 123,
'bitrate' => 123,
'format' => '<string>',
'channel' => 123
],
'pronunciation_dict' => [
'tone' => [
[
]
]
],
'timbre_weights' => [
[
'voice_id' => '<string>',
'weight' => 123
]
],
'stream' => true,
'stream_options' => [
'exclude_aggregated_audio' => true
],
'language_boost' => '<string>',
'output_format' => '<string>',
'voice_modify' => [
'pitch' => 123,
'intensity' => 123,
'timbre' => 123,
'sound_effects' => '<string>'
]
]),
CURLOPT_HTTPHEADER => [
"Authorization: <authorization>",
"Content-Type: <content-type>"
],
]);
$response = curl_exec($curl);
$err = curl_error($curl);
curl_close($curl);
if ($err) {
echo "cURL Error #:" . $err;
} else {
echo $response;
}package main
import (
"fmt"
"strings"
"net/http"
"io"
)
func main() {
url := "https://api.highwayapi.ai/v3/minimax-speech-2.6-hd"
payload := strings.NewReader("{\n \"text\": \"<string>\",\n \"voice_setting\": {\n \"speed\": 123,\n \"vol\": 123,\n \"pitch\": 123,\n \"voice_id\": \"<string>\",\n \"emotion\": \"<string>\",\n \"latex_read\": true,\n \"text_normalization\": true\n },\n \"audio_setting\": {\n \"sample_rate\": 123,\n \"bitrate\": 123,\n \"format\": \"<string>\",\n \"channel\": 123\n },\n \"pronunciation_dict\": {\n \"tone\": [\n {}\n ]\n },\n \"timbre_weights\": [\n {\n \"voice_id\": \"<string>\",\n \"weight\": 123\n }\n ],\n \"stream\": true,\n \"stream_options\": {\n \"exclude_aggregated_audio\": true\n },\n \"language_boost\": \"<string>\",\n \"output_format\": \"<string>\",\n \"voice_modify\": {\n \"pitch\": 123,\n \"intensity\": 123,\n \"timbre\": 123,\n \"sound_effects\": \"<string>\"\n }\n}")
req, _ := http.NewRequest("POST", url, payload)
req.Header.Add("Content-Type", "<content-type>")
req.Header.Add("Authorization", "<authorization>")
res, _ := http.DefaultClient.Do(req)
defer res.Body.Close()
body, _ := io.ReadAll(res.Body)
fmt.Println(string(body))
}HttpResponse<String> response = Unirest.post("https://api.highwayapi.ai/v3/minimax-speech-2.6-hd")
.header("Content-Type", "<content-type>")
.header("Authorization", "<authorization>")
.body("{\n \"text\": \"<string>\",\n \"voice_setting\": {\n \"speed\": 123,\n \"vol\": 123,\n \"pitch\": 123,\n \"voice_id\": \"<string>\",\n \"emotion\": \"<string>\",\n \"latex_read\": true,\n \"text_normalization\": true\n },\n \"audio_setting\": {\n \"sample_rate\": 123,\n \"bitrate\": 123,\n \"format\": \"<string>\",\n \"channel\": 123\n },\n \"pronunciation_dict\": {\n \"tone\": [\n {}\n ]\n },\n \"timbre_weights\": [\n {\n \"voice_id\": \"<string>\",\n \"weight\": 123\n }\n ],\n \"stream\": true,\n \"stream_options\": {\n \"exclude_aggregated_audio\": true\n },\n \"language_boost\": \"<string>\",\n \"output_format\": \"<string>\",\n \"voice_modify\": {\n \"pitch\": 123,\n \"intensity\": 123,\n \"timbre\": 123,\n \"sound_effects\": \"<string>\"\n }\n}")
.asString();require 'uri'
require 'net/http'
url = URI("https://api.highwayapi.ai/v3/minimax-speech-2.6-hd")
http = Net::HTTP.new(url.host, url.port)
http.use_ssl = true
request = Net::HTTP::Post.new(url)
request["Content-Type"] = '<content-type>'
request["Authorization"] = '<authorization>'
request.body = "{\n \"text\": \"<string>\",\n \"voice_setting\": {\n \"speed\": 123,\n \"vol\": 123,\n \"pitch\": 123,\n \"voice_id\": \"<string>\",\n \"emotion\": \"<string>\",\n \"latex_read\": true,\n \"text_normalization\": true\n },\n \"audio_setting\": {\n \"sample_rate\": 123,\n \"bitrate\": 123,\n \"format\": \"<string>\",\n \"channel\": 123\n },\n \"pronunciation_dict\": {\n \"tone\": [\n {}\n ]\n },\n \"timbre_weights\": [\n {\n \"voice_id\": \"<string>\",\n \"weight\": 123\n }\n ],\n \"stream\": true,\n \"stream_options\": {\n \"exclude_aggregated_audio\": true\n },\n \"language_boost\": \"<string>\",\n \"output_format\": \"<string>\",\n \"voice_modify\": {\n \"pitch\": 123,\n \"intensity\": 123,\n \"timbre\": 123,\n \"sound_effects\": \"<string>\"\n }\n}"
response = http.request(request)
puts response.read_body{
"audio": "<string>",
"status": 123
}Cette API prend en charge la génération synchrone de texte en parole, avec une limite maximale de 10000 caractères par transmission de texte. Elle prend en charge plus de 100 voix système et la sélection libre de voix clonées ; l’ajustement du volume, de l’intonation, de la vitesse de parole et du format de sortie ; le mixage proportionnel et le contrôle d’intervalles fixes ; ainsi que plusieurs spécifications et formats audio, notamment : mp3, pcm, flac, wav, avec prise en charge de la sortie en streaming.
Après l’envoi d’une requête de synthèse vocale de texte long, veuillez noter que l’url retournée est valable pendant 24 heures à compter de son retour. Veillez à télécharger les informations dans les délais.
Adapté aux scénarios tels que la génération de phrases courtes, le chat vocal et les interactions sociales en ligne. Le temps de traitement est court, mais la longueur du texte est limitée à moins de 10000 caractères. Pour les textes longs, il est recommandé d’utiliser l’appel asynchrone de synthèse vocale.
En-têtes de requête
string
requis
Valeur énumérée :
application/jsonstring
requis
Format d’authentification Bearer : Bearer {{API Key}}.
Corps de la requête
string
requis
Texte à synthétiser, longueur limitée à moins de 10000 caractères ; les changements de paragraphe doivent être remplacés par des retours à la ligne. (Si vous devez contrôler les intervalles dans la parole, ajoutez <#x#> entre les caractères, où x est en secondes, avec une plage prise en charge de 0.01 à 99.99 et jusqu’à deux décimales). Prend en charge la personnalisation de l’intervalle temporel vocal entre deux textes afin de créer des pauses vocales personnalisées. Veuillez noter que l’intervalle entre les textes doit être défini entre deux segments pouvant être prononcés, et que plusieurs intervalles consécutifs ne peuvent pas être définis.
object
requis
Afficher properties
Afficher properties
float
défaut:"1.0"
Plage [0.5,2], valeur par défaut : 1.0Vitesse de parole de la voix générée. Optionnel ; plus la valeur est élevée, plus la vitesse de parole est rapide.
float
défaut:"1.0"
Plage (0,10], valeur par défaut : 1.0Volume de la voix générée. Optionnel ; plus la valeur est élevée, plus le volume est élevé.
int
défaut:"0"
Plage [-12,12], valeur par défaut : 0Intonation de la voix générée. Optionnel ; (0 correspond à la sortie de la voix d’origine, la valeur doit être un entier).
string
Identifiant de la voix demandée. Obligatoire au choix avec timbre_weights.Deux types sont pris en charge : voix système (id) et voix clonées (id). Les voix système (ID) sont les suivantes :
- Voix de jeune homme timide :
male-qn-qingse - Voix de jeune homme d’élite :
male-qn-jingying - Voix de jeune homme autoritaire :
male-qn-badao - Voix de jeune étudiant universitaire :
male-qn-daxuesheng - Voix de jeune fille :
female-shaonv - Voix de femme mature et assurée :
female-yujie - Voix de femme mûre :
female-chengshu - Voix de femme douce :
female-tianmei - Présentateur masculin :
presenter_male - Présentatrice féminine :
presenter_female - Livre audio masculin 1 :
audiobook_male_1 - Livre audio masculin 2 :
audiobook_male_2 - Livre audio féminin 1 :
audiobook_female_1 - Livre audio féminin 2 :
audiobook_female_2 - Voix de jeune homme timide-beta :
male-qn-qingse-jingpin - Voix de jeune homme d’élite-beta :
male-qn-jingying-jingpin - Voix de jeune homme autoritaire-beta :
male-qn-badao-jingpin - Voix de jeune étudiant universitaire-beta :
male-qn-daxuesheng-jingpin - Voix de jeune fille-beta :
female-shaonv-jingpin - Voix de femme mature et assurée-beta :
female-yujie-jingpin - Voix de femme mûre-beta :
female-chengshu-jingpin - Voix de femme douce-beta :
female-tianmei-jingpin - Garçon intelligent :
clever_boy - Garçon mignon :
cute_boy - Petite fille adorable :
lovely_girl - Cochon de dessin animé Xiaoqi :
cartoon_pig - Petit frère maladivement attachant :
bingjiao_didi - Petit ami séduisant :
junlang_nanyou - Jeune camarade innocent :
chunzhen_xuedi - Aîné distant :
lengdan_xiongzhang - Jeune maître autoritaire :
badao_shaoye - Petite Ling au cœur doux :
tianxin_xiaoling - Fille vive et espiègle :
qiaopi_mengmei - Femme séduisante et assurée :
wumei_yujie - Jeune camarade à la voix douce :
diadia_xuemei - Aînée élégante :
danya_xuejie - Santa Claus :
Santa_Claus - Grinch :
Grinch - Rudolph :
Rudolph - Arnold :
Arnold - Charming Santa :
Charming_Santa - Charming Lady :
Charming_Lady - Sweet Girl :
Sweet_Girl - Cute Elf :
Cute_Elf - Attractive Girl :
Attractive_Girl - Serene Woman :
Serene_Woman
string
Contrôle l’émotion de la voix synthétisée ;7 émotions sont actuellement prises en charge : joie, tristesse, colère, peur, dégoût, surprise, neutralité ;Plage de paramètres :
["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]bool
défaut:"false"
Contrôle la prise en charge de la lecture des formules latex. La valeur par défaut est false.Remarques :
- Les formules dans la requête doivent être entourées de $$ au début et à la fin ;
- Si une formule dans la requête contient "", il doit être échappé en ”\”.
$$\\frac{d}{dx}(x^n) = nx^{n-1}$$bool
défaut:"false"
Ce paramètre prend en charge la normalisation des textes anglais, ce qui peut améliorer les performances dans les scénarios de lecture de nombres, mais augmente légèrement la latence. S’il n’est pas fourni, la valeur par défaut est false.
object
Afficher properties
Afficher properties
int
défaut:"32000"
Plage 【8000,16000,22050,24000,32000,44100】Taux d’échantillonnage de la voix générée. Optionnel, valeur par défaut : 32000.
int
défaut:"128000"
Plage 【32000,64000,128000,256000】Débit binaire de la voix générée. Optionnel, valeur par défaut : 128000. Ce paramètre ne s’applique qu’à l’audio au format mp3.
string
défaut:"mp3"
Format audio généré. Par défaut : mp3, plage [mp3,pcm,flac,wav]. wav n’est pris en charge que pour les sorties non streaming.
int
défaut:"1"
Nombre de canaux de l’audio généré. Par défaut 1 : mono. Options :1 : mono2 : stéréo
object
Afficher properties
Afficher properties
list
Remplace les textes, symboles et prononciations correspondantes nécessitant une annotation spéciale.Remplacement de prononciation (ajustement du ton/remplacement de la prononciation d’autres caractères), au format suivant :
["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)","omg/oh my god"]Les tons sont représentés par des chiffres : le premier ton (yinping) est 1, le deuxième ton (yangping) est 2, le troisième ton (shangsheng) est 3, le quatrième ton (qusheng) est 4, et le ton léger est 5.object[]
Obligatoire au choix avec voice_id
Afficher properties
Afficher properties
boolean
défaut:"false"
Indique si le mode streaming est activé. Par défaut : false, c’est-à-dire que le streaming n’est pas activé.
object
Afficher properties
Afficher properties
boolean
défaut:"false"
Lorsque ce paramètre est défini sur True, le dernier chunk du streaming ne contiendra pas les données hex complètes de l’audio concaténé. Par défaut : False, ce qui signifie que le dernier chunk contient les données hex complètes de l’audio concaténé.
string
défaut:"null"
Renforce la capacité de reconnaissance pour les langues minoritaires et dialectes spécifiés. Une fois défini, ce paramètre peut améliorer les performances vocales dans les scénarios correspondant à la langue minoritaire/au dialecte spécifié. Si le type de langue minoritaire n’est pas clair, vous pouvez choisir “auto” ; le modèle déterminera automatiquement le type de langue minoritaire. Les valeurs suivantes sont prises en charge :
'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'string
défaut:"hex"
Paramètre contrôlant la forme du résultat de sortie. Les valeurs possibles sont
url et hex. La valeur par défaut est hex. Ce paramètre ne prend effet que dans les scénarios non streaming ; les scénarios streaming ne prennent en charge que le retour au format hex. L’url retournée est valable 24 heures.object
Paramètres des effets vocaux. Ce paramètre prend en charge les formats audio suivants :
- Non streaming : mp3, wav, flac
- Streaming : mp3
Afficher properties
Afficher properties
integer
Ajustement de la hauteur (grave/brillante), plage [-100,100] ; plus la valeur est proche de -100, plus la voix est grave ; plus elle est proche de 100, plus la voix est brillante
integer
Ajustement de l’intensité (puissance/douceur), plage [-100,100] ; plus la valeur est proche de -100, plus la voix est énergique ; plus elle est proche de 100, plus la voix est douce
integer
Ajustement du timbre (magnétique/clair), plage [-100,100] ; plus la valeur est proche de -100, plus la voix est riche ; plus la valeur est proche de 100, plus la voix est claire
string
Paramètres d’effet sonore. Une seule option peut être sélectionnée à la fois. Valeurs possibles :
spacious_echo(écho spacieux)auditorium_echo(diffusion de salle)lofi_telephone(distorsion téléphonique)robotic(voix électronique)
Informations de réponse
string
Segment audio synthétisé, encodé en hex, généré selon le format défini en entrée (
audio_setting.format) (mp3/pcm/flac). La forme du retour dépend de la définition de output_format ; lorsque stream est true, seule la forme de retour hex est prise en charge.number
État actuel du flux audio, retourné uniquement lorsque
stream est true. 1 indique que la synthèse est en cours, 2 indique que la synthèse est terminée.⌘I