Cette API prend en charge la génération asynchrone de synthèse vocale à partir de texte. Une seule requête de génération de texte peut transmettre jusqu’à 1 million de caractères, et le résultat audio complet généré peut être récupéré de manière asynchrone. Elle prend en charge plus de 100 voix système ainsi que des voix clonées au choix ; elle permet également d’ajuster librement l’intonation, la vitesse, le volume, le débit binaire, la fréquence d’échantillonnage et le format de sortie.Après avoir soumis une demande de synthèse vocale pour un texte long, notez que l’url renvoyée est valide pendant 24 heures à compter de son retour. Veillez à télécharger les informations dans les délais.
Convient à la génération vocale de textes longs, comme des livres entiers. Le temps d’attente en file de tâches peut être relativement long. Pour les scénarios tels que la génération de phrases courtes, les conversations vocales ou les interactions sociales en ligne, il est recommandé d’utiliser l’appel synchrone de synthèse vocale.
Plage [-12,12], valeur par défaut : 0Intonation de la voix générée, facultatif (0 correspond à la sortie avec la voix d’origine ; la valeur doit être un entier).
Identifiant de la voix demandée.Deux types sont pris en charge : les voix système (id) et les voix clonées (id). Les voix système (ID) sont les suivantes :
Voix de jeune homme naïf : male-qn-qingse
Voix de jeune homme d’élite : male-qn-jingying
Voix de jeune homme autoritaire : male-qn-badao
Voix de jeune étudiant universitaire : male-qn-daxuesheng
Voix de jeune fille : female-shaonv
Voix de femme sûre d’elle : female-yujie
Voix de femme mature : female-chengshu
Voix de femme douce : female-tianmei
Présentateur masculin : presenter_male
Présentatrice féminine : presenter_female
Livre audio masculin 1 : audiobook_male_1
Livre audio masculin 2 : audiobook_male_2
Livre audio féminin 1 : audiobook_female_1
Livre audio féminin 2 : audiobook_female_2
Voix de jeune homme naïf-beta : male-qn-qingse-jingpin
Voix de jeune homme d’élite-beta : male-qn-jingying-jingpin
Voix de jeune homme autoritaire-beta : male-qn-badao-jingpin
Voix de jeune étudiant universitaire-beta : male-qn-daxuesheng-jingpin
Voix de jeune fille-beta : female-shaonv-jingpin
Voix de femme sûre d’elle-beta : female-yujie-jingpin
Voix de femme mature-beta : female-chengshu-jingpin
Ce paramètre prend en charge la normalisation du texte anglais, ce qui peut améliorer les performances dans les scénarios de lecture de nombres, mais augmente légèrement la latence. S’il n’est pas fourni, la valeur par défaut est false.
Plage 【32000,64000,128000,256000】Débit binaire de la voix générée. Facultatif, valeur par défaut : 128000. Ce paramètre ne s’applique qu’à l’audio au format mp3.
Remplace le texte, les symboles et les transcriptions phonétiques correspondantes nécessitant une annotation spéciale.Remplacement de la prononciation (ajustement du ton/remplacement de la prononciation d’autres caractères), au format suivant :["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)","omg/oh my god"]Les tons sont représentés par des nombres : premier ton (yinping) = 1, deuxième ton (yangping) = 2, troisième ton (shangsheng) = 3, quatrième ton (qusheng) = 4, ton léger = 5.
Renforce la capacité de reconnaissance pour les langues minoritaires et dialectes spécifiés, et peut améliorer la performance vocale dans les scénarios correspondant à ces langues/dialectes après configuration. Si le type de langue minoritaire n’est pas clair, vous pouvez choisir “auto” ; le modèle déterminera alors automatiquement le type de langue minoritaire. Les valeurs suivantes sont prises en charge :'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'
Ajustement de la hauteur (grave/clair), plage [-100,100]. Plus la valeur est proche de -100, plus la voix est grave ; plus elle est proche de 100, plus la voix est claire.
Ajustement de l’intensité (puissance/douceur), plage [-100,100]. Plus la valeur est proche de -100, plus la voix est ferme ; plus elle est proche de 100, plus la voix est douce.
Ajustement du timbre (magnétique/cristallin), plage [-100,100]. Plus la valeur est proche de -100, plus la voix est riche ; plus elle est proche de 100, plus la voix est claire et cristalline.