Cette API prend en charge la génération asynchrone de texte en parole. Une génération de texte unique prend en charge jusqu’à 1 million de caractères transmis, et le résultat audio complet généré peut être récupéré de manière asynchrone. Elle prend en charge plus de 100 voix système, ainsi que le choix autonome de voix clonées ; elle permet également d’ajuster librement l’intonation, la vitesse, le volume, le débit binaire, le taux d’échantillonnage et le format de sortie.Après avoir soumis une demande de synthèse vocale pour un texte long, veuillez noter que l’url retournée est valable 24 heures à compter de sa génération. Veillez à télécharger les informations dans le délai imparti.
Convient à la génération vocale de textes longs, comme des livres entiers. Le temps d’attente dans la file de tâches peut être relativement long. Pour les phrases courtes, les chats vocaux, les interactions sociales en ligne et autres scénarios similaires, il est recommandé d’utiliser l’appel synchrone de synthèse vocale.
Plage [-12,12], valeur par défaut : 0Intonation de la voix générée, facultatif (0 correspond à la sortie de la voix d’origine ; la valeur doit être un entier).
Identifiant de la voix demandée.Deux types sont pris en charge : les voix système (id) et les voix clonées (id). Les voix système (ID) sont les suivantes :
Ce paramètre prend en charge la normalisation du texte anglais, ce qui peut améliorer les performances dans les scénarios de lecture de nombres, mais augmente légèrement la latence. S’il n’est pas fourni, la valeur par défaut est false.
Plage 【32000,64000,128000,256000】Débit binaire de la voix générée. Facultatif, valeur par défaut : 128000. Ce paramètre ne s’applique qu’à l’audio au format mp3.
Remplace les caractères, symboles et prononciations correspondantes nécessitant une annotation spéciale.Remplacement de la prononciation (ajustement du ton/remplacement de la prononciation d’autres caractères), format :["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)","omg/oh my god"]Les tons sont représentés par des chiffres : le premier ton (yinping) est 1, le deuxième ton (yangping) est 2, le troisième ton (shangsheng) est 3, le quatrième ton (qusheng) est 4, et le ton neutre est 5.
Renforce la capacité de reconnaissance des langues moins répandues et des dialectes spécifiés. Une fois défini, ce paramètre peut améliorer les performances vocales dans les scénarios utilisant la langue moins répandue/le dialecte spécifié. Si le type de langue moins répandue n’est pas clairement connu, vous pouvez choisir “auto”, et le modèle déterminera automatiquement le type de langue moins répandue. Les valeurs suivantes sont prises en charge :'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'
Ajustement de la hauteur (grave/clair), plage [-100,100]. Plus la valeur est proche de -100, plus la voix est grave ; plus elle est proche de 100, plus la voix est claire
Ajustement de l’intensité (puissance/douceur), plage [-100,100]. Plus la valeur est proche de -100, plus la voix est ferme ; plus elle est proche de 100, plus la voix est douce
Ajustement du timbre (magnétique/cristallin), plage [-100,100]. Plus la valeur est proche de -100, plus la voix est profonde ; plus la valeur est proche de 100, plus la voix est cristalline