Skip to main content
POST
Synthèse vocale synchrone MiniMax Speech-2.6-hd
Cette API prend en charge la génération synchrone de texte en parole, avec une limite maximale de 10000 caractères par transmission de texte. Elle prend en charge plus de 100 voix système et la sélection libre de voix clonées ; l’ajustement du volume, de l’intonation, de la vitesse de parole et du format de sortie ; le mixage proportionnel et le contrôle d’intervalles fixes ; ainsi que plusieurs spécifications et formats audio, notamment : mp3, pcm, flac, wav, avec prise en charge de la sortie en streaming. Après l’envoi d’une requête de synthèse vocale de texte long, veuillez noter que l’url retournée est valable pendant 24 heures à compter de son retour. Veillez à télécharger les informations dans les délais.
Adapté aux scénarios tels que la génération de phrases courtes, le chat vocal et les interactions sociales en ligne. Le temps de traitement est court, mais la longueur du texte est limitée à moins de 10000 caractères. Pour les textes longs, il est recommandé d’utiliser l’appel asynchrone de synthèse vocale.

En-têtes de requête

string
requis
Valeur énumérée : application/json
string
requis
Format d’authentification Bearer : Bearer {{API Key}}.

Corps de la requête

string
requis
Texte à synthétiser, longueur limitée à moins de 10000 caractères ; les changements de paragraphe doivent être remplacés par des retours à la ligne. (Si vous devez contrôler les intervalles dans la parole, ajoutez <#x#> entre les caractères, où x est en secondes, avec une plage prise en charge de 0.01 à 99.99 et jusqu’à deux décimales). Prend en charge la personnalisation de l’intervalle temporel vocal entre deux textes afin de créer des pauses vocales personnalisées. Veuillez noter que l’intervalle entre les textes doit être défini entre deux segments pouvant être prononcés, et que plusieurs intervalles consécutifs ne peuvent pas être définis.
object
requis
object
object
object[]
Obligatoire au choix avec voice_id
boolean
défaut:"false"
Indique si le mode streaming est activé. Par défaut : false, c’est-à-dire que le streaming n’est pas activé.
object
string
défaut:"null"
Renforce la capacité de reconnaissance pour les langues minoritaires et dialectes spécifiés. Une fois défini, ce paramètre peut améliorer les performances vocales dans les scénarios correspondant à la langue minoritaire/au dialecte spécifié. Si le type de langue minoritaire n’est pas clair, vous pouvez choisir “auto” ; le modèle déterminera automatiquement le type de langue minoritaire. Les valeurs suivantes sont prises en charge :'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'
string
défaut:"hex"
Paramètre contrôlant la forme du résultat de sortie. Les valeurs possibles sont url et hex. La valeur par défaut est hex. Ce paramètre ne prend effet que dans les scénarios non streaming ; les scénarios streaming ne prennent en charge que le retour au format hex. L’url retournée est valable 24 heures.
object
Paramètres des effets vocaux. Ce paramètre prend en charge les formats audio suivants :
  • Non streaming : mp3, wav, flac
  • Streaming : mp3

Informations de réponse

string
Segment audio synthétisé, encodé en hex, généré selon le format défini en entrée (audio_setting.format) (mp3/pcm/flac). La forme du retour dépend de la définition de output_format ; lorsque stream est true, seule la forme de retour hex est prise en charge.
number
État actuel du flux audio, retourné uniquement lorsque stream est true. 1 indique que la synthèse est en cours, 2 indique que la synthèse est terminée.