Síntesis de voz asíncrona MiniMax Speech 2.8 Turbo
Audio
Síntesis de voz asíncrona MiniMax Speech 2.8 Turbo
POST
Síntesis de voz asíncrona MiniMax Speech 2.8 Turbo
Use esta interfaz para crear tareas de síntesis de voz asíncrona. Admite entrada de texto o archivo; la longitud máxima del texto es de 50 000 caracteres y la del archivo es de 100 000 caracteres.
Encabezados de solicitud
string
requerido
Valores enumerados:
application/jsonstring
requerido
Formato de autenticación Bearer: Bearer {{API Key}}.
Cuerpo de la solicitud
string
Texto del audio que se va a sintetizar, con un límite máximo de 50 000 caracteres. Es obligatorio proporcionar uno de
• Etiquetas de interjecciones: solo cuando el modelo seleccionado es
text o text_file_id• Etiquetas de interjecciones: solo cuando el modelo seleccionado es
speech-2.8-hd o speech-2.8-turbo, se admite insertar etiquetas de interjecciones en el texto. Interjecciones admitidas: (laughs) (risa), (chuckle) (risa suave), (coughs) (tos), (clear-throat) (aclararse la garganta), (groans) (gemido), (breath) (respiración normal), (pant) (jadeo), (inhale) (inhalación), (exhale) (exhalación), (gasps) (aspiración brusca), (sniffs) (sonarse/aspirar por la nariz), (sighs) (suspiro), (snorts) (resoplido), (burps) (eructo), (lip-smacking) (chasquido de labios), (humming) (tarareo), (hissing) (siseo), (emm) (eh), (whistles) (silbido), (sneezes) (estornudo), (crying) (sollozo), (applause) (aplausos)integer
id del archivo de texto del audio que se va a sintetizar; la longitud de un solo archivo debe ser inferior a 100 000 caracteres. Formatos de archivo admitidos: txt, zip. Es obligatorio proporcionar uno de
• Archivo txt: límite de longitud <100,000 caracteres. Admite el uso de
• Archivo zip:
• El paquete comprimido debe contener archivos txt o json del mismo formato.
• Formato de archivo json: admite tres campos [
text o text_file_id; tras enviarlo, el formato se validará automáticamente.• Archivo txt: límite de longitud <100,000 caracteres. Admite el uso de
<#x#> para marcar pausas personalizadas. x es la duración de la pausa (unidad: segundos), rango [0.01,99.99], con un máximo de dos decimales. Tenga en cuenta que la pausa debe establecerse entre dos fragmentos de texto que puedan pronunciarse; no se pueden usar varias marcas de pausa consecutivas• Archivo zip:
• El paquete comprimido debe contener archivos txt o json del mismo formato.
• Formato de archivo json: admite tres campos [
title, content, extra], que representan respectivamente el título, el cuerpo y la información adicional. Si existen los tres campos, se producirán 3 conjuntos de resultados, con un total de 9 archivos, almacenados de forma uniforme en una carpeta. Si un campo no existe o su contenido está vacío, no se generará el resultado correspondiente para ese campoobject
object
object
requerido
boolean
predeterminado:false
Controla la adición de una marca de ritmo de audio al final del audio sintetizado. El valor predeterminado es False. Este parámetro solo tiene efecto para la síntesis no en streaming
string
Indica si se debe mejorar la capacidad de reconocimiento de idiomas minoritarios y dialectos específicos. El valor predeterminado es
null; puede establecerse en auto para que el modelo lo determine de forma autónoma.Valores opcionales: Chinese, Chinese,Yue, English, Arabic, Russian, Spanish, French, Portuguese, German, Turkish, Dutch, Ukrainian, Vietnamese, Indonesian, Japanese, Italian, Korean, Thai, Polish, Romanian, Greek, Czech, Finnish, Hindi, Bulgarian, Danish, Hebrew, Malay, Persian, Slovak, Swedish, Croatian, Filipino, Hungarian, Norwegian, Slovenian, Catalan, Nynorsk, Tamil, Afrikaans, autoboolean
predeterminado:false
Active este parámetro para que la conexión entre cláusulas sea más natural; solo es compatible con los modelos
speech-2.8-hd y speech-2.8-turboobject
Información de respuesta
string
Utilice task_id para solicitar la API de consulta de resultados de tareas y recuperar la salida generada.
object
Detalles adicionales.