> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Síntesis de voz asíncrona MiniMax Speech 2.8 Turbo

Use esta interfaz para crear tareas de síntesis de voz asíncrona. Admite entrada de texto o archivo; la longitud máxima del texto es de 50 000 caracteres y la del archivo es de 100 000 caracteres.

<Tip>
  Esta es una API **asíncrona** que solo devuelve el task\_id de la tarea asíncrona. Debe usar ese task\_id para solicitar la [API de consulta del resultado de la tarea](/es/docs/models/reference-get-async-task-result) y recuperar el resultado generado.
</Tip>

## Encabezados de solicitud

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticación Bearer: Bearer \{\{API Key}}.
</ParamField>

## Cuerpo de la solicitud

<ParamField body="text" type="string">
  Texto del audio que se va a sintetizar, con un límite máximo de 50 000 caracteres. Es obligatorio proporcionar uno de `text` o `text_file_id`<br /><br />• Etiquetas de interjecciones: solo cuando el modelo seleccionado es `speech-2.8-hd` o `speech-2.8-turbo`, se admite insertar etiquetas de interjecciones en el texto. Interjecciones admitidas: `(laughs)` (risa), `(chuckle)` (risa suave), `(coughs)` (tos), `(clear-throat)` (aclararse la garganta), `(groans)` (gemido), `(breath)` (respiración normal), `(pant)` (jadeo), `(inhale)` (inhalación), `(exhale)` (exhalación), `(gasps)` (aspiración brusca), `(sniffs)` (sonarse/aspirar por la nariz), `(sighs)` (suspiro), `(snorts)` (resoplido), `(burps)` (eructo), `(lip-smacking)` (chasquido de labios), `(humming)` (tarareo), `(hissing)` (siseo), `(emm)` (eh), `(whistles)` (silbido), `(sneezes)` (estornudo), `(crying)` (sollozo), `(applause)` (aplausos)
</ParamField>

<ParamField body="text_file_id" type="integer">
  id del archivo de texto del audio que se va a sintetizar; la longitud de un solo archivo debe ser inferior a 100 000 caracteres. Formatos de archivo admitidos: txt, zip. Es obligatorio proporcionar uno de `text` o `text_file_id`; tras enviarlo, el formato se validará automáticamente.<br />• **Archivo txt**: límite de longitud \<100,000 caracteres. Admite el uso de `&lt;#x#&gt;` para marcar pausas personalizadas. x es la duración de la pausa (unidad: segundos), rango \[0.01,99.99], con un máximo de dos decimales. Tenga en cuenta que la pausa debe establecerse entre dos fragmentos de texto que puedan pronunciarse; no se pueden usar varias marcas de pausa consecutivas<br />• **Archivo zip**:<br />• El paquete comprimido debe contener archivos txt o json del mismo formato.<br />• Formato de archivo json: admite tres campos \[`title`, `content`, `extra`], que representan respectivamente el título, el cuerpo y la información adicional. Si existen los tres campos, se producirán 3 conjuntos de resultados, con un total de 9 archivos, almacenados de forma uniforme en una carpeta. Si un campo no existe o su contenido está vacío, no se generará el resultado correspondiente para ese campo
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="propiedades" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Ajuste de tono (grave/brillante), rango \[-100, 100]. Cuanto más se acerque el valor a -100, más grave será la voz; cuanto más se acerque a 100, más brillante será

      Rango de valores: \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajuste de timbre (magnético/nítido), rango \[-100, 100]. Cuanto más se acerque el valor a -100, más densa será la voz; cuanto más se acerque a 100, más nítida será

      Rango de valores: \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajuste de intensidad (sensación de fuerza/suavidad), rango \[-100, 100]. Cuanto más se acerque el valor a -100, más firme será la voz; cuanto más se acerque a 100, más suave será

      Rango de valores: \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Configuración de efectos de sonido; solo se puede seleccionar uno por vez. Valores opcionales:

      1. spacious\_echo (eco espacioso)
      2. auditorium\_echo (megafonía de auditorio)
      3. lofi\_telephone (distorsión telefónica)
      4. robotic (voz electrónica)

      Valores opcionales: `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="propiedades" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Formato del audio generado. Rango opcional \[mp3, pcm, flac], valor predeterminado `mp3`

      Valores opcionales: `mp3`, `pcm`, `flac`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Tasa de bits del audio generado. Rango opcional \[32000, 64000, 128000, 256000], valor predeterminado `128000`. Este parámetro solo tiene efecto para audio en formato `mp3`
    </ParamField>

    <ParamField body="channel" type="integer" default={2}>
      Número de canales del audio generado. Rango opcional: \[1, 2], donde `1` es mono y `2` es estéreo; el valor predeterminado es 1
    </ParamField>

    <ParamField body="audio_sample_rate" type="integer" default={32000}>
      Frecuencia de muestreo del audio generado. Rango opcional \[8000, 16000, 22050, 24000, 32000, 44100], valor predeterminado `32000`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="propiedades" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Volumen del audio sintetizado; cuanto mayor sea el valor, mayor será el volumen. Rango de valores (0, 10], valor predeterminado 1.0

      Rango de valores: \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Entonación del audio sintetizado. Rango de valores \[-12, 12], valor predeterminado 0, donde 0 corresponde a la salida con el timbre original

      Rango de valores: \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Velocidad del habla del audio sintetizado; cuanto mayor sea el valor, más rápida será la velocidad. Rango de valores \[0.5, 2], valor predeterminado 1.0

      Rango de valores: \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Controla la emoción de la voz sintetizada. Rango de parámetros \["happy", "sad", "angry", "fearful", "disgusted", "surprised", "calm", "fluent", "whisper"], que corresponden respectivamente a 8 emociones: felicidad, tristeza, ira, miedo, asco, sorpresa, neutralidad, vivacidad y susurro
      <br />• El modelo emparejará automáticamente la emoción adecuada según el texto de entrada; por lo general no es necesario especificarla manualmente
      <br />• Este parámetro solo tiene efecto para los modelos `speech-2.6-hd`, `speech-2.6-turbo`, `speech-01-hd`, `speech-01-turbo`
      <br />• Las opciones `fluent`, `whisper` solo tienen efecto para los modelos `speech-2.6-turbo`, `speech-2.6-hd`

      Valores opcionales: `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Identificador de timbre del audio sintetizado. Si necesita configurar un timbre mixto, establezca el parámetro timber\_weights y deje este parámetro en un valor vacío. Admite tres tipos: timbres del sistema, timbres clonados y timbres generados a partir de texto. A continuación se muestran algunos de los timbres del sistema más recientes (ID); puede consultar todos los timbres admitidos oficialmente
      <br />• **Chino**:<br />• moss\_audio\_ce44fc67-7ce3-11f0-8de5-96e35d26fb85<br />• moss\_audio\_aaa1346a-7ce7-11f0-8e61-2e6e3c7ee85d<br />• Chinese (Mandarin)\_Lyrical\_Voice<br />• Chinese (Mandarin)\_HK\_Flight\_Attendant<br />• Inglés:<br />• English\_Graceful\_Lady<br />• English\_Insightful\_Speaker<br />• English\_radiant\_girl<br />• English\_Persuasive\_Man<br />• moss\_audio\_6dc281eb-713c-11f0-a447-9613c873494c<br />• moss\_audio\_570551b1-735c-11f0-b236-0adeeecad052<br />• moss\_audio\_ad5baf92-735f-11f0-8263-fe5a2fe98ec8<br />• English\_Lucky\_Robot<br />• Japonés:<br />• Japanese\_Whisper\_Belle<br />• moss\_audio\_24875c4a-7be4-11f0-9359-4e72c55db738<br />• moss\_audio\_7f4ee608-78ea-11f0-bb73-1e2a4cfcd245<br />• moss\_audio\_c1a6a3ac-7be6-11f0-8e8e-36b92fbb4f95
    </ParamField>

    <ParamField body="english_normalization" type="boolean" default={false}>
      Admite la normalización de texto en inglés. Al activarla, puede mejorar el rendimiento en escenarios de lectura de números, pero aumentará ligeramente la latencia. Valor predeterminado false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Controla la adición de una marca de ritmo de audio al final del audio sintetizado. El valor predeterminado es False. Este parámetro solo tiene efecto para la síntesis no en streaming
</ParamField>

<ParamField body="language_boost" type="string">
  Indica si se debe mejorar la capacidad de reconocimiento de idiomas minoritarios y dialectos específicos. El valor predeterminado es `null`; puede establecerse en `auto` para que el modelo lo determine de forma autónoma.

  Valores opcionales: `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Active este parámetro para que la conexión entre cláusulas sea más natural; solo es compatible con los modelos `speech-2.8-hd` y `speech-2.8-turbo`
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="propiedades" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Define las reglas de reemplazo de anotación fonética o pronunciación correspondientes a caracteres o símbolos que requieren anotación especial. En textos chinos, los tonos se representan con números:
      el primer tono es `1`, el segundo tono es `2`, el tercer tono es `3`, el cuarto tono es `4` y el tono neutro es `5`
      Ejemplos:
      \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Información de respuesta

<ResponseField name="file_id" type="integer" required={false}>
  ID del archivo de audio correspondiente devuelto después de crear correctamente la tarea.<br /><br />• Una vez completada la tarea, se puede consultar mediante file\_id. Cuando se produce un error en la solicitud, este campo no se devuelve

  Nota: la URL de descarga devuelta es válida durante 9 horas (32400 segundos) desde su generación. Una vez vencida, el archivo dejará de ser válido y la información generada se perderá; preste atención al plazo de descarga de la información
</ResponseField>

<ResponseField name="task_id" type="string" required={false}>
  Use task\_id para solicitar la [API de consulta del resultado de la tarea](/es/docs/models/reference-get-async-task-result) y recuperar la salida generada.
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  <Expandable title="propiedades" defaultOpen={true}>
    <ResponseField name="status_msg" type="string" required={true}>
      Detalles del estado
    </ResponseField>

    <ResponseField name="status_code" type="integer" required={true}>
      Código de estado<br /><br />• `0`: normal<br />• `1002`: límite de tasa<br />• `1004`: error de autenticación<br />• `1039`: se activó el límite de tasa TPM<br />• `1042`: caracteres no válidos superiores al 10%<br />• `2013`: error de parámetro
    </ResponseField>
  </Expandable>
</ResponseField>

<ResponseField name="task_token" type="string" required={false}>
  Información de la clave utilizada para completar la tarea actual
</ResponseField>

<ResponseField name="usage_characters" type="integer" required={false}>
  Número de caracteres facturables
</ResponseField>
