> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Síntesis de voz asíncrona MiniMax Speech 2.8 HD

Use esta interfaz para crear una tarea asíncrona de síntesis de voz. Admite entrada de texto o archivo; el texto está limitado a un máximo de 50 000 caracteres y los archivos a un máximo de 100 000 caracteres.

<Tip>
  Esta es una API **asíncrona** y solo devolverá el task\_id de la tarea asíncrona. Debe usar ese task\_id para solicitar la [API de consulta de resultado de tarea](/es/docs/models/reference-get-async-task-result) a fin de recuperar el resultado generado.
</Tip>

## Encabezados de solicitud

<ParamField header="Content-Type" type="string" required={true}>
  Valor enumerado: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticación Bearer: Bearer \{\{API Key}}.
</ParamField>

## Cuerpo de la solicitud

<ParamField body="text" type="string">
  Texto del audio que se va a sintetizar, limitado a un máximo de 50 000 caracteres. Se debe proporcionar obligatoriamente uno de `text_file_id` o `text`<br /><br />• Etiquetas de interjecciones: solo cuando el modelo seleccionado sea `speech-2.8-hd` o `speech-2.8-turbo`, se admite insertar etiquetas de interjecciones en el texto. Interjecciones admitidas: `(laughs)` (risa), `(chuckle)` (risa leve), `(coughs)` (tos), `(clear-throat)` (carraspeo), `(groans)` (gemido), `(breath)` (respiración normal), `(pant)` (jadeo), `(inhale)` (inhalación), `(exhale)` (exhalación), `(gasps)` (aspiración repentina), `(sniffs)` (sorber la nariz), `(sighs)` (suspiro), `(snorts)` (resoplido), `(burps)` (eructo), `(lip-smacking)` (chasquido de labios), `(humming)` (tarareo), `(hissing)` (silbido sibilante), `(emm)` (eh/em), `(whistles)` (silbido), `(sneezes)` (estornudo), `(crying)` (sollozo), `(applause)` (aplausos)
</ParamField>

<ParamField body="text_file_id" type="integer">
  id del archivo de texto del audio que se va a sintetizar; la longitud de un único archivo debe ser inferior a 100 000 caracteres. Formatos de archivo admitidos: txt, zip. Se debe proporcionar obligatoriamente uno de `text` o `text_file_id`; después de enviarlo, el formato se validará automáticamente.<br />• **Archivo txt**: límite de longitud \<100000 caracteres. Admite usar `&lt;#x#&gt;` para marcar pausas personalizadas. x es la duración de la pausa (unidad: segundos), rango \[0.01, 99.99], con un máximo de dos decimales. Tenga en cuenta que la pausa debe colocarse entre dos fragmentos de texto que puedan pronunciarse, y no se pueden usar varias marcas de pausa de forma consecutiva<br />• **Archivo zip**:<br />• El paquete comprimido debe contener archivos txt o json del mismo formato.<br />• Formato de archivo json: admite tres campos: \[`title`, `content`, `extra`], que representan respectivamente título, cuerpo e información adicional. Si los tres campos existen, se producirán 3 grupos de resultados, con un total de 9 archivos, almacenados de forma unificada en una carpeta. Si algún campo no existe o su contenido está vacío, no se generará el resultado correspondiente para ese campo
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="propiedades" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Ajuste de tono (grave/brillante), rango \[-100, 100]; cuanto más se acerque el valor a -100, más grave será la voz; cuanto más se acerque a 100, más brillante será

      Rango de valores: \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajuste de timbre (magnético/nítido), rango \[-100, 100]; cuanto más se acerque el valor a -100, más rica y profunda será la voz; cuanto más se acerque a 100, más nítida será

      Rango de valores: \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajuste de intensidad (fuerza/suavidad), rango \[-100, 100]; cuanto más se acerque el valor a -100, más firme será la voz; cuanto más se acerque a 100, más suave será

      Rango de valores: \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Configuración de efectos de sonido; solo se puede seleccionar uno por vez. Valores disponibles:

      1. spacious\_echo (eco espacioso)
      2. auditorium\_echo (difusión de auditorio)
      3. lofi\_telephone (distorsión telefónica)
      4. robotic (sonido electrónico)

      Valores opcionales: `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="propiedades" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Formato del audio generado. Rango opcional \[mp3, pcm, flac], valor predeterminado `mp3`

      Valores opcionales: `mp3`, `pcm`, `flac`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Tasa de bits del audio generado. Rango opcional \[32000, 64000, 128000, 256000], valor predeterminado `128000`. Este parámetro solo es efectivo para audio en formato `mp3`
    </ParamField>

    <ParamField body="channel" type="integer" default={2}>
      Número de canales del audio generado. Rango opcional: \[1, 2], donde `1` es mono y `2` es estéreo; el valor predeterminado es 1
    </ParamField>

    <ParamField body="audio_sample_rate" type="integer" default={32000}>
      Frecuencia de muestreo del audio generado. Rango opcional \[8000, 16000, 22050, 24000, 32000, 44100], valor predeterminado `32000`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="propiedades" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Volumen del audio sintetizado; cuanto mayor sea el valor, mayor será el volumen. Rango de valores (0, 10], valor predeterminado 1.0

      Rango de valores: \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Entonación del audio sintetizado; rango de valores \[-12, 12], valor predeterminado 0, donde 0 corresponde a la salida con el timbre original

      Rango de valores: \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Velocidad de habla del audio sintetizado; cuanto mayor sea el valor, más rápida será la velocidad. Rango de valores \[0.5, 2], valor predeterminado 1.0

      Rango de valores: \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Controla la emoción de la voz sintetizada. Rango del parámetro \["happy", "sad", "angry", "fearful", "disgusted", "surprised", "calm", "fluent", "whisper"], que corresponden respectivamente a 8 emociones: feliz, triste, enfadado, temeroso, disgustado, sorprendido, neutral, vívido, susurro
      <br />• El modelo emparejará automáticamente una emoción adecuada según el texto de entrada; por lo general no es necesario especificarla manualmente
      <br />• Este parámetro solo es efectivo para los modelos `speech-2.6-hd`, `speech-2.6-turbo`, `speech-01-hd`, `speech-01-turbo`
      <br />• Las opciones `fluent`, `whisper` solo son efectivas para los modelos `speech-2.6-turbo`, `speech-2.6-hd`

      Valores opcionales: `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      Identificador de timbre del audio sintetizado. Si necesita configurar timbres mezclados, establezca el parámetro timber\_weights y deje este parámetro vacío. Admite tres tipos: timbres del sistema, timbres clonados y timbres generados a partir de texto. A continuación se muestran algunos de los timbres del sistema (ID) más recientes; puede consultar todos los timbres admitidos oficialmente
      <br />• **Chino**:<br />• moss\_audio\_ce44fc67-7ce3-11f0-8de5-96e35d26fb85<br />• moss\_audio\_aaa1346a-7ce7-11f0-8e61-2e6e3c7ee85d<br />• Chinese (Mandarin)\_Lyrical\_Voice<br />• Chinese (Mandarin)\_HK\_Flight\_Attendant<br />• **Inglés**:<br />• English\_Graceful\_Lady<br />• English\_Insightful\_Speaker<br />• English\_radiant\_girl<br />• English\_Persuasive\_Man<br />• moss\_audio\_6dc281eb-713c-11f0-a447-9613c873494c<br />• moss\_audio\_570551b1-735c-11f0-b236-0adeeecad052<br />• moss\_audio\_ad5baf92-735f-11f0-8263-fe5a2fe98ec8<br />• English\_Lucky\_Robot<br />• **Japonés**:<br />• Japanese\_Whisper\_Belle<br />• moss\_audio\_24875c4a-7be4-11f0-9359-4e72c55db738<br />• moss\_audio\_7f4ee608-78ea-11f0-bb73-1e2a4cfcd245<br />• moss\_audio\_c1a6a3ac-7be6-11f0-8e8e-36b92fbb4f95
    </ParamField>

    <ParamField body="english_normalization" type="boolean" default={false}>
      Admite la normalización de texto en inglés. Al activarla, puede mejorar el rendimiento en escenarios de lectura de números, pero aumentará ligeramente la latencia. Valor predeterminado: false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Controla la adición de una marca de ritmo de audio al final del audio sintetizado. El valor predeterminado es False. Este parámetro solo es efectivo para síntesis no en streaming
</ParamField>

<ParamField body="language_boost" type="string">
  Indica si se debe mejorar la capacidad de reconocimiento para idiomas minoritarios y dialectos especificados. El valor predeterminado es `null`; puede establecerse en `auto` para que el modelo lo determine de forma autónoma.

  Valores opcionales: `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Active este parámetro para que la conexión entre cláusulas sea más natural. Solo admite los modelos `speech-2.8-hd` y `speech-2.8-turbo`
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="propiedades" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Define reglas de sustitución de fonética o pronunciación para caracteres o símbolos que requieren anotación especial. En textos chinos, los tonos se representan con números:
      el primer tono es `1`, el segundo tono es `2`, el tercer tono es `3`, el cuarto tono es `4` y el tono neutro es `5`
      Ejemplos:
      \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Información de respuesta

<ResponseField name="file_id" type="integer" required={false}>
  ID del archivo de audio correspondiente devuelto después de crear correctamente la tarea.<br /><br />• Una vez completada la tarea, se puede consultar mediante file\_id. Cuando se produce un error en la solicitud, este campo no se devuelve

  Nota: La URL de descarga devuelta es válida durante 9 horas (32400 segundos) desde su generación. Después de expirar, el archivo dejará de ser válido y la información generada se perderá; preste atención al tiempo de descarga de la información
</ResponseField>

<ResponseField name="task_id" type="string" required={false}>
  Use task\_id para solicitar la [API de consulta de resultado de tarea](/es/docs/models/reference-get-async-task-result) a fin de recuperar la salida generada.
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  <Expandable title="propiedades" defaultOpen={true}>
    <ResponseField name="status_msg" type="string" required={true}>
      Detalles del estado
    </ResponseField>

    <ResponseField name="status_code" type="integer" required={true}>
      Código de estado<br /><br />• `0`: normal<br />• `1002`: límite de tasa<br />• `1004`: fallo de autenticación<br />• `1039`: se activó el límite de tasa TPM<br />• `1042`: caracteres ilegales superiores al 10%<br />• `2013`: error de parámetros
    </ResponseField>
  </Expandable>
</ResponseField>

<ResponseField name="task_token" type="string" required={false}>
  Información de clave utilizada para completar la tarea actual
</ResponseField>

<ResponseField name="usage_characters" type="integer" required={false}>
  Número de caracteres facturables
</ResponseField>
