> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Síntesis de voz asíncrona MiniMax Speech-2.6-hd

Esta API admite la generación asíncrona de texto a voz. La transmisión de generación de texto en una sola vez admite hasta 1 millón de caracteres, y el resultado de audio completo generado se puede recuperar de forma asíncrona. Admite más de 100 voces del sistema y voces clonadas seleccionables libremente; también permite ajustar de forma independiente la entonación, la velocidad, el volumen, la tasa de bits, la frecuencia de muestreo y el formato de salida.

Después de enviar una solicitud de síntesis de voz para texto largo, tenga en cuenta que la URL devuelta tiene una validez de 24 horas desde el momento en que se devuelve la URL. Preste atención al tiempo disponible para descargar la información.

<Tip>Es adecuado para la generación de voz de textos largos, como libros completos; el tiempo de espera en cola de la tarea puede ser prolongado. Para escenarios como generación de frases cortas, chat de voz y socialización en línea, se recomienda usar la [síntesis de voz mediante llamada síncrona](/es/docs/models/reference-minimax-speech-2.6-hd).</Tip>

## Encabezados de solicitud

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticación Bearer: Bearer \{\{API Key}}.
</ParamField>

## Cuerpo de la solicitud

<ParamField body="text" type="string" required={true}>
  Texto que se va a sintetizar, con un límite máximo de 50 000 caracteres.
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="propiedades">
    <ParamField body="speed" type="number" default={1.0}>
      Rango \[0.5,2], valor predeterminado 1.0

      Velocidad del habla de la voz generada. Opcional; cuanto mayor sea el valor, más rápida será la velocidad.
    </ParamField>

    <ParamField body="vol" type="number" default={1.0}>
      Rango (0,10], valor predeterminado 1.0

      Volumen de la voz generada. Opcional; cuanto mayor sea el valor, mayor será el volumen.
    </ParamField>

    <ParamField body="pitch" type="number" default={0}>
      Rango \[-12,12], valor predeterminado 0

      Entonación de la voz generada. Opcional (0 corresponde a la salida con el timbre original; el valor debe ser un entero).
    </ParamField>

    <ParamField body="voice_id" type="string">
      Identificador de la voz solicitada.

      Admite dos tipos: voces del sistema (id) y voces clonadas (id). Las voces del sistema (ID) son las siguientes:

      * Voz de joven inexperto: `male-qn-qingse`
      * Voz de joven élite: `male-qn-jingying`
      * Voz de joven dominante: `male-qn-badao`
      * Voz de estudiante universitario joven: `male-qn-daxuesheng`
      * Voz de chica joven: `female-shaonv`
      * Voz de mujer madura y sofisticada: `female-yujie`
      * Voz de mujer madura: `female-chengshu`
      * Voz de mujer dulce: `female-tianmei`
      * Presentador masculino: `presenter_male`
      * Presentadora femenina: `presenter_female`
      * Audiolibro masculino 1: `audiobook_male_1`
      * Audiolibro masculino 2: `audiobook_male_2`
      * Audiolibro femenino 1: `audiobook_female_1`
      * Audiolibro femenino 2: `audiobook_female_2`
      * Voz de joven inexperto-beta: `male-qn-qingse-jingpin`
      * Voz de joven élite-beta: `male-qn-jingying-jingpin`
      * Voz de joven dominante-beta: `male-qn-badao-jingpin`
      * Voz de estudiante universitario joven-beta: `male-qn-daxuesheng-jingpin`
      * Voz de chica joven-beta: `female-shaonv-jingpin`
      * Voz de mujer madura y sofisticada-beta: `female-yujie-jingpin`
      * Voz de mujer madura-beta: `female-chengshu-jingpin`
      * Voz de mujer dulce-beta: `female-tianmei-jingpin`
      * Niño inteligente: `clever_boy`
      * Niño adorable: `cute_boy`
      * Niña tierna: `lovely_girl`
      * Cerdita de caricatura Xiaoqi: `cartoon_pig`
      * Hermano menor obsesivo: `bingjiao_didi`
      * Novio apuesto: `junlang_nanyou`
      * Estudiante menor inocente: `chunzhen_xuedi`
      * Estudiante mayor distante: `lengdan_xiongzhang`
      * Joven amo dominante: `badao_shaoye`
      * Dulce Xiaoling: `tianxin_xiaoling`
      * Chica tierna y traviesa: `qiaopi_mengmei`
      * Mujer madura seductora: `wumei_yujie`
      * Estudiante menor melosa: `diadia_xuemei`
      * Estudiante mayor elegante: `danya_xuejie`
      * Santa Claus: `Santa_Claus`
      * Grinch: `Grinch`
      * Rudolph: `Rudolph`
      * Arnold: `Arnold`
      * Charming Santa: `Charming_Santa`
      * Charming Lady: `Charming_Lady`
      * Sweet Girl: `Sweet_Girl`
      * Cute Elf: `Cute_Elf`
      * Attractive Girl: `Attractive_Girl`
      * Serene Woman: `Serene_Woman`
    </ParamField>

    <ParamField body="emotion" type="string">
      Controla la emoción de la voz sintetizada;

      Actualmente admite 7 emociones: alegría, tristeza, ira, miedo, asco, sorpresa y neutralidad;

      Rango de parámetros: `["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]`
    </ParamField>

    <ParamField body="text_normalization" type="bool" default="false">
      Este parámetro admite la normalización de texto en inglés y puede mejorar el rendimiento en escenarios de lectura de números, aunque aumentará ligeramente la latencia. Si no se proporciona, el valor predeterminado es false.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="propiedades">
    <ParamField body="sample_rate" type="number" default={32000}>
      Rango 【8000，16000，22050，24000，32000，44100】

      Frecuencia de muestreo de la voz generada. Opcional; el valor predeterminado es 32000.
    </ParamField>

    <ParamField body="bitrate" type="number" default={128000}>
      Rango 【32000，64000，128000，256000】

      Tasa de bits de la voz generada. Opcional; el valor predeterminado es 128000. Este parámetro solo tiene efecto para audio en formato mp3.
    </ParamField>

    <ParamField body="format" type="string" default="mp3">
      Formato del audio generado. Predeterminado: mp3. Opciones: `mp3`, `pcm`, `flac`, `wav`. wav solo se admite en salida no en streaming.
    </ParamField>

    <ParamField body="channel" type="number" default={1}>
      Número de canales del audio generado. Predeterminado 1: mono. Opciones:

      1: mono

      2: estéreo
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="propiedades">
    <ParamField body="tone" type="list">
      Reemplaza texto, símbolos y sus pronunciaciones correspondientes que necesitan anotación especial.

      Sustitución de pronunciación (ajustar tono/sustituir la pronunciación de otros caracteres), con el siguiente formato:

      `["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]`

      Los tonos se sustituyen con números: el primer tono (yinping) es 1, el segundo tono (yangping) es 2, el tercer tono (shangsheng) es 3, el cuarto tono (qusheng) es 4, y el tono ligero es 5.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="language_boost" type="string" default="null">
  Mejora la capacidad de reconocimiento de idiomas minoritarios y dialectos especificados. Una vez configurado, puede mejorar el rendimiento de voz en escenarios del idioma minoritario/dialecto especificado. Si no está claro el tipo de idioma minoritario, se puede seleccionar "auto" y el modelo determinará de forma autónoma el tipo de idioma minoritario. Admite los siguientes valores:

  `'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'`
</ParamField>

<ParamField body="voice_modify" type="object">
  Configuración del efecto de voz. Formatos de audio admitidos por este parámetro: mp3, wav, flac

  <Expandable title="propiedades">
    <ParamField body="pitch" type="integer">
      Ajuste de tono (grave/brillante), rango \[-100,100]. Cuanto más cerca esté el valor de -100, más grave será la voz; cuanto más cerca de 100, más brillante será la voz.
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajuste de intensidad (fuerza/suavidad), rango \[-100,100]. Cuanto más cerca esté el valor de -100, más firme será la voz; cuanto más cerca de 100, más suave será.
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajuste de timbre (magnético/nítido), rango \[-100,100]. Cuanto más cerca esté el valor de -100, más profunda y resonante será la voz; cuanto más cerca de 100, más nítida será.
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Configuración de efectos de sonido. Solo se puede seleccionar una opción por vez. Valores disponibles:

      * `spacious_echo`（eco espacioso）
      * `auditorium_echo`（megafonía de auditorio）
      * `lofi_telephone`（distorsión telefónica）
      * `robotic`（sonido electrónico）
    </ParamField>
  </Expandable>
</ParamField>

## Parámetros de información de respuesta

<ResponseField name="task_id" type="string" required={true}>
  El task\_id de la tarea asíncrona. Debe usar este task\_id para solicitar la [API de consulta del resultado de la tarea](/es/docs/models/reference-get-async-task-result) y obtener el resultado generado.
</ResponseField>
