> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Síntese de voz assíncrona MiniMax Speech-2.6-hd

Esta API oferece suporte à geração assíncrona de texto para fala. Uma única transmissão de geração de texto suporta até 1 milhão de caracteres, e o resultado de áudio completo gerado pode ser recuperado de forma assíncrona. Suporta mais de 100 vozes do sistema e vozes clonadas à sua escolha; também permite ajustar tom, velocidade, volume, bitrate, taxa de amostragem e formato de saída.

Após enviar uma solicitação de síntese de voz para texto longo, observe que a URL retornada é válida por 24 horas a partir do momento em que a URL é retornada. Fique atento ao prazo para baixar as informações.

<Tip>Indicado para geração de voz de textos longos, como livros inteiros. O tempo de enfileiramento da tarefa pode ser maior. Para cenários como geração de frases curtas, chat por voz e interação social online, recomenda-se usar a [chamada síncrona de síntese de voz](/pt/docs/models/reference-minimax-speech-2.6-hd).</Tip>

## Cabeçalhos da solicitação

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticação Bearer: Bearer \{\{API Key}}.
</ParamField>

## Corpo da solicitação

<ParamField body="text" type="string" required={true}>
  Texto a ser sintetizado, limitado a no máximo 50 mil caracteres.
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="propriedades">
    <ParamField body="speed" type="number" default={1.0}>
      Intervalo \[0.5,2], valor padrão 1.0

      Velocidade da voz gerada. Opcional. Quanto maior o valor, mais rápida a fala.
    </ParamField>

    <ParamField body="vol" type="number" default={1.0}>
      Intervalo (0,10], valor padrão 1.0

      Volume da voz gerada. Opcional. Quanto maior o valor, maior o volume.
    </ParamField>

    <ParamField body="pitch" type="number" default={0}>
      Intervalo \[-12,12], valor padrão 0

      Tom da voz gerada. Opcional. (0 produz a voz original; o valor deve ser um número inteiro).
    </ParamField>

    <ParamField body="voice_id" type="string">
      ID da voz solicitada.

      Suporta dois tipos: vozes do sistema (id) e vozes clonadas (id). As vozes do sistema (ID) são:

      * Voz masculina jovem inexperiente: `male-qn-qingse`
      * Voz masculina jovem de elite: `male-qn-jingying`
      * Voz masculina jovem dominadora: `male-qn-badao`
      * Voz masculina de jovem universitário: `male-qn-daxuesheng`
      * Voz de garota: `female-shaonv`
      * Voz de mulher confiante: `female-yujie`
      * Voz feminina madura: `female-chengshu`
      * Voz feminina doce: `female-tianmei`
      * Apresentador masculino: `presenter_male`
      * Apresentadora feminina: `presenter_female`
      * Audiolivro masculino 1: `audiobook_male_1`
      * Audiolivro masculino 2: `audiobook_male_2`
      * Audiolivro feminino 1: `audiobook_female_1`
      * Audiolivro feminino 2: `audiobook_female_2`
      * Voz masculina jovem inexperiente-beta: `male-qn-qingse-jingpin`
      * Voz masculina jovem de elite-beta: `male-qn-jingying-jingpin`
      * Voz masculina jovem dominadora-beta: `male-qn-badao-jingpin`
      * Voz masculina de jovem universitário-beta: `male-qn-daxuesheng-jingpin`
      * Voz de garota-beta: `female-shaonv-jingpin`
      * Voz de mulher confiante-beta: `female-yujie-jingpin`
      * Voz feminina madura-beta: `female-chengshu-jingpin`
      * Voz feminina doce-beta: `female-tianmei-jingpin`
      * Menino inteligente: `clever_boy`
      * Menino fofo: `cute_boy`
      * Menina adorável: `lovely_girl`
      * Porquinha de desenho Xiaoqi: `cartoon_pig`
      * Irmão mais novo obcecado: `bingjiao_didi`
      * Namorado atraente: `junlang_nanyou`
      * Calouro inocente: `chunzhen_xuedi`
      * Veterano frio: `lengdan_xiongzhang`
      * Jovem mestre dominador: `badao_shaoye`
      * Queridinha Xiaoling: `tianxin_xiaoling`
      * Garota fofa e travessa: `qiaopi_mengmei`
      * Mulher confiante e sedutora: `wumei_yujie`
      * Caloura dengosa: `diadia_xuemei`
      * Veterana elegante: `danya_xuejie`
      * Santa Claus: `Santa_Claus`
      * Grinch: `Grinch`
      * Rudolph: `Rudolph`
      * Arnold: `Arnold`
      * Charming Santa: `Charming_Santa`
      * Charming Lady: `Charming_Lady`
      * Sweet Girl: `Sweet_Girl`
      * Cute Elf: `Cute_Elf`
      * Attractive Girl: `Attractive_Girl`
      * Serene Woman: `Serene_Woman`
    </ParamField>

    <ParamField body="emotion" type="string">
      Controla a emoção da fala sintetizada;

      Atualmente são suportadas 7 emoções: felicidade, tristeza, raiva, medo, nojo, surpresa e neutro;

      Intervalo de parâmetros: `["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]`
    </ParamField>

    <ParamField body="text_normalization" type="bool" default="false">
      Este parâmetro oferece suporte à normalização de texto em inglês, podendo melhorar o desempenho em cenários de leitura de números, mas aumenta ligeiramente a latência. Se não for fornecido, o valor padrão é false.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="propriedades">
    <ParamField body="sample_rate" type="number" default={32000}>
      Intervalo 【8000，16000，22050，24000，32000，44100】

      Taxa de amostragem da voz gerada. Opcional, padrão 32000.
    </ParamField>

    <ParamField body="bitrate" type="number" default={128000}>
      Intervalo 【32000，64000，128000，256000】

      Bitrate da voz gerada. Opcional, valor padrão 128000. Este parâmetro só é efetivo para áudio no formato mp3.
    </ParamField>

    <ParamField body="format" type="string" default="mp3">
      Formato do áudio gerado. Padrão mp3. Opções: `mp3`, `pcm`, `flac`, `wav`. wav é suportado apenas em saída não streaming.
    </ParamField>

    <ParamField body="channel" type="number" default={1}>
      Número de canais do áudio gerado. Padrão 1: mono. Opções:

      1: mono

      2: estéreo
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="propriedades">
    <ParamField body="tone" type="list">
      Substitui textos e símbolos que exigem marcação especial, bem como suas respectivas notações fonéticas.

      Substituição de pronúncia (ajuste de tom/substituição da pronúncia de outros caracteres), no seguinte formato:

      `["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]`

      Os tons são representados por números: primeiro tom (yinping) como 1, segundo tom (yangping) como 2, terceiro tom (shangsheng) como 3, quarto tom (qusheng) como 4, e tom neutro como 5.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="language_boost" type="string" default="null">
  Melhora a capacidade de reconhecimento para idiomas menos comuns e dialetos especificados. Após configurado, pode melhorar o desempenho de voz em cenários do idioma/dialeto especificado. Se o tipo de idioma menos comum não estiver claro, é possível selecionar "auto", e o modelo determinará autonomamente o tipo de idioma. Suporta os seguintes valores:

  `'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'`
</ParamField>

<ParamField body="voice_modify" type="object">
  Configurações do efeito de voz. Este parâmetro suporta os seguintes formatos de áudio: mp3, wav, flac

  <Expandable title="propriedades">
    <ParamField body="pitch" type="integer">
      Ajuste de altura tonal (grave/brilhante), intervalo \[-100,100]. Quanto mais próximo de -100, mais grave a voz; quanto mais próximo de 100, mais brilhante a voz
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajuste de intensidade (força/suavidade), intervalo \[-100,100]. Quanto mais próximo de -100, mais firme a voz; quanto mais próximo de 100, mais suave a voz
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajuste de timbre (magnético/nítido), intervalo \[-100,100]. Quanto mais próximo de -100, mais encorpada a voz; quanto mais próximo de 100, mais nítida a voz
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Configuração de efeitos sonoros. Só é possível selecionar um por vez. Valores opcionais:

      * `spacious_echo`（eco em espaço amplo）
      * `auditorium_echo`（transmissão de auditório）
      * `lofi_telephone`（distorção de telefone）
      * `robotic`（som eletrônico）
    </ParamField>
  </Expandable>
</ParamField>

## Parâmetros de informações da resposta

<ResponseField name="task_id" type="string" required={true}>
  O task\_id da tarefa assíncrona. Você deve usar este task\_id para solicitar a [API de consulta de resultado da tarefa](/pt/docs/models/reference-get-async-task-result) e obter o resultado gerado
</ResponseField>
