> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Síntese de voz assíncrona MiniMax Speech-2.6-turbo

Esta API oferece suporte à geração assíncrona de texto para voz. Uma única transmissão de geração de texto oferece suporte a até 1 milhão de caracteres, e o resultado completo de áudio gerado pode ser recuperado de forma assíncrona. Oferece suporte a mais de 100 vozes do sistema e à seleção independente de vozes clonadas; também permite ajustar de forma independente entonação, velocidade, volume, bitrate, taxa de amostragem e formato de saída.

Após enviar uma solicitação de síntese de voz para texto longo, observe que a URL retornada é válida por 24 horas a partir do momento em que a URL é retornada. Preste atenção ao horário para baixar as informações.

<Tip>Adequada para geração de voz de textos longos, como livros inteiros; o tempo de fila da tarefa pode ser relativamente longo. Para frases curtas, chat por voz, redes sociais online e cenários semelhantes, recomenda-se usar a [síntese de voz por chamada síncrona](/pt/docs/models/reference-minimax-speech-2.6-turbo).</Tip>

## Cabeçalhos da solicitação

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticação Bearer: Bearer \{\{API Key}}.
</ParamField>

## Corpo da solicitação

<ParamField body="text" type="string" required={true}>
  Texto a ser sintetizado, com limite máximo de 50 mil caracteres.
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="properties">
    <ParamField body="speed" type="number" default={1.0}>
      Intervalo \[0.5,2], valor padrão 1.0

      Velocidade da fala gerada. Opcional; quanto maior o valor, mais rápida a fala.
    </ParamField>

    <ParamField body="vol" type="number" default={1.0}>
      Intervalo (0,10], valor padrão 1.0

      Volume da voz gerada. Opcional; quanto maior o valor, maior o volume.
    </ParamField>

    <ParamField body="pitch" type="number" default={0}>
      Intervalo \[-12,12], valor padrão 0

      Entonação da voz gerada. Opcional; 0 indica saída da voz original, e o valor deve ser um número inteiro.
    </ParamField>

    <ParamField body="voice_id" type="string">
      ID da voz solicitada.

      Oferece suporte a dois tipos: vozes do sistema (id) e vozes clonadas (id). As vozes do sistema (ID) são:

      * Voz masculina jovem e inexperiente: `male-qn-qingse`
      * Voz masculina jovem de elite: `male-qn-jingying`
      * Voz masculina jovem dominante: `male-qn-badao`
      * Voz masculina de universitário jovem: `male-qn-daxuesheng`
      * Voz de garota: `female-shaonv`
      * Voz feminina madura e imponente: `female-yujie`
      * Voz feminina madura: `female-chengshu`
      * Voz feminina doce: `female-tianmei`
      * Apresentador masculino: `presenter_male`
      * Apresentadora feminina: `presenter_female`
      * Audiolivro masculino 1: `audiobook_male_1`
      * Audiolivro masculino 2: `audiobook_male_2`
      * Audiolivro feminino 1: `audiobook_female_1`
      * Audiolivro feminino 2: `audiobook_female_2`
      * Voz masculina jovem e inexperiente-beta: `male-qn-qingse-jingpin`
      * Voz masculina jovem de elite-beta: `male-qn-jingying-jingpin`
      * Voz masculina jovem dominante-beta: `male-qn-badao-jingpin`
      * Voz masculina de universitário jovem-beta: `male-qn-daxuesheng-jingpin`
      * Voz de garota-beta: `female-shaonv-jingpin`
      * Voz feminina madura e imponente-beta: `female-yujie-jingpin`
      * Voz feminina madura-beta: `female-chengshu-jingpin`
      * Voz feminina doce-beta: `female-tianmei-jingpin`
      * Menino esperto: `clever_boy`
      * Menino fofo: `cute_boy`
      * Menina adorável: `lovely_girl`
      * Porquinha de desenho Xiaoqi: `cartoon_pig`
      * Irmão mais novo yandere: `bingjiao_didi`
      * Namorado bonito: `junlang_nanyou`
      * Calouro inocente: `chunzhen_xuedi`
      * Veterano indiferente: `lengdan_xiongzhang`
      * Jovem mestre dominante: `badao_shaoye`
      * Queridinha Xiaoling: `tianxin_xiaoling`
      * Menina fofa e brincalhona: `qiaopi_mengmei`
      * Mulher madura sedutora: `wumei_yujie`
      * Colega mais nova dengosa: `diadia_xuemei`
      * Colega mais velha elegante: `danya_xuejie`
      * Santa Claus: `Santa_Claus`
      * Grinch: `Grinch`
      * Rudolph: `Rudolph`
      * Arnold: `Arnold`
      * Charming Santa: `Charming_Santa`
      * Charming Lady: `Charming_Lady`
      * Sweet Girl: `Sweet_Girl`
      * Cute Elf: `Cute_Elf`
      * Attractive Girl: `Attractive_Girl`
      * Serene Woman: `Serene_Woman`
    </ParamField>

    <ParamField body="emotion" type="string">
      Controla a emoção da voz sintetizada;

      Atualmente oferece suporte a 7 emoções: feliz, triste, irritada, com medo, enojada, surpresa, neutra;

      Intervalo de parâmetros: `["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]`
    </ParamField>

    <ParamField body="text_normalization" type="bool" default="false">
      Este parâmetro oferece suporte à normalização de texto em inglês, o que pode melhorar o desempenho em cenários de leitura de números, mas aumentará ligeiramente a latência. Se não for fornecido, o valor padrão será false.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="properties">
    <ParamField body="sample_rate" type="number" default={32000}>
      Intervalo 【8000，16000，22050，24000，32000，44100】

      Taxa de amostragem da voz gerada. Opcional, padrão 32000.
    </ParamField>

    <ParamField body="bitrate" type="number" default={128000}>
      Intervalo 【32000，64000，128000，256000】

      Bitrate da voz gerada. Opcional, valor padrão 128000. Este parâmetro é efetivo apenas para áudio no formato mp3.
    </ParamField>

    <ParamField body="format" type="string" default="mp3">
      Formato do áudio gerado. Padrão mp3. Opções: `mp3`, `pcm`, `flac`, `wav`. wav é compatível apenas em saída não streaming.
    </ParamField>

    <ParamField body="channel" type="number" default={1}>
      Número de canais do áudio gerado. Padrão 1: mono. Opções:

      1: mono

      2: estéreo
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="properties">
    <ParamField body="tone" type="list">
      Substitui textos, símbolos e respectivas pronúncias que exigem marcação especial.

      Substituição de pronúncia (ajuste de tom/substituição da pronúncia de outros caracteres), no seguinte formato:

      `["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]`

      Os tons são representados por números: primeiro tom (yinping) é 1, segundo tom (yangping) é 2, terceiro tom (shangsheng) é 3, quarto tom (qusheng) é 4, e tom neutro é 5.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="language_boost" type="string" default="null">
  Melhora a capacidade de reconhecimento de idiomas menos comuns e dialetos especificados. Após a configuração, pode melhorar o desempenho da fala em cenários do idioma/dialeto especificado. Se o tipo de idioma menos comum não estiver claro, você pode selecionar "auto", e o modelo determinará autonomamente o tipo do idioma. Oferece suporte aos seguintes valores:

  `'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'`
</ParamField>

<ParamField body="voice_modify" type="object">
  Configurações de efeitos de voz. Formatos de áudio compatíveis com este parâmetro: mp3, wav, flac

  <Expandable title="properties">
    <ParamField body="pitch" type="integer">
      Ajuste de altura tonal (grave/brilhante), intervalo \[-100,100]. Quanto mais próximo de -100, mais grave é a voz; quanto mais próximo de 100, mais brilhante é a voz
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajuste de intensidade (força/suavidade), intervalo \[-100,100]. Quanto mais próximo de -100, mais firme é a voz; quanto mais próximo de 100, mais suave é a voz
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajuste de timbre (magnético/nítido), intervalo \[-100,100]. Quanto mais próximo de -100, mais encorpada é a voz; quanto mais próximo de 100, mais nítida é a voz
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Configuração de efeito sonoro. Apenas uma opção pode ser selecionada por vez. Valores disponíveis:

      * `spacious_echo`（eco amplo）
      * `auditorium_echo`（transmissão em auditório）
      * `lofi_telephone`（distorção de telefone）
      * `robotic`（voz eletrônica）
    </ParamField>
  </Expandable>
</ParamField>

## Parâmetros de informações da resposta

<ResponseField name="task_id" type="string" required={true}>
  O task\_id da tarefa assíncrona. Você deve usar este task\_id para solicitar a [API de consulta de resultado da tarefa](/pt/docs/models/reference-get-async-task-result) a fim de obter o resultado gerado
</ResponseField>
