> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Síntese de voz assíncrona MiniMax Speech 2.8 HD

Use esta API para criar tarefas assíncronas de síntese de voz. Suporta entrada por texto ou arquivo; o limite máximo é de 50 mil caracteres para texto e 100 mil caracteres para arquivos.

<Tip>
  Esta é uma API **assíncrona** e retornará apenas o task\_id da tarefa assíncrona. Você deve usar esse task\_id para solicitar a [API de consulta de resultado da tarefa](/pt/docs/models/reference-get-async-task-result) para recuperar o resultado gerado.
</Tip>

## Cabeçalhos da solicitação

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticação Bearer: Bearer \{\{API Key}}.
</ParamField>

## Corpo da solicitação

<ParamField body="text" type="string">
  Texto do áudio a ser sintetizado, com limite máximo de 50 mil caracteres. Obrigatório escolher um entre `text` e `text_file_id`<br /><br />• Tags de interjeição: somente quando o modelo selecionado for `speech-2.8-hd` ou `speech-2.8-turbo`, há suporte para inserir tags de interjeição no texto. Interjeições suportadas: `(laughs)` (risada), `(chuckle)` (risadinha), `(coughs)` (tosse), `(clear-throat)` (limpar a garganta), `(groans)` (gemido), `(breath)` (respiração normal), `(pant)` (ofegar), `(inhale)` (inspirar), `(exhale)` (expirar), `(gasps)` (gasp), `(sniffs)` (fungar), `(sighs)` (suspiro), `(snorts)` (bufar), `(burps)` (arroto), `(lip-smacking)` (estalo de lábios), `(humming)` (cantarolar), `(hissing)` (sibilo), `(emm)` (hum), `(whistles)` (assobio), `(sneezes)` (espirro), `(crying)` (soluço), `(applause)` (aplausos)
</ParamField>

<ParamField body="text_file_id" type="integer">
  id do arquivo de texto do áudio a ser sintetizado. O limite de comprimento de um único arquivo é inferior a 100 mil caracteres. Formatos de arquivo suportados: txt, zip. Obrigatório escolher um entre `text` e `text_file_id`; após o envio, o formato será validado automaticamente.<br />• **Arquivo txt**: limite de comprimento \<100000 caracteres. Suporta o uso de `&lt;#x#&gt;` para marcar pausas personalizadas. x é a duração da pausa (unidade: segundos), no intervalo \[0.01, 99.99], com no máximo duas casas decimais. Observe que a pausa deve ser definida entre dois trechos de texto que possam ser pronunciados por voz; não é permitido usar várias marcações de pausa consecutivamente<br />• **Arquivo zip**:<br />• O pacote compactado deve conter arquivos txt ou json no mesmo formato.<br />• Formato do arquivo json: suporta três campos, \[`title`, `content`, `extra`], que indicam, respectivamente, título, corpo do texto e informações adicionais. Se os três campos existirem, serão gerados 3 conjuntos de resultados, totalizando 9 arquivos, armazenados juntos em uma única pasta. Se algum campo não existir ou seu conteúdo estiver vazio, o resultado correspondente a esse campo não será gerado
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="propriedades" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Ajuste de altura tonal (grave/brilhante), intervalo \[-100, 100]. Quanto mais próximo de -100, mais grave será a voz; quanto mais próximo de 100, mais brilhante será a voz

      Intervalo de valores: \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajuste de timbre (magnético/cristalino), intervalo \[-100, 100]. Quanto mais próximo de -100, mais encorpada será a voz; quanto mais próximo de 100, mais cristalina será a voz

      Intervalo de valores: \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajuste de intensidade (sensação de força/suavidade), intervalo \[-100, 100]. Quanto mais próximo de -100, mais firme será a voz; quanto mais próximo de 100, mais suave será a voz

      Intervalo de valores: \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Configuração de efeito sonoro; apenas uma opção pode ser selecionada por vez. Valores opcionais:

      1. spacious\_echo (eco em espaço amplo)
      2. auditorium\_echo (transmissão em auditório)
      3. lofi\_telephone (distorção de telefone)
      4. robotic (voz eletrônica)

      Valores opcionais: `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="propriedades" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Formato do áudio gerado. Intervalo opcional \[mp3, pcm, flac], valor padrão `mp3`

      Valores opcionais: `mp3`, `pcm`, `flac`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Bitrate do áudio gerado. Intervalo opcional \[32000, 64000, 128000, 256000], valor padrão `128000`. Este parâmetro é válido apenas para áudio no formato `mp3`
    </ParamField>

    <ParamField body="channel" type="integer" default={2}>
      Número de canais do áudio gerado. Intervalo opcional: \[1, 2], em que `1` é mono e `2` é estéreo; o valor padrão é 1
    </ParamField>

    <ParamField body="audio_sample_rate" type="integer" default={32000}>
      Taxa de amostragem do áudio gerado. Intervalo opcional \[8000, 16000, 22050, 24000, 32000, 44100], padrão `32000`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="propriedades" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Volume do áudio sintetizado. Quanto maior o valor, maior o volume. Intervalo de valores (0, 10], valor padrão 1.0

      Intervalo de valores: \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Tom do áudio sintetizado, intervalo de valores \[-12, 12], valor padrão 0, em que 0 representa a saída no timbre original

      Intervalo de valores: \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Velocidade de fala do áudio sintetizado. Quanto maior o valor, mais rápida a fala. Intervalo de valores \[0.5, 2], valor padrão 1.0

      Intervalo de valores: \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Controla a emoção da voz sintetizada. O intervalo de parâmetros é \["happy", "sad", "angry", "fearful", "disgusted", "surprised", "calm", "fluent", "whisper"], correspondendo respectivamente a 8 emoções: feliz, triste, com raiva, com medo, com nojo, surpreso, neutro, vívido, sussurrado
      <br />• O modelo corresponderá automaticamente a emoção adequada com base no texto de entrada; geralmente não é necessário especificá-la manualmente
      <br />• Este parâmetro é válido apenas para os modelos `speech-2.6-hd`, `speech-2.6-turbo`, `speech-01-hd`, `speech-01-turbo`
      <br />• As opções `fluent`, `whisper` são válidas apenas para os modelos `speech-2.6-turbo`, `speech-2.6-hd`

      Valores opcionais: `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      ID do timbre do áudio sintetizado. Se precisar configurar timbres mistos, defina o parâmetro timber\_weights e deixe este parâmetro vazio. Suporta três tipos: timbres do sistema, timbres clonados e timbres gerados a partir de texto. A seguir estão alguns dos timbres do sistema (ID) mais recentes; você pode consultar todos os timbres suportados oficialmente
      <br />• **Chinês**:<br />• moss\_audio\_ce44fc67-7ce3-11f0-8de5-96e35d26fb85<br />• moss\_audio\_aaa1346a-7ce7-11f0-8e61-2e6e3c7ee85d<br />• Chinese (Mandarin)\_Lyrical\_Voice<br />• Chinese (Mandarin)\_HK\_Flight\_Attendant<br />• **Inglês**:<br />• English\_Graceful\_Lady<br />• English\_Insightful\_Speaker<br />• English\_radiant\_girl<br />• English\_Persuasive\_Man<br />• moss\_audio\_6dc281eb-713c-11f0-a447-9613c873494c<br />• moss\_audio\_570551b1-735c-11f0-b236-0adeeecad052<br />• moss\_audio\_ad5baf92-735f-11f0-8263-fe5a2fe98ec8<br />• English\_Lucky\_Robot<br />• **Japonês**:<br />• Japanese\_Whisper\_Belle<br />• moss\_audio\_24875c4a-7be4-11f0-9359-4e72c55db738<br />• moss\_audio\_7f4ee608-78ea-11f0-bb73-1e2a4cfcd245<br />• moss\_audio\_c1a6a3ac-7be6-11f0-8e8e-36b92fbb4f95
    </ParamField>

    <ParamField body="english_normalization" type="boolean" default={false}>
      Suporta normalização de texto em inglês. Quando ativado, pode melhorar o desempenho em cenários de leitura de números, mas aumenta ligeiramente a latência. O padrão é false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Controla a adição de uma marcação rítmica de áudio ao final do áudio sintetizado. O valor padrão é False. Este parâmetro é válido apenas para síntese não streaming
</ParamField>

<ParamField body="language_boost" type="string">
  Indica se deve aprimorar a capacidade de reconhecimento de idiomas minoritários e dialetos especificados. O valor padrão é `null`; pode ser definido como `auto` para permitir que o modelo decida autonomamente.

  Valores opcionais: `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Ative este parâmetro para tornar a transição entre subfrases mais natural. Suportado apenas pelos modelos `speech-2.8-hd` e `speech-2.8-turbo`
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="propriedades" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Define regras de anotação fonética ou substituição de pronúncia correspondentes a textos ou símbolos que exigem marcação especial. Em textos em chinês, os tons são representados por números:
      primeiro tom como `1`, segundo tom como `2`, terceiro tom como `3`, quarto tom como `4`, tom neutro como `5`
      Exemplo:
      \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Informações de resposta

<ResponseField name="file_id" type="integer" required={false}>
  ID do arquivo de áudio correspondente retornado após a criação bem-sucedida da tarefa.<br /><br />• Depois que a tarefa for concluída, é possível consultar pelo file\_id. Quando ocorrer um erro na solicitação, este campo não será retornado

  Observação: a URL de download retornada é válida por 9 horas (32400 segundos) a partir da geração. Após expirar, o arquivo ficará inválido e as informações geradas serão perdidas; preste atenção ao prazo das informações de download
</ResponseField>

<ResponseField name="task_id" type="string" required={false}>
  Use o task\_id para solicitar a [API de consulta de resultado da tarefa](/pt/docs/models/reference-get-async-task-result) para recuperar a saída gerada.
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  <Expandable title="propriedades" defaultOpen={true}>
    <ResponseField name="status_msg" type="string" required={true}>
      Detalhes do status
    </ResponseField>

    <ResponseField name="status_code" type="integer" required={true}>
      Código de status<br /><br />• `0`: normal<br />• `1002`: limite de taxa<br />• `1004`: falha na autenticação<br />• `1039`: limite de taxa TPM acionado<br />• `1042`: caracteres ilegais acima de 10%<br />• `2013`: erro de parâmetro
    </ResponseField>
  </Expandable>
</ResponseField>

<ResponseField name="task_token" type="string" required={false}>
  Informações da chave usadas para concluir a tarefa atual
</ResponseField>

<ResponseField name="usage_characters" type="integer" required={false}>
  Número de caracteres faturáveis
</ResponseField>
