> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Síntese de voz síncrona MiniMax Speech-2.6-turbo

Esta API oferece suporte à geração síncrona baseada em texto para voz, com limite máximo de 10000 caracteres por envio de texto. Compatível com mais de 100 timbres de sistema e seleção independente de timbres clonados; permite ajustar volume, entonação, velocidade da fala e formato de saída; oferece suporte a mixagem proporcional, controle de intervalo fixo; e é compatível com várias especificações e formatos de áudio, incluindo: mp3, pcm, flac, wav, além de saída em streaming.

Após enviar uma solicitação de síntese de voz para texto longo, observe que a URL retornada é válida por 24 horas a partir do momento em que a URL é retornada. Fique atento ao prazo para baixar as informações.

<Tip>Adequada para cenários como geração de frases curtas, chat por voz e redes sociais online; tem baixa latência, mas o limite de comprimento do texto é inferior a 10000 caracteres. Para textos longos, recomenda-se usar [síntese de voz por chamada assíncrona](/pt/docs/models/reference-minimax-speech-2.6-turbo-async).</Tip>

## Cabeçalhos da solicitação

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticação Bearer: Bearer \{\{API Key}}.
</ParamField>

## Corpo da solicitação

<ParamField body="text" type="string" required={true}>
  Texto a ser sintetizado, com limite de comprimento inferior a 10000 caracteres; quebras de parágrafo devem ser substituídas por caracteres de nova linha. (Se precisar controlar o intervalo de tempo na fala, adicione \<#x#> entre caracteres, em que x está em segundos, com suporte a 0.01-99.99 e no máximo duas casas decimais). Oferece suporte à personalização do intervalo de tempo de fala entre textos, para obter o efeito de pausas personalizadas na fala do texto. Observe que o intervalo de tempo entre textos deve ser definido entre dois trechos de texto que possam ser pronunciados, e não é permitido definir vários intervalos de tempo consecutivos.
</ParamField>

<ParamField body="voice_setting" type="object" required={true}>
  <Expandable title="properties">
    <ParamField body="speed" type="float" default="1.0">
      Intervalo \[0.5,2], valor padrão 1.0

      Velocidade da fala gerada. Opcional. Quanto maior o valor, mais rápida será a fala.
    </ParamField>

    <ParamField body="vol" type="float" default="1.0">
      Intervalo (0,10], valor padrão 1.0

      Volume da voz gerada. Opcional. Quanto maior o valor, maior o volume.
    </ParamField>

    <ParamField body="pitch" type="int" default="0">
      Intervalo \[-12,12], valor padrão 0

      Entonação da voz gerada. Opcional. (0 indica saída no timbre original; o valor deve ser um inteiro).
    </ParamField>

    <ParamField body="voice_id" type="string">
      Número do timbre solicitado. Obrigatório escolher um entre este campo e timbre\_weights.

      Suporta dois tipos: timbres de sistema (id) e timbres clonados (id). Os timbres de sistema (ID) são:

      * Timbre de jovem inexperiente: `male-qn-qingse`
      * Timbre de jovem elite: `male-qn-jingying`
      * Timbre de jovem dominante: `male-qn-badao`
      * Timbre de universitário jovem: `male-qn-daxuesheng`
      * Timbre de garota jovem: `female-shaonv`
      * Timbre de mulher madura e elegante: `female-yujie`
      * Timbre de mulher madura: `female-chengshu`
      * Timbre de mulher doce: `female-tianmei`
      * Apresentador masculino: `presenter_male`
      * Apresentadora feminina: `presenter_female`
      * Audiolivro masculino 1: `audiobook_male_1`
      * Audiolivro masculino 2: `audiobook_male_2`
      * Audiolivro feminino 1: `audiobook_female_1`
      * Audiolivro feminino 2: `audiobook_female_2`
      * Timbre de jovem inexperiente-beta: `male-qn-qingse-jingpin`
      * Timbre de jovem elite-beta: `male-qn-jingying-jingpin`
      * Timbre de jovem dominante-beta: `male-qn-badao-jingpin`
      * Timbre de universitário jovem-beta: `male-qn-daxuesheng-jingpin`
      * Timbre de garota jovem-beta: `female-shaonv-jingpin`
      * Timbre de mulher madura e elegante-beta: `female-yujie-jingpin`
      * Timbre de mulher madura-beta: `female-chengshu-jingpin`
      * Timbre de mulher doce-beta: `female-tianmei-jingpin`
      * Menino inteligente: `clever_boy`
      * Menino fofo: `cute_boy`
      * Menina adorável: `lovely_girl`
      * Porquinha de desenho Xiaoqi: `cartoon_pig`
      * Irmão mais novo yandere: `bingjiao_didi`
      * Namorado bonito: `junlang_nanyou`
      * Calouro inocente: `chunzhen_xuedi`
      * Veterano indiferente: `lengdan_xiongzhang`
      * Jovem mestre dominador: `badao_shaoye`
      * Docinha Xiaoling: `tianxin_xiaoling`
      * Garota fofa e travessa: `qiaopi_mengmei`
      * Mulher madura sedutora: `wumei_yujie`
      * Caloura meiga: `diadia_xuemei`
      * Veterana elegante: `danya_xuejie`
      * Santa Claus: `Santa_Claus`
      * Grinch: `Grinch`
      * Rudolph: `Rudolph`
      * Arnold: `Arnold`
      * Charming Santa: `Charming_Santa`
      * Charming Lady: `Charming_Lady`
      * Sweet Girl: `Sweet_Girl`
      * Cute Elf: `Cute_Elf`
      * Attractive Girl: `Attractive_Girl`
      * Serene Woman: `Serene_Woman`
    </ParamField>

    <ParamField body="emotion" type="string">
      Controla a emoção da voz sintetizada;

      Atualmente oferece suporte a 7 emoções: feliz, triste, com raiva, com medo, com nojo, surpreso, neutro;

      Intervalo do parâmetro: `["happy", "sad", "angry", "fearful", "disgusted", "surprised", "neutral"]`
    </ParamField>

    <ParamField body="latex_read" type="bool" default="false">
      Controla se a leitura de fórmulas latex é suportada. O padrão é false.

      Observações:

      1. As fórmulas na solicitação precisam ter \$\$ no início e no fim;
      2. Se a fórmula na solicitação contiver "", ele deve ser escapado como "\\".

      Exemplo: a fórmula básica da derivada é `$$\\frac{d}{dx}(x^n) = nx^{n-1}$$`
    </ParamField>

    <ParamField body="text_normalization" type="bool" default="false">
      Este parâmetro oferece suporte à normalização de texto em inglês, podendo melhorar o desempenho em cenários de leitura de números, mas aumentando ligeiramente a latência. Se não for fornecido, o valor padrão será false.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="properties">
    <ParamField body="sample_rate" type="int" default="32000">
      Intervalo 【8000，16000，22050，24000，32000，44100】

      Taxa de amostragem da voz gerada. Opcional, padrão 32000.
    </ParamField>

    <ParamField body="bitrate" type="int" default="128000">
      Intervalo 【32000，64000，128000，256000】

      Taxa de bits da voz gerada. Opcional, valor padrão 128000. Este parâmetro só tem efeito para áudio no formato mp3.
    </ParamField>

    <ParamField body="format" type="string" default="mp3">
      Formato do áudio gerado. Padrão mp3, intervalo \[mp3,pcm,flac,wav]. wav é suportado apenas em saída não streaming.
    </ParamField>

    <ParamField body="channel" type="int" default="1">
      Número de canais do áudio gerado. Padrão 1: mono. Opções:

      1: mono

      2: estéreo
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="properties">
    <ParamField body="tone" type="list">
      Substitui textos, símbolos e suas respectivas pronúncias que precisam de anotação especial.

      Substituição de pronúncia (ajuste de tom/substituição da pronúncia de outros caracteres), no seguinte formato:

      `["燕少飞/(yan4)(shao3)(fei1)","达菲/(da2)(fei1)"，"omg/oh my god"]`

      Os tons são representados por números: primeiro tom (yinping) é 1, segundo tom (yangping) é 2, terceiro tom (shangsheng) é 3, quarto tom (qusheng) é 4, e tom neutro é 5.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="timbre_weights" type="object[]">
  Obrigatório escolher um entre este campo e voice\_id

  <Expandable title="properties">
    <ParamField body="voice_id" type="string">
      ID do timbre solicitado. Deve ser preenchido junto com o parâmetro weight.
    </ParamField>

    <ParamField body="weight" type="int">
      Intervalo \[1,100]

      Peso, deve ser preenchido em conjunto com voice\_id. Suporta mistura de no máximo 4 timbres. O valor deve ser um inteiro; quanto maior a proporção de um único timbre, mais o timbre sintetizado se parecerá com ele.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="stream" type="boolean" default="false">
  Indica se a saída será em streaming. O padrão é false, ou seja, streaming desativado.
</ParamField>

<ParamField body="stream_options" type="object">
  <Expandable title="properties">
    <ParamField body="exclude_aggregated_audio" type="boolean" default="false">
      Quando este parâmetro é definido como True, o último chunk do streaming não conterá os dados hex da fala completa concatenada. O padrão é False, ou seja, o último chunk contém os dados hex da fala completa concatenada.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="language_boost" type="string" default="null">
  Melhora a capacidade de reconhecimento para idiomas minoritários e dialetos especificados. Após a configuração, pode melhorar o desempenho de fala em cenários no idioma/dialeto especificado. Se o tipo de idioma minoritário não estiver claro, você pode escolher "auto" e o modelo determinará automaticamente o tipo de idioma minoritário. Suporta os seguintes valores:

  `'Chinese', 'Chinese,Yue', 'English', 'Arabic', 'Russian', 'Spanish', 'French', 'Portuguese', 'German', 'Turkish', 'Dutch', 'Ukrainian', 'Vietnamese', 'Indonesian', 'Japanese', 'Italian', 'Korean', 'Thai', 'Polish', 'Romanian', 'Greek', 'Czech', 'Finnish', 'Hindi', 'Bulgarian', 'Danish', 'Hebrew', 'Malay', 'Persian', 'Slovak', 'Swedish', 'Croatian', 'Filipino', 'Hungarian', 'Norwegian', 'Slovenian', 'Catalan', 'Nynorsk', 'Tamil', 'Afrikaans', 'auto'`
</ParamField>

<ParamField body="output_format" type="string" default="hex">
  Parâmetro que controla a forma do resultado de saída. Valores opcionais: `url` `hex`. O valor padrão é `hex`. Este parâmetro só tem efeito em cenários não streaming; em cenários de streaming, apenas o retorno no formato hex é suportado. A URL retornada é válida por 24 horas.
</ParamField>

<ParamField body="voice_modify" type="object">
  Configurações de efeitos de voz. Este parâmetro é compatível com os seguintes formatos de áudio:

  * Não streaming: mp3, wav, flac
  * Streaming: mp3

  <Expandable title="properties">
    <ParamField body="pitch" type="integer">
      Ajuste de altura (grave/brilhante), intervalo \[-100,100]. Quanto mais próximo de -100, mais grave a voz; quanto mais próximo de 100, mais brilhante a voz
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajuste de intensidade (força/suavidade), intervalo \[-100,100]. Quanto mais próximo de -100, mais firme a voz; quanto mais próximo de 100, mais suave a voz
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajuste de timbre (magnético/nítido), intervalo \[-100,100]. Quanto mais próximo de -100, mais encorpada a voz; quanto mais próximo de 100, mais nítida a voz
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Configuração de efeito sonoro; apenas uma opção pode ser selecionada por vez. Valores opcionais:

      * `spacious_echo` (eco amplo)
      * `auditorium_echo` (transmissão de auditório)
      * `lofi_telephone` (distorção telefônica)
      * `robotic` (voz eletrônica)
    </ParamField>
  </Expandable>
</ParamField>

## Informações da resposta

<ResponseField name="audio" type="string">
  Segmento de áudio sintetizado, codificado em hex, gerado de acordo com o formato definido na entrada (`audio_setting.format`) (mp3/pcm/flac). A forma de retorno segue a definição de `output_format`; quando `stream` é true, apenas o formato de retorno hex é suportado.
</ResponseField>

<ResponseField name="status" type="number">
  Status atual do fluxo de áudio, retornado somente quando `stream` é true. 1 indica sintetizando, 2 indica fim da síntese.
</ResponseField>
