> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# MiniMax Speech 2.8 Turbo Síntese de voz síncrona

Converte texto em voz, com suporte a várias vozes, controle de emoção, ajuste de velocidade de fala e outros recursos. O comprimento do texto deve ser inferior a 10000 caracteres. Se o comprimento do texto for maior que 3000 caracteres, recomenda-se usar saída em streaming.

## Cabeçalhos da requisição

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticação Bearer: Bearer \{\{API Key}}.
</ParamField>

## Corpo da requisição

<ParamField body="text" type="string" required={true}>
  Texto a ser sintetizado em voz. O comprimento deve ser inferior a 10000 caracteres. Se o comprimento do texto for maior que 3000 caracteres, recomenda-se usar saída em streaming. Suporta troca de parágrafos (quebras de linha), controle de pausas (marcador `&lt;#x#&gt;`) e tags de interjeição/expressão (como (laughs), (coughs) etc.; compatível apenas com speech-2.8-hd/turbo)
</ParamField>

<ParamField body="stream" type="boolean" default={false}>
  Controla se a saída será em streaming. O padrão é false, ou seja, streaming desativado
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Ajuste de altura tonal (grave/brilhante), intervalo \[-100, 100]. Quanto mais próximo de -100, mais grave será a voz; quanto mais próximo de 100, mais brilhante será a voz

      Intervalo de valores: \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajuste de timbre (magnético/cristalino), intervalo \[-100, 100]. Quanto mais próximo de -100, mais encorpada será a voz; quanto mais próximo de 100, mais cristalina será a voz

      Intervalo de valores: \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajuste de intensidade (força/suavidade), intervalo \[-100, 100]. Quanto mais próximo de -100, mais firme será a voz; quanto mais próximo de 100, mais suave será a voz

      Intervalo de valores: \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Configuração de efeito sonoro. Apenas um tipo pode ser selecionado por vez. Valores disponíveis: spacious\_echo (eco em espaço amplo), auditorium\_echo (transmissão em auditório), lofi\_telephone (distorção de telefone), robotic (som eletrônico)

      Valores disponíveis: `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Formato do áudio gerado. wav é compatível apenas em saída sem streaming

      Valores disponíveis: `mp3`, `pcm`, `flac`, `wav`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Taxa de bits do áudio gerado. Intervalo disponível \[32000, 64000, 128000, 256000], valor padrão 128000. Este parâmetro só é efetivo para áudio no formato mp3

      Valores disponíveis: `32000`, `64000`, `128000`, `256000`
    </ParamField>

    <ParamField body="channel" type="integer" default={1}>
      Número de canais do áudio gerado. Intervalo disponível: \[1, 2], em que 1 é mono e 2 é estéreo. O valor padrão é 1

      Valores disponíveis: `1`, `2`
    </ParamField>

    <ParamField body="force_cbr" type="boolean" default={false}>
      Controle de taxa de bits constante (cbr) para o áudio; opções: false, true. Quando este parâmetro é definido como true, o áudio será codificado com taxa de bits constante. Observação: este parâmetro só é efetivo quando o áudio está configurado para saída em streaming e o formato de áudio é mp3
    </ParamField>

    <ParamField body="sample_rate" type="integer" default={32000}>
      Taxa de amostragem do áudio gerado. Intervalo disponível \[8000, 16000, 22050, 24000, 32000, 44100], padrão 32000

      Valores disponíveis: `8000`, `16000`, `22050`, `24000`, `32000`, `44100`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="output_format" type="string" default="hex">
  Parâmetro que controla o formato do resultado de saída. Valores disponíveis: url, hex; o padrão é hex. Este parâmetro só é efetivo em cenários sem streaming; cenários com streaming só oferecem retorno no formato hex. A url retornada é válida por 24 horas

  Valores disponíveis: `url`, `hex`
</ParamField>

<ParamField body="voice_setting" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Volume do áudio sintetizado. Quanto maior o valor, maior o volume. Intervalo de valores (0, 10], valor padrão 1.0

      Intervalo de valores: \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Tom do áudio sintetizado. Intervalo de valores \[-12, 12], valor padrão 0, em que 0 representa a saída com a voz original

      Intervalo de valores: \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Velocidade de fala do áudio sintetizado. Quanto maior o valor, mais rápida a fala. Intervalo de valores \[0.5, 2], valor padrão 1.0

      Intervalo de valores: \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Controla a emoção da voz sintetizada. Os parâmetros correspondem a 8 emoções: feliz (happy), triste (sad), raiva (angry), medo (fearful), nojo (disgusted), surpresa (surprised), neutra (calm), expressiva (fluent) e sussurro (whisper). O modelo selecionará automaticamente uma emoção adequada com base no texto de entrada; em geral, não é necessário especificá-la manualmente

      Valores disponíveis: `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      ID da voz do áudio sintetizado. Se precisar configurar uma voz misturada, defina o parâmetro timber\_weights e deixe este parâmetro vazio. Suporta três tipos: vozes do sistema, vozes clonadas e vozes geradas a partir de texto
    </ParamField>

    <ParamField body="latex_read" type="boolean" default={false}>
      Controla se fórmulas latex serão lidas em voz alta. O padrão é false. Compatível apenas com chinês; após ativar este parâmetro, o parâmetro language\_boost será definido como Chinese
    </ParamField>

    <ParamField body="text_normalization" type="boolean" default={false}>
      Define se a normalização de texto em chinês e inglês será ativada. Quando ativada, pode melhorar o desempenho em cenários de leitura de números, mas aumenta ligeiramente a latência. O valor padrão é false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Controla a adição de uma marcação rítmica de áudio ao final do áudio sintetizado. O valor padrão é false. Este parâmetro só é efetivo para síntese sem streaming
</ParamField>

<ParamField body="language_boost" type="string">
  Define se a capacidade de reconhecimento de idiomas menos comuns e dialetos especificados será aprimorada. O valor padrão é null; pode ser definido como auto para permitir que o modelo faça a avaliação automaticamente

  Valores disponíveis: `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="stream_options" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="exclude_aggregated_audio" type="boolean" default={false}>
      Define se o último chunk deve conter os dados de voz em hex após a concatenação. O valor padrão é false, ou seja, o último chunk contém os dados hex da voz completa após a concatenação
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="timber_weights" type="object[]">
  Configuração de voz misturada, com suporte a mistura de até 4 vozes

  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="weight" type="integer" required={true}>
      Peso de cada voz no áudio sintetizado; deve ser preenchido em conjunto com voice\_id. O intervalo de valores disponível é \[1, 100], com suporte a mistura de até 4 vozes. Quanto maior a proporção de uma única voz, maior a semelhança da voz sintetizada com essa voz

      Intervalo de valores: \[1, 100]
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      ID da voz do áudio sintetizado; deve ser preenchido em conjunto com o parâmetro weight. Suporta três tipos: vozes do sistema, vozes clonadas e vozes geradas a partir de texto
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="subtitle_enable" type="boolean" default={false}>
  Controla se o serviço de legendas será ativado. O valor padrão é false. Este parâmetro é válido apenas em cenários de saída sem streaming e apenas para os modelos speech-2.6-hd, speech-2.6-turbo, speech-01-turbo, speech-01-hd
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Ative este parâmetro para tornar a transição entre subfrases mais natural. Compatível apenas com os modelos speech-2.8-hd e speech-2.8-turbo
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Define regras de substituição de anotação fonética ou pronúncia para textos ou símbolos que exigem marcação especial. Em textos em chinês, os tons são representados por números: primeiro tom é 1, segundo tom é 2, terceiro tom é 3, quarto tom é 4 e tom neutro é 5. Exemplo: \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Informações da resposta

<ResponseField name="data" type="object" required={false}>
  Objeto de dados de síntese retornado; pode ser null, portanto é necessário verificar se não está vazio
</ResponseField>

<ResponseField name="trace_id" type="string" required={false}>
  id desta sessão, usado para ajudar a localizar problemas durante consultas/feedback
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  Código de status e detalhes desta requisição
</ResponseField>

<ResponseField name="extra_info" type="object" required={false}>
  Informações adicionais do áudio
</ResponseField>
