> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Síntese de voz síncrona MiniMax Speech 2.8 HD

Converta texto em fala, com suporte a várias vozes, controle de emoção, ajuste de velocidade de fala e outros recursos. O limite de comprimento do texto é inferior a 10000 caracteres; se o texto tiver mais de 3000 caracteres, recomenda-se usar saída em streaming.

## Cabeçalhos da requisição

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticação Bearer: Bearer \{\{API Key}}.
</ParamField>

## Corpo da requisição

<ParamField body="text" type="string" required={true}>
  O texto a ser sintetizado em fala. O limite de comprimento é inferior a 10000 caracteres; se o texto tiver mais de 3000 caracteres, recomenda-se usar saída em streaming. Oferece suporte a troca de parágrafos (quebras de linha), controle de pausas (marcador `&lt;#x#&gt;`) e tags de interjeições (como (laughs), (coughs), etc.; compatível apenas com speech-2.8-hd/turbo)
</ParamField>

<ParamField body="stream" type="boolean" default={false}>
  Controla se a saída será em streaming. O padrão é false, ou seja, streaming desativado
</ParamField>

<ParamField body="voice_modify" type="object">
  <Expandable title="propriedades" defaultOpen={true}>
    <ParamField body="pitch" type="integer">
      Ajuste de altura vocal (grave/brilhante), intervalo \[-100, 100]. Quanto mais próximo de -100, mais grave a voz; quanto mais próximo de 100, mais brilhante a voz

      Intervalo de valores: \[-100, 100]
    </ParamField>

    <ParamField body="timbre" type="integer">
      Ajuste de timbre (encorpado/cristalino), intervalo \[-100, 100]. Quanto mais próximo de -100, mais encorpada a voz; quanto mais próximo de 100, mais cristalina a voz

      Intervalo de valores: \[-100, 100]
    </ParamField>

    <ParamField body="intensity" type="integer">
      Ajuste de intensidade (força/suavidade), intervalo \[-100, 100]. Quanto mais próximo de -100, mais firme a voz; quanto mais próximo de 100, mais suave a voz

      Intervalo de valores: \[-100, 100]
    </ParamField>

    <ParamField body="sound_effects" type="string">
      Configuração de efeito sonoro. Apenas um pode ser selecionado por vez. Valores disponíveis: spacious\_echo (eco em espaço aberto), auditorium\_echo (transmissão em auditório), lofi\_telephone (distorção de telefone), robotic (voz eletrônica)

      Valores disponíveis: `spacious_echo`, `auditorium_echo`, `lofi_telephone`, `robotic`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="audio_setting" type="object">
  <Expandable title="propriedades" defaultOpen={true}>
    <ParamField body="format" type="string" default="mp3">
      Formato do áudio gerado. wav é compatível apenas com saída não streaming

      Valores disponíveis: `mp3`, `pcm`, `flac`, `wav`
    </ParamField>

    <ParamField body="bitrate" type="integer" default={128000}>
      Taxa de bits do áudio gerado. Intervalo disponível \[32000, 64000, 128000, 256000], valor padrão 128000. Este parâmetro só tem efeito para áudio no formato mp3

      Valores disponíveis: `32000`, `64000`, `128000`, `256000`
    </ParamField>

    <ParamField body="channel" type="integer" default={1}>
      Número de canais do áudio gerado. Intervalo disponível: \[1, 2], em que 1 é mono e 2 é estéreo. O valor padrão é 1

      Valores disponíveis: `1`, `2`
    </ParamField>

    <ParamField body="force_cbr" type="boolean" default={false}>
      Controle de taxa de bits constante (cbr) para áudio; opções: false, true. Quando este parâmetro é definido como true, o áudio será codificado com taxa de bits constante. Observação: este parâmetro só tem efeito quando o áudio está configurado para saída em streaming e o formato de áudio é mp3
    </ParamField>

    <ParamField body="sample_rate" type="integer" default={32000}>
      Taxa de amostragem do áudio gerado. Intervalo disponível \[8000, 16000, 22050, 24000, 32000, 44100], padrão 32000

      Valores disponíveis: `8000`, `16000`, `22050`, `24000`, `32000`, `44100`
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="output_format" type="string" default="hex">
  Parâmetro que controla o formato do resultado de saída. Os valores disponíveis são url e hex; o valor padrão é hex. Este parâmetro só tem efeito em cenários não streaming; em cenários de streaming, apenas o retorno em formato hex é compatível. A url retornada é válida por 24 horas

  Valores disponíveis: `url`, `hex`
</ParamField>

<ParamField body="voice_setting" type="object">
  <Expandable title="propriedades" defaultOpen={true}>
    <ParamField body="vol" type="number" default={1}>
      Volume do áudio sintetizado. Quanto maior o valor, maior o volume. Intervalo de valores (0, 10], valor padrão 1.0

      Intervalo de valores: \[0, 10]
    </ParamField>

    <ParamField body="pitch" type="integer" default={0}>
      Tom do áudio sintetizado. Intervalo de valores \[-12, 12], valor padrão 0, em que 0 indica saída com o timbre original

      Intervalo de valores: \[-12, 12]
    </ParamField>

    <ParamField body="speed" type="number" default={1}>
      Velocidade de fala do áudio sintetizado. Quanto maior o valor, mais rápida a fala. Intervalo de valores \[0.5, 2], valor padrão 1.0

      Intervalo de valores: \[0.5, 2]
    </ParamField>

    <ParamField body="emotion" type="string">
      Controla a emoção da fala sintetizada. O intervalo de parâmetros corresponde a 8 emoções: feliz (happy), triste (sad), irritado (angry), com medo (fearful), com nojo (disgusted), surpreso (surprised), neutro (calm), vívido (fluent), sussurro (whisper). O modelo corresponderá automaticamente a emoção adequada de acordo com o texto de entrada; em geral, não é necessário especificar manualmente

      Valores disponíveis: `happy`, `sad`, `angry`, `fearful`, `disgusted`, `surprised`, `calm`, `fluent`, `whisper`
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      ID da voz do áudio sintetizado. Se precisar configurar uma voz mista, defina o parâmetro timber\_weights e deixe este parâmetro vazio. Oferece suporte a três tipos: vozes do sistema, vozes clonadas e vozes geradas a partir de texto
    </ParamField>

    <ParamField body="latex_read" type="boolean" default={false}>
      Controla se fórmulas latex serão lidas, padrão false. Compatível apenas com chinês. Após ativar este parâmetro, o parâmetro language\_boost será definido como Chinese
    </ParamField>

    <ParamField body="text_normalization" type="boolean" default={false}>
      Define se a normalização de texto em chinês e inglês será ativada. Após ativada, pode melhorar o desempenho em cenários de leitura de números, mas aumentará ligeiramente a latência. O valor padrão é false
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="aigc_watermark" type="boolean" default={false}>
  Controla a adição de um identificador de ritmo de áudio ao final do áudio sintetizado. O valor padrão é false. Este parâmetro só tem efeito para síntese não streaming
</ParamField>

<ParamField body="language_boost" type="string">
  Define se a capacidade de reconhecimento para idiomas minoritários e dialetos especificados será aprimorada. O valor padrão é null; pode ser definido como auto para permitir que o modelo julgue automaticamente

  Valores disponíveis: `Chinese`, `Chinese,Yue`, `English`, `Arabic`, `Russian`, `Spanish`, `French`, `Portuguese`, `German`, `Turkish`, `Dutch`, `Ukrainian`, `Vietnamese`, `Indonesian`, `Japanese`, `Italian`, `Korean`, `Thai`, `Polish`, `Romanian`, `Greek`, `Czech`, `Finnish`, `Hindi`, `Bulgarian`, `Danish`, `Hebrew`, `Malay`, `Persian`, `Slovak`, `Swedish`, `Croatian`, `Filipino`, `Hungarian`, `Norwegian`, `Slovenian`, `Catalan`, `Nynorsk`, `Tamil`, `Afrikaans`, `auto`
</ParamField>

<ParamField body="stream_options" type="object">
  <Expandable title="propriedades" defaultOpen={true}>
    <ParamField body="exclude_aggregated_audio" type="boolean" default={false}>
      Define se o último chunk contém os dados de áudio hex concatenados. O valor padrão é false, ou seja, o último chunk contém os dados hex do áudio completo após a concatenação
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="timber_weights" type="object[]">
  Configuração de voz mista, com suporte a no máximo 4 vozes misturadas

  <Expandable title="propriedades" defaultOpen={true}>
    <ParamField body="weight" type="integer" required={true}>
      Peso de cada voz no áudio sintetizado; deve ser preenchido junto com voice\_id. O intervalo de valores disponível é \[1, 100], com suporte a no máximo 4 vozes misturadas. Quanto maior a proporção de uma única voz, mais semelhante a voz sintetizada será a ela

      Intervalo de valores: \[1, 100]
    </ParamField>

    <ParamField body="voice_id" type="string" required={true}>
      ID da voz do áudio sintetizado; deve ser preenchido junto com o parâmetro weight. Oferece suporte a três tipos: vozes do sistema, vozes clonadas e vozes geradas a partir de texto
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="subtitle_enable" type="boolean" default={false}>
  Controla se o serviço de legendas será ativado, padrão false. Este parâmetro só é válido em cenários de saída não streaming e apenas para os modelos speech-2.6-hd, speech-2.6-turbo, speech-01-turbo, speech-01-hd
</ParamField>

<ParamField body="continuous_sound" type="boolean" default={false}>
  Ative este parâmetro para tornar a transição entre orações mais natural. Compatível apenas com os modelos speech-2.8-hd e speech-2.8-turbo
</ParamField>

<ParamField body="pronunciation_dict" type="object">
  <Expandable title="propriedades" defaultOpen={true}>
    <ParamField body="tone" type="string[]">
      Define regras de substituição de pronúncia ou leitura fonética correspondentes a textos ou símbolos que exigem marcação especial. Em textos em chinês, os tons são representados por números: primeiro tom é 1, segundo tom é 2, terceiro tom é 3, quarto tom é 4 e tom neutro é 5. Exemplo: \["燕少飞/(yan4)(shao3)(fei1)", "omg/oh my god"]
    </ParamField>
  </Expandable>
</ParamField>

## Informações da resposta

<ResponseField name="data" type="object" required={false}>
  Objeto de dados sintetizados retornado; pode ser null, portanto é necessário verificar se não está vazio
</ResponseField>

<ResponseField name="trace_id" type="string" required={false}>
  id desta sessão, usado para ajudar a localizar problemas em consultas/feedback
</ResponseField>

<ResponseField name="base_resp" type="object" required={false}>
  Código de status e detalhes desta requisição
</ResponseField>

<ResponseField name="extra_info" type="object" required={false}>
  Informações adicionais do áudio
</ResponseField>
