> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# Síntese de voz Fish Audio

<Note>
  Para obter os melhores resultados, recomendamos usar a [clonagem de áudio](/pt/docs/models/reference-fish-audio-voice-cloning) para enviar um áudio de referência antes de usar esta API. Isso melhorará a qualidade da voz e reduzirá a latência.
</Note>

O Fish Audio converte texto em fala.

Formatos de áudio compatíveis:

* WAV / PCM
  * Taxa de amostragem: 8kHz, 16kHz, 24kHz, 32kHz, 44.1kHz
  * Taxa de amostragem padrão: 44.1kHz
  * 16-bit, mono

* MP3
  * Taxa de amostragem: 32kHz, 44.1kHz
  * Taxa de amostragem padrão: 44.1kHz
  * Mono
  * Taxa de bits: 64kbps, 128kbps (padrão), 192kbps

* Opus
  * Taxa de amostragem: 48kHz
  * Taxa de amostragem padrão: 48kHz
  * Mono
  * Taxa de bits: -1000 (automático), 24kbps, 32kbps (padrão), 48kbps, 64kbps

## Cabeçalhos da requisição

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticação Bearer: Bearer \{\{API Key}}.
</ParamField>

## Corpo da requisição

<ParamField body="text" type="string" required={true}>
  O texto a ser convertido em fala.
</ParamField>

<ParamField body="temperature" type="number" default={0.9}>
  Controla a aleatoriedade da geração de fala. Valores mais altos (por exemplo, 1.0) tornam a saída mais aleatória, enquanto valores mais baixos (por exemplo, 0.1) a tornam mais determinística. Recomendamos usar `0.9` para o modelo `s1`.

  Intervalo obrigatório: `0 <= x <= 1`
</ParamField>

<ParamField body="top_p" type="number" default={0.9}>
  Controla a diversidade por meio de amostragem de núcleo. Valores mais baixos (por exemplo, 0.1) tornam a saída mais focada, enquanto valores mais altos (por exemplo, 1.0) permitem mais diversidade. Recomendamos usar `0.9` para o modelo `s1`.

  Intervalo obrigatório: `0 <= x <= 1`
</ParamField>

<ParamField body="references" type="ReferenceAudio · object[] | null">
  Áudios de referência usados para a voz; isso requer serialização MessagePack, que substituirá reference\_voices e reference\_texts.

  <Expandable title="propriedades">
    <ParamField body="audio" type="file" required={true}>
      Arquivo de áudio de referência.
    </ParamField>

    <ParamField body="text" type="string" required={true}>
      Texto de referência correspondente ao áudio.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="reference_id" type="string | null">
  ID do modelo de referência usado para a voz.
</ParamField>

<ParamField body="prosody" type="ProsodyControl · object">
  Controle de prosódia usado para a voz.

  <Expandable title="propriedades">
    <ParamField body="speed" type="number" default={1}>
      Controle de velocidade da fala.
    </ParamField>

    <ParamField body="volume" type="number" default={0}>
      Controle de volume da fala.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="chunk_length" type="integer" default={200}>
  Comprimento dos blocos usado para a voz.

  Intervalo obrigatório: `100 <= x <= 300`
</ParamField>

<ParamField body="normalize" type="boolean" default={true}>
  Se deve normalizar a fala; isso reduzirá a latência, mas pode diminuir o desempenho no processamento de números e datas.
</ParamField>

<ParamField body="format" type="enum<string>" default="mp3">
  Formato usado para a voz.

  Valores opcionais: `wav`, `pcm`, `mp3`, `opus`
</ParamField>

<ParamField body="sample_rate" type="integer | null">
  Taxa de amostragem usada para a voz.
</ParamField>

<ParamField body="mp3_bitrate" type="enum<integer>" default={128}>
  Taxa de bits MP3 usada para a voz.

  Valores opcionais: `64`, `128`, `192`
</ParamField>

<ParamField body="opus_bitrate" type="enum<integer>" default={32}>
  Taxa de bits Opus usada para a voz.

  Valores opcionais: `-1000`, `24`, `32`, `48`, `64`
</ParamField>

<ParamField body="latency" type="enum<string>" default="normal">
  Configuração de latência usada para a voz; balanced reduzirá a latência, mas pode causar queda de desempenho.

  Valores opcionais: `normal`, `balanced`
</ParamField>

## Informações de resposta

A API retornará diretamente um fluxo de áudio no formato especificado pelo parâmetro `format` (padrão: mp3).
