> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabs Conversão de fala em texto V2

Transcreve arquivos de áudio ou vídeo. Quando use\_multi\_channel for true e o áudio enviado tiver múltiplos canais, retorna um objeto 'transcripts', com uma transcrição por canal. Caso contrário, retorna um único resultado de transcrição.

## Cabeçalhos da solicitação

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticação Bearer: Bearer \{\{API Key}}.
</ParamField>

## Corpo da solicitação

<ParamField body="seed" type="integer" nullable={true}>
  Se especificado, o sistema fará o possível para amostrar de forma determinística; solicitações com o mesmo seed e os mesmos parâmetros devem retornar o mesmo resultado, mas determinismo absoluto não é garantido. Deve ser um inteiro entre 0 e 2147483647.

  Intervalo de valores: \[0, 2147483647]
</ParamField>

<ParamField body="diarize" type="boolean" default={false}>
  Se deve marcar o falante atual no arquivo enviado.
</ParamField>

<ParamField body="file_format" type="string" default="other">
  Formato do áudio de entrada. Pode ser 'pcm\_s16le\_16' ou 'other'. pcm\_s16le\_16 exige que o áudio tenha taxa de amostragem de 16kHz, inteiro de 16 bits, mono, formato little-endian, com menor latência em comparação a formas de onda codificadas.

  Valores opcionais: `pcm_s16le_16`, `other`
</ParamField>

<ParamField body="temperature" type="number" nullable={true}>
  Controla a aleatoriedade da saída da transcrição. O intervalo de valores é de 0.0 a 2.0; valores mais altos produzem resultados mais diversos e menos determinísticos. Se omitido, será usada a temperatura padrão do modelo selecionado (geralmente 0).

  Intervalo de valores: \[0, 2]
</ParamField>

<ParamField body="num_speakers" type="integer" nullable={true}>
  Número máximo de falantes no arquivo enviado. Pode ser usado para auxiliar na diferenciação de falantes; suporta até 32 falantes.

  Intervalo de valores: \[1, 32]
</ParamField>

<ParamField body="language_code" type="string" nullable={true}>
  Especifica o código de idioma ISO-639-1 ou ISO-639-3 do arquivo de áudio. Indicar antecipadamente às vezes pode melhorar o desempenho da transcrição. O padrão é null, e o idioma será detectado automaticamente.
</ParamField>

<ParamField body="tag_audio_events" type="boolean" default={true}>
  Se deve marcar eventos de áudio como (laughter) e (footsteps) na transcrição.
</ParamField>

<ParamField body="cloud_storage_url" type="string" required={true} nullable={true}>
  Link HTTPS do arquivo a ser transcrito. file e cloud\_storage\_url são mutuamente exclusivos; um deles deve ser fornecido. O arquivo deve ser acessível via HTTPS e ter menos de 2GB. Qualquer endereço HTTPS válido é aceito, incluindo armazenamento em nuvem (AWS S3, GCS, Cloudflare R2 etc.), CDN ou outras origens HTTPS, com suporte a links pré-assinados com token ou autenticação por parâmetros de consulta de URL.
</ParamField>

<ParamField body="use_multi_channel" type="boolean" default={false}>
  Se o arquivo de áudio é multicanal e cada canal contém apenas um único falante. Quando habilitado, cada canal será transcrito independentemente e os resultados serão combinados; cada palavra no conteúdo de saída inclui o campo channel\_index. Suporta até 5 canais.
</ParamField>

<ParamField body="diarization_threshold" type="number" nullable={true}>
  Limiar de diarização. Com valores mais altos, a probabilidade de uma pessoa ser dividida em várias é menor, mas a probabilidade de pessoas diferentes serem mescladas em uma só é maior (menos falantes identificados); com valores mais baixos, a probabilidade de uma pessoa ser dividida em várias aumenta, mas a probabilidade de pessoas diferentes serem mescladas em uma só diminui (mais falantes). Só pode ser definido quando diarize=True e num\_speakers=None. O padrão é None, e o limiar será escolhido de acordo com o model id (geralmente 0.22).

  Intervalo de valores: \[0.1, 0.4]
</ParamField>

<ParamField body="timestamps_granularity" type="string" default="word">
  Granularidade dos timestamps no conteúdo transcrito. 'word' fornece timestamps em nível de palavra, e 'character' fornece timestamps para cada caractere.

  Valores opcionais: `none`, `word`, `character`
</ParamField>

## Informações da resposta

<Note>
  A resposta pode ser um dos seguintes tipos de resposta:
</Note>

<Accordion title="Tipo de resposta 1">
  <ResponseField name="text" type="string" required={true}>
    Texto original transcrito.
  </ResponseField>

  <ResponseField name="words" type="object[]" required={true}>
    Lista de palavras e suas informações de tempo.

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="end" type="number" required={false}>
        Tempo de término desta palavra ou som no áudio (em segundos).
      </ResponseField>

      <ResponseField name="text" type="string" required={true}>
        Conteúdo da palavra ou som transcrito.
      </ResponseField>

      <ResponseField name="type" type="string" required={true}>
        Tipo desta palavra ou som. 'audio\_event' é usado para sons que não são palavras, como risadas ou passos.

        Valores opcionais: `word`, `spacing`, `audio_event`
      </ResponseField>

      <ResponseField name="start" type="number" required={false}>
        Tempo de início desta palavra ou som no áudio (em segundos).
      </ResponseField>

      <ResponseField name="logprob" type="number" required={true}>
        Logaritmo da probabilidade ao prever esta palavra. O intervalo de logprob é \[-infinity, 0]; valores mais altos indicam que o modelo está mais confiante na previsão.
      </ResponseField>

      <ResponseField name="characters" type="object[]" required={false}>
        Caracteres que compõem a palavra e suas respectivas informações de tempo.

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Tempo de término do caractere no áudio (em segundos).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Conteúdo do caractere transcrito.
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Tempo de início do caractere no áudio (em segundos).
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="speaker_id" type="string" required={false}>
        Identificador único do falante correspondente a esta palavra.
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="channel_index" type="integer" required={false}>
    Índice do canal correspondente a esta transcrição (válido para áudio multicanal).
  </ResponseField>

  <ResponseField name="language_code" type="string" required={true}>
    Código de idioma detectado (por exemplo, 'eng' indica inglês).
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    ID único de transcrição desta resposta.
  </ResponseField>

  <ResponseField name="language_probability" type="number" required={true}>
    Confiança da detecção de idioma (entre 0 e 1).
  </ResponseField>
</Accordion>

<Accordion title="Tipo de resposta 2">
  <ResponseField name="transcripts" type="object[]" required={true}>
    Lista de transcrições correspondentes a cada canal de áudio. Cada transcrição contém o texto do canal correspondente e detalhes em nível de palavra.

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="text" type="string" required={true}>
        Texto original transcrito.
      </ResponseField>

      <ResponseField name="words" type="object[]" required={true}>
        Lista de palavras e suas informações de tempo.

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Tempo de término desta palavra ou som no áudio (em segundos).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Conteúdo da palavra ou som transcrito.
          </ResponseField>

          <ResponseField name="type" type="string" required={true}>
            Tipo desta palavra ou som. 'audio\_event' é usado para sons que não são palavras, como risadas ou passos.

            Valores opcionais: `word`, `spacing`, `audio_event`
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Tempo de início desta palavra ou som no áudio (em segundos).
          </ResponseField>

          <ResponseField name="logprob" type="number" required={true}>
            Logaritmo da probabilidade ao prever esta palavra. O intervalo de logprob é \[-infinity, 0]; valores mais altos indicam que o modelo está mais confiante na previsão.
          </ResponseField>

          <ResponseField name="characters" type="object[]" required={false}>
            Caracteres que compõem a palavra e suas respectivas informações de tempo.

            <Expandable title="properties" defaultOpen={true}>
              <ResponseField name="end" type="number" required={false}>
                Tempo de término do caractere no áudio (em segundos).
              </ResponseField>

              <ResponseField name="text" type="string" required={true}>
                Conteúdo do caractere transcrito.
              </ResponseField>

              <ResponseField name="start" type="number" required={false}>
                Tempo de início do caractere no áudio (em segundos).
              </ResponseField>
            </Expandable>
          </ResponseField>

          <ResponseField name="speaker_id" type="string" required={false}>
            Identificador único do falante correspondente a esta palavra.
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="channel_index" type="integer" required={false}>
        Índice do canal correspondente a esta transcrição (válido para áudio multicanal).
      </ResponseField>

      <ResponseField name="language_code" type="string" required={true}>
        Código de idioma detectado (por exemplo, 'eng' indica inglês).
      </ResponseField>

      <ResponseField name="transcription_id" type="string" required={false}>
        ID único de transcrição desta resposta.
      </ResponseField>

      <ResponseField name="language_probability" type="number" required={true}>
        Confiança da detecção de idioma (entre 0 e 1).
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    ID único de transcrição desta resposta.
  </ResponseField>
</Accordion>
