> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabs Speech-to-Text V1

Transcreve arquivos de áudio ou vídeo. Quando use\_multi\_channel for true e o áudio enviado tiver vários canais, retorna um objeto 'transcripts', com uma transcrição por canal. Caso contrário, retorna um único resultado de transcrição.

## Cabeçalhos da solicitação

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticação Bearer: Bearer \{\{API Key}}.
</ParamField>

## Corpo da solicitação

<ParamField body="seed" type="integer" nullable={true}>
  Se especificado, o sistema fará o possível para amostrar de forma determinística; solicitações com o mesmo seed e os mesmos parâmetros devem retornar o mesmo resultado, mas a determinismo absoluto não é garantido. Deve ser um inteiro entre 0 e 2147483647.

  Intervalo de valores: \[0, 2147483647]
</ParamField>

<ParamField body="diarize" type="boolean" default={false}>
  Indica se deve rotular o falante atual no arquivo enviado.
</ParamField>

<ParamField body="file_format" type="string" default="other">
  Formato do áudio de entrada. Pode ser 'pcm\_s16le\_16' ou 'other'. pcm\_s16le\_16 exige que o áudio esteja em taxa de amostragem de 16 kHz, inteiro de 16 bits, mono e little-endian, com menor latência em comparação a formas de onda codificadas.

  Valores possíveis: `pcm_s16le_16`, `other`
</ParamField>

<ParamField body="temperature" type="number" nullable={true}>
  Controla a aleatoriedade da saída da transcrição. O intervalo é de 0.0 a 2.0; valores mais altos tornam os resultados mais variados e menos determinísticos. Se omitido, será usada a temperatura padrão do modelo selecionado (geralmente 0).

  Intervalo de valores: \[0, 2]
</ParamField>

<ParamField body="num_speakers" type="integer" nullable={true}>
  Número máximo de falantes no arquivo enviado. Pode ser usado para auxiliar na diferenciação dos falantes, com suporte a até 32 falantes.

  Intervalo de valores: \[1, 32]
</ParamField>

<ParamField body="language_code" type="string" nullable={true}>
  Especifica o código de idioma ISO-639-1 ou ISO-639-3 do arquivo de áudio. Informar antecipadamente às vezes pode melhorar o desempenho da transcrição. O padrão é null, e o idioma será detectado automaticamente.
</ParamField>

<ParamField body="tag_audio_events" type="boolean" default={true}>
  Indica se eventos de áudio, como (laughter) e (footsteps), devem ser marcados na transcrição.
</ParamField>

<ParamField body="cloud_storage_url" type="string" required={true} nullable={true}>
  Link HTTPS do arquivo a ser transcrito. file e cloud\_storage\_url são mutuamente exclusivos; um dos dois deve ser fornecido. O arquivo deve ser acessível via HTTPS e ter menos de 2 GB. Qualquer endereço HTTPS válido é compatível, incluindo armazenamento em nuvem (AWS S3, GCS, Cloudflare R2 etc.), CDN ou outras origens HTTPS, com suporte a links pré-assinados com token ou autenticação por parâmetros de consulta na URL.
</ParamField>

<ParamField body="use_multi_channel" type="boolean" default={false}>
  Indica se o arquivo de áudio é multicanal e se cada canal contém apenas um único falante. Quando ativado, cada canal será transcrito de forma independente e os resultados serão combinados; cada palavra no conteúdo de saída incluirá o campo channel\_index. Suporta até 5 canais.
</ParamField>

<ParamField body="diarization_threshold" type="number" nullable={true}>
  Limiar de diarização. Com valores maiores, é menor a probabilidade de uma pessoa ser dividida em várias, mas maior a probabilidade de pessoas diferentes serem mescladas em uma só (menos falantes identificados); com valores menores, aumenta a probabilidade de uma pessoa ser dividida em várias, mas diminui a probabilidade de pessoas diferentes serem mescladas em uma só (mais falantes). Só pode ser definido quando diarize=True e num\_speakers=None. O padrão é None, e o limiar será escolhido com base no id do modelo (geralmente 0.22).

  Intervalo de valores: \[0.1, 0.4]
</ParamField>

<ParamField body="timestamps_granularity" type="string" default="word">
  Granularidade dos timestamps no conteúdo da transcrição. 'word' fornece timestamps em nível de palavra, enquanto 'character' fornece timestamps para cada caractere.

  Valores possíveis: `none`, `word`, `character`
</ParamField>

## Informações da resposta

<Note>
  A resposta pode ser um dos seguintes tipos:
</Note>

<Accordion title="Tipo de resposta 1">
  <ResponseField name="text" type="string" required={true}>
    Texto bruto transcrito.
  </ResponseField>

  <ResponseField name="words" type="object[]" required={true}>
    Lista de palavras e suas informações de tempo.

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="end" type="number" required={false}>
        Horário de término desta palavra ou som no áudio (em segundos).
      </ResponseField>

      <ResponseField name="text" type="string" required={true}>
        Conteúdo da palavra ou som transcrito.
      </ResponseField>

      <ResponseField name="type" type="string" required={true}>
        Tipo desta palavra ou som. 'audio\_event' é usado para sons que não são palavras, como risadas ou passos.

        Valores possíveis: `word`, `spacing`, `audio_event`
      </ResponseField>

      <ResponseField name="start" type="number" required={false}>
        Horário de início desta palavra ou som no áudio (em segundos).
      </ResponseField>

      <ResponseField name="logprob" type="number" required={true}>
        Logaritmo da probabilidade ao prever esta palavra. O intervalo de logprob é \[-infinity, 0]; quanto maior o valor, maior a confiança do modelo na previsão.
      </ResponseField>

      <ResponseField name="characters" type="object[]" required={false}>
        Caracteres que compõem a palavra e suas respectivas informações de tempo.

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Horário de término do caractere no áudio (em segundos).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Conteúdo do caractere transcrito.
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Horário de início do caractere no áudio (em segundos).
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="speaker_id" type="string" required={false}>
        Identificador único do falante correspondente a esta palavra.
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="channel_index" type="integer" required={false}>
    Índice do canal correspondente a esta transcrição (válido para áudio multicanal).
  </ResponseField>

  <ResponseField name="language_code" type="string" required={true}>
    Código do idioma detectado (por exemplo, 'eng' para inglês).
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    ID único da transcrição desta resposta.
  </ResponseField>

  <ResponseField name="language_probability" type="number" required={true}>
    Confiança da detecção de idioma (entre 0 e 1).
  </ResponseField>
</Accordion>

<Accordion title="Tipo de resposta 2">
  <ResponseField name="transcripts" type="object[]" required={true}>
    Lista de transcrições correspondente a cada canal de áudio. Cada transcrição inclui o texto do canal correspondente e detalhes em nível de palavra.

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="text" type="string" required={true}>
        Texto bruto transcrito.
      </ResponseField>

      <ResponseField name="words" type="object[]" required={true}>
        Lista de palavras e suas informações de tempo.

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Horário de término desta palavra ou som no áudio (em segundos).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Conteúdo da palavra ou som transcrito.
          </ResponseField>

          <ResponseField name="type" type="string" required={true}>
            Tipo desta palavra ou som. 'audio\_event' é usado para sons que não são palavras, como risadas ou passos.

            Valores possíveis: `word`, `spacing`, `audio_event`
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Horário de início desta palavra ou som no áudio (em segundos).
          </ResponseField>

          <ResponseField name="logprob" type="number" required={true}>
            Logaritmo da probabilidade ao prever esta palavra. O intervalo de logprob é \[-infinity, 0]; quanto maior o valor, maior a confiança do modelo na previsão.
          </ResponseField>

          <ResponseField name="characters" type="object[]" required={false}>
            Caracteres que compõem a palavra e suas respectivas informações de tempo.

            <Expandable title="properties" defaultOpen={true}>
              <ResponseField name="end" type="number" required={false}>
                Horário de término do caractere no áudio (em segundos).
              </ResponseField>

              <ResponseField name="text" type="string" required={true}>
                Conteúdo do caractere transcrito.
              </ResponseField>

              <ResponseField name="start" type="number" required={false}>
                Horário de início do caractere no áudio (em segundos).
              </ResponseField>
            </Expandable>
          </ResponseField>

          <ResponseField name="speaker_id" type="string" required={false}>
            Identificador único do falante correspondente a esta palavra.
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="channel_index" type="integer" required={false}>
        Índice do canal correspondente a esta transcrição (válido para áudio multicanal).
      </ResponseField>

      <ResponseField name="language_code" type="string" required={true}>
        Código do idioma detectado (por exemplo, 'eng' para inglês).
      </ResponseField>

      <ResponseField name="transcription_id" type="string" required={false}>
        ID único da transcrição desta resposta.
      </ResponseField>

      <ResponseField name="language_probability" type="number" required={true}>
        Confiança da detecção de idioma (entre 0 e 1).
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    ID único da transcrição desta resposta.
  </ResponseField>
</Accordion>
