> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabs Speech-to-Text V1

Transcrit des fichiers audio ou vidéo. Lorsque use\_multi\_channel est true et que l’audio téléversé comporte plusieurs canaux, renvoie un objet 'transcripts', avec une transcription par canal. Sinon, renvoie un résultat de transcription unique.

## En-têtes de requête

<ParamField header="Content-Type" type="string" required={true}>
  Valeur d’énumération : `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Format d’authentification Bearer : Bearer \{\{API Key}}.
</ParamField>

## Corps de la requête

<ParamField body="seed" type="integer" nullable={true}>
  Si spécifié, le système fera de son mieux pour effectuer un échantillonnage déterministe ; les requêtes avec le même seed et les mêmes paramètres devraient renvoyer le même résultat, sans garantie de déterminisme absolu. Doit être un entier compris entre 0 et 2147483647.

  Plage de valeurs : \[0, 2147483647]
</ParamField>

<ParamField body="diarize" type="boolean" default={false}>
  Indique s’il faut annoter le locuteur actuel dans le fichier téléversé.
</ParamField>

<ParamField body="file_format" type="string" default="other">
  Format audio d’entrée. Peut être 'pcm\_s16le\_16' ou 'other'. pcm\_s16le\_16 exige un audio à une fréquence d’échantillonnage de 16 kHz, en entier 16 bits, mono, au format little-endian, avec une latence plus faible que les formes d’onde encodées.

  Valeurs possibles : `pcm_s16le_16`, `other`
</ParamField>

<ParamField body="temperature" type="number" nullable={true}>
  Contrôle le caractère aléatoire de la sortie de transcription. La plage de valeurs est de 0.0 à 2.0 ; plus la valeur est élevée, plus les résultats sont variés et moins déterministes. Si omis, la température par défaut du modèle sélectionné sera utilisée (généralement 0).

  Plage de valeurs : \[0, 2]
</ParamField>

<ParamField body="num_speakers" type="integer" nullable={true}>
  Nombre maximal de locuteurs dans le fichier téléversé. Peut être utilisé pour aider à distinguer les locuteurs ; jusqu’à 32 locuteurs sont pris en charge.

  Plage de valeurs : \[1, 32]
</ParamField>

<ParamField body="language_code" type="string" nullable={true}>
  Spécifie le code de langue ISO-639-1 ou ISO-639-3 du fichier audio. L’indiquer à l’avance peut parfois améliorer les performances de transcription. Par défaut null, la langue sera détectée automatiquement.
</ParamField>

<ParamField body="tag_audio_events" type="boolean" default={true}>
  Indique s’il faut marquer dans la transcription les événements audio tels que (laughter) ou (footsteps).
</ParamField>

<ParamField body="cloud_storage_url" type="string" required={true} nullable={true}>
  Lien HTTPS du fichier à transcrire. L’un des deux paramètres file ou cloud\_storage\_url est requis. Le fichier doit être accessible via HTTPS et faire moins de 2 Go ; toute adresse HTTPS valide est prise en charge, notamment le stockage cloud (AWS S3, GCS, Cloudflare R2, etc.), les CDN ou d’autres sources HTTPS, ainsi que les liens présignés avec token ou l’authentification via paramètres de requête d’URL.
</ParamField>

<ParamField body="use_multi_channel" type="boolean" default={false}>
  Indique si le fichier audio est multicanal et si chaque canal contient un seul locuteur. Une fois activé, chaque canal est transcrit indépendamment et les résultats sont fusionnés ; chaque mot dans la sortie contient un champ channel\_index. Jusqu’à 5 canaux sont pris en charge.
</ParamField>

<ParamField body="diarization_threshold" type="number" nullable={true}>
  Seuil de diarisation des locuteurs. Une valeur élevée réduit la probabilité qu’une personne soit divisée en plusieurs locuteurs, mais augmente la probabilité que différentes personnes soient fusionnées en une seule (moins de locuteurs identifiés) ; une valeur faible augmente la probabilité qu’une personne soit divisée en plusieurs locuteurs, mais réduit la probabilité que différentes personnes soient fusionnées en une seule (plus de locuteurs). Peut être défini uniquement lorsque diarize=True et num\_speakers=None. Par défaut None ; le seuil est choisi en fonction de l’id du modèle (généralement 0.22).

  Plage de valeurs : \[0.1, 0.4]
</ParamField>

<ParamField body="timestamps_granularity" type="string" default="word">
  Granularité des horodatages dans le contenu transcrit. 'word' fournit des horodatages au niveau des mots, tandis que 'character' fournit les horodatages de chaque caractère.

  Valeurs possibles : `none`, `word`, `character`
</ParamField>

## Informations de réponse

<Note>
  La réponse peut être l’un des types de réponse suivants :
</Note>

<Accordion title="Type de réponse 1">
  <ResponseField name="text" type="string" required={true}>
    Texte brut de la transcription.
  </ResponseField>

  <ResponseField name="words" type="object[]" required={true}>
    Liste des mots et de leurs informations temporelles.

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="end" type="number" required={false}>
        Heure de fin de ce mot ou de ce son dans l’audio (en secondes).
      </ResponseField>

      <ResponseField name="text" type="string" required={true}>
        Contenu du mot ou du son transcrit.
      </ResponseField>

      <ResponseField name="type" type="string" required={true}>
        Type de ce mot ou de ce son. 'audio\_event' est utilisé pour les sons qui ne sont pas des mots, comme des rires ou des bruits de pas.

        Valeurs possibles : `word`, `spacing`, `audio_event`
      </ResponseField>

      <ResponseField name="start" type="number" required={false}>
        Heure de début de ce mot ou de ce son dans l’audio (en secondes).
      </ResponseField>

      <ResponseField name="logprob" type="number" required={true}>
        Log-probabilité au moment de la prédiction de ce mot. La plage de logprob est \[-infinity, 0] ; plus la valeur est élevée, plus le modèle est confiant dans sa prédiction.
      </ResponseField>

      <ResponseField name="characters" type="object[]" required={false}>
        Caractères composant le mot et leurs informations temporelles correspondantes.

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Heure de fin du caractère dans l’audio (en secondes).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Contenu du caractère transcrit.
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Heure de début du caractère dans l’audio (en secondes).
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="speaker_id" type="string" required={false}>
        Identifiant unique du locuteur correspondant à ce mot.
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="channel_index" type="integer" required={false}>
    Index du canal correspondant à cette transcription (valide pour l’audio multicanal).
  </ResponseField>

  <ResponseField name="language_code" type="string" required={true}>
    Code de langue détecté (par exemple, 'eng' pour l’anglais).
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    ID de transcription unique de cette réponse.
  </ResponseField>

  <ResponseField name="language_probability" type="number" required={true}>
    Niveau de confiance de la détection de la langue (entre 0 et 1).
  </ResponseField>
</Accordion>

<Accordion title="Type de réponse 2">
  <ResponseField name="transcripts" type="object[]" required={true}>
    Liste des transcriptions correspondant à chaque canal audio. Chaque transcription contient le texte du canal concerné ainsi que des informations détaillées au niveau des mots.

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="text" type="string" required={true}>
        Texte brut de la transcription.
      </ResponseField>

      <ResponseField name="words" type="object[]" required={true}>
        Liste des mots et de leurs informations temporelles.

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Heure de fin de ce mot ou de ce son dans l’audio (en secondes).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Contenu du mot ou du son transcrit.
          </ResponseField>

          <ResponseField name="type" type="string" required={true}>
            Type de ce mot ou de ce son. 'audio\_event' est utilisé pour les sons qui ne sont pas des mots, comme des rires ou des bruits de pas.

            Valeurs possibles : `word`, `spacing`, `audio_event`
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Heure de début de ce mot ou de ce son dans l’audio (en secondes).
          </ResponseField>

          <ResponseField name="logprob" type="number" required={true}>
            Log-probabilité au moment de la prédiction de ce mot. La plage de logprob est \[-infinity, 0] ; plus la valeur est élevée, plus le modèle est confiant dans sa prédiction.
          </ResponseField>

          <ResponseField name="characters" type="object[]" required={false}>
            Caractères composant le mot et leurs informations temporelles correspondantes.

            <Expandable title="properties" defaultOpen={true}>
              <ResponseField name="end" type="number" required={false}>
                Heure de fin du caractère dans l’audio (en secondes).
              </ResponseField>

              <ResponseField name="text" type="string" required={true}>
                Contenu du caractère transcrit.
              </ResponseField>

              <ResponseField name="start" type="number" required={false}>
                Heure de début du caractère dans l’audio (en secondes).
              </ResponseField>
            </Expandable>
          </ResponseField>

          <ResponseField name="speaker_id" type="string" required={false}>
            Identifiant unique du locuteur correspondant à ce mot.
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="channel_index" type="integer" required={false}>
        Index du canal correspondant à cette transcription (valide pour l’audio multicanal).
      </ResponseField>

      <ResponseField name="language_code" type="string" required={true}>
        Code de langue détecté (par exemple, 'eng' pour l’anglais).
      </ResponseField>

      <ResponseField name="transcription_id" type="string" required={false}>
        ID de transcription unique de cette réponse.
      </ResponseField>

      <ResponseField name="language_probability" type="number" required={true}>
        Niveau de confiance de la détection de la langue (entre 0 et 1).
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    ID de transcription unique de cette réponse.
  </ResponseField>
</Accordion>
