> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabs преобразование речи в текст V2

Транскрибирует аудио- или видеофайлы. Когда use\_multi\_channel равно true и загруженный аудиофайл содержит несколько каналов, возвращается объект 'transcripts' — по одной транскрипции на каждый канал. В остальных случаях возвращается единый результат транскрипции.

## Заголовки запроса

<ParamField header="Content-Type" type="string" required={true}>
  Перечисляемое значение: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Формат Bearer-аутентификации: Bearer \{\{API 密钥}}.
</ParamField>

## Тело запроса

<ParamField body="seed" type="integer" nullable={true}>
  Если указано, система постарается выполнять выборку детерминированным образом: запросы с одинаковыми seed и параметрами должны возвращать одинаковые результаты, однако абсолютная детерминированность не гарантируется. Должно быть целым числом от 0 до 2147483647.

  Диапазон значений: \[0, 2147483647]
</ParamField>

<ParamField body="diarize" type="boolean" default={false}>
  Нужно ли помечать текущего говорящего в загруженном файле.
</ParamField>

<ParamField body="file_format" type="string" default="other">
  Формат входного аудио. Возможные значения: 'pcm\_s16le\_16' или 'other'. pcm\_s16le\_16 требует, чтобы аудио имело частоту дискретизации 16kHz, 16-битный целочисленный формат, один канал и порядок байтов little-endian; по сравнению с кодированной волновой формой задержка ниже.

  Возможные значения: `pcm_s16le_16`, `other`
</ParamField>

<ParamField body="temperature" type="number" nullable={true}>
  Управляет случайностью вывода транскрипции. Диапазон значений от 0.0 до 2.0: чем выше значение, тем более разнообразными и менее определенными будут результаты. Если параметр опущен, будет использована температура по умолчанию выбранной модели (обычно 0).

  Диапазон значений: \[0, 2]
</ParamField>

<ParamField body="num_speakers" type="integer" nullable={true}>
  Максимальное количество говорящих в загруженном файле. Может использоваться для помощи в различении говорящих; поддерживается до 32 говорящих.

  Диапазон значений: \[1, 32]
</ParamField>

<ParamField body="language_code" type="string" nullable={true}>
  Указывает код языка аудиофайла в формате ISO-639-1 или ISO-639-3. Предварительное указание иногда может повысить качество транскрипции. По умолчанию null, язык будет определен автоматически.
</ParamField>

<ParamField body="tag_audio_events" type="boolean" default={true}>
  Нужно ли помечать в транскрипции аудиособытия, такие как (laughter), (footsteps) и т. п.
</ParamField>

<ParamField body="cloud_storage_url" type="string" required={true} nullable={true}>
  HTTPS-ссылка на файл для транскрипции. Необходимо указать либо file, либо cloud\_storage\_url. Файл должен быть доступен по HTTPS и иметь размер менее 2GB. Поддерживаются любые допустимые HTTPS-адреса, включая облачные хранилища (AWS S3, GCS, Cloudflare R2 и т. д.), CDN или другие HTTPS-источники; поддерживаются предварительно подписанные ссылки с token или аутентификация через параметры запроса URL.
</ParamField>

<ParamField body="use_multi_channel" type="boolean" default={false}>
  Является ли аудиофайл многоканальным, при этом каждый канал содержит только одного говорящего. После включения каждый канал будет транскрибирован независимо, а результаты будут объединены; каждое слово в выходном содержимом будет содержать поле channel\_index. Поддерживается до 5 каналов.
</ParamField>

<ParamField body="diarization_threshold" type="number" nullable={true}>
  Порог разделения говорящих (diarization). При большом значении вероятность того, что один человек будет разделен на нескольких, ниже, но вероятность объединения разных людей в одного выше (будет выявлено меньше говорящих); при малом значении вероятность разделения одного человека на нескольких выше, но вероятность объединения разных людей в одного ниже (говорящих будет больше). Можно задавать только когда diarize=True и num\_speakers=None. По умолчанию None; порог выбирается на основе model id (обычно 0.22).

  Диапазон значений: \[0.1, 0.4]
</ParamField>

<ParamField body="timestamps_granularity" type="string" default="word">
  Гранулярность временных меток в транскрибированном содержимом. 'word' предоставляет временные метки на уровне слов, 'character' предоставляет временные метки для каждого символа.

  Возможные значения: `none`, `word`, `character`
</ParamField>

## Информация об ответе

<Note>
  Ответ может быть одним из следующих типов:
</Note>

<Accordion title="Тип ответа 1">
  <ResponseField name="text" type="string" required={true}>
    Исходный текст транскрипции.
  </ResponseField>

  <ResponseField name="words" type="object[]" required={true}>
    Список слов и связанной с ними временной информации.

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="end" type="number" required={false}>
        Время окончания этого слова или звука в аудио (в секундах).
      </ResponseField>

      <ResponseField name="text" type="string" required={true}>
        Содержимое транскрибированного слова или звука.
      </ResponseField>

      <ResponseField name="type" type="string" required={true}>
        Тип этого слова или звука. 'audio\_event' используется для несловесных звуков, таких как смех или шаги.

        Возможные значения: `word`, `spacing`, `audio_event`
      </ResponseField>

      <ResponseField name="start" type="number" required={false}>
        Время начала этого слова или звука в аудио (в секундах).
      </ResponseField>

      <ResponseField name="logprob" type="number" required={true}>
        Логарифм вероятности при предсказании этого слова. Диапазон logprob: \[-infinity, 0]; чем выше значение, тем увереннее предсказание модели.
      </ResponseField>

      <ResponseField name="characters" type="object[]" required={false}>
        Символы, составляющие слово, и соответствующая им временная информация.

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Время окончания символа в аудио (в секундах).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Содержимое транскрибированного символа.
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Время начала символа в аудио (в секундах).
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="speaker_id" type="string" required={false}>
        Уникальный идентификатор говорящего, соответствующего этому слову.
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="channel_index" type="integer" required={false}>
    Индекс канала, соответствующий этой транскрипции (актуально для многоканального аудио).
  </ResponseField>

  <ResponseField name="language_code" type="string" required={true}>
    Обнаруженный код языка (например, 'eng' означает английский).
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    Уникальный ID транскрипции для этого ответа.
  </ResponseField>

  <ResponseField name="language_probability" type="number" required={true}>
    Уверенность определения языка (от 0 до 1).
  </ResponseField>
</Accordion>

<Accordion title="Тип ответа 2">
  <ResponseField name="transcripts" type="object[]" required={true}>
    Список транскрипций, соответствующих каждому аудиоканалу. Каждая транскрипция содержит текст соответствующего канала и подробную информацию на уровне слов.

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="text" type="string" required={true}>
        Исходный текст транскрипции.
      </ResponseField>

      <ResponseField name="words" type="object[]" required={true}>
        Список слов и связанной с ними временной информации.

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Время окончания этого слова или звука в аудио (в секундах).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Содержимое транскрибированного слова или звука.
          </ResponseField>

          <ResponseField name="type" type="string" required={true}>
            Тип этого слова или звука. 'audio\_event' используется для несловесных звуков, таких как смех или шаги.

            Возможные значения: `word`, `spacing`, `audio_event`
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Время начала этого слова или звука в аудио (в секундах).
          </ResponseField>

          <ResponseField name="logprob" type="number" required={true}>
            Логарифм вероятности при предсказании этого слова. Диапазон logprob: \[-infinity, 0]; чем выше значение, тем увереннее предсказание модели.
          </ResponseField>

          <ResponseField name="characters" type="object[]" required={false}>
            Символы, составляющие слово, и соответствующая им временная информация.

            <Expandable title="properties" defaultOpen={true}>
              <ResponseField name="end" type="number" required={false}>
                Время окончания символа в аудио (в секундах).
              </ResponseField>

              <ResponseField name="text" type="string" required={true}>
                Содержимое транскрибированного символа.
              </ResponseField>

              <ResponseField name="start" type="number" required={false}>
                Время начала символа в аудио (в секундах).
              </ResponseField>
            </Expandable>
          </ResponseField>

          <ResponseField name="speaker_id" type="string" required={false}>
            Уникальный идентификатор говорящего, соответствующего этому слову.
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="channel_index" type="integer" required={false}>
        Индекс канала, соответствующий этой транскрипции (актуально для многоканального аудио).
      </ResponseField>

      <ResponseField name="language_code" type="string" required={true}>
        Обнаруженный код языка (например, 'eng' означает английский).
      </ResponseField>

      <ResponseField name="transcription_id" type="string" required={false}>
        Уникальный ID транскрипции для этого ответа.
      </ResponseField>

      <ResponseField name="language_probability" type="number" required={true}>
        Уверенность определения языка (от 0 до 1).
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    Уникальный ID транскрипции для этого ответа.
  </ResponseField>
</Accordion>
