> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabs 音声テキスト変換 V2

音声または動画ファイルを文字起こしします。use\_multi\_channel が true で、アップロードされた音声に複数のチャンネルがある場合、各チャンネルにつき 1 つの文字起こしを含む 'transcripts' オブジェクトを返します。それ以外の場合は、単一の文字起こし結果を返します。

## リクエストヘッダー

<ParamField header="Content-Type" type="string" required={true}>
  列挙値: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Bearer 認証形式: Bearer \{\{API Key}}。
</ParamField>

## リクエストボディ

<ParamField body="seed" type="integer" nullable={true}>
  指定した場合、システムは可能な限り決定論的にサンプリングします。同じ seed とパラメータのリクエストは同じ結果を返すはずですが、完全な決定性は保証されません。0 から 2147483647 までの整数である必要があります。

  値の範囲：\[0, 2147483647]
</ParamField>

<ParamField body="diarize" type="boolean" default={false}>
  アップロードファイル内の現在の話者をラベル付けするかどうか。
</ParamField>

<ParamField body="file_format" type="string" default="other">
  入力音声形式。'pcm\_s16le\_16' または 'other' を選択できます。pcm\_s16le\_16 は、音声が 16kHz サンプリングレート、16 ビット整数、モノラル、リトルエンディアン形式であることを要求し、エンコードされた波形と比べて遅延が低くなります。

  選択可能な値：`pcm_s16le_16`, `other`
</ParamField>

<ParamField body="temperature" type="number" nullable={true}>
  文字起こし出力のランダム性を制御します。値の範囲は 0.0 ～ 2.0 で、値が高いほど結果は多様になり、不確実性も高くなります。省略した場合、選択したモデルのデフォルト温度（通常は0）が使用されます。

  値の範囲：\[0, 2]
</ParamField>

<ParamField body="num_speakers" type="integer" nullable={true}>
  アップロードファイル内の話者の最大数。話者の区別を補助するために使用でき、最大 32 人の話者をサポートします。

  値の範囲：\[1, 32]
</ParamField>

<ParamField body="language_code" type="string" nullable={true}>
  音声ファイルの ISO-639-1 または ISO-639-3 言語コードを指定します。事前に指定すると、文字起こし性能が向上する場合があります。デフォルトは null で、言語は自動検出されます。
</ParamField>

<ParamField body="tag_audio_events" type="boolean" default={true}>
  文字起こし内で（laughter）（footsteps）などの音声イベントをタグ付けするかどうか。
</ParamField>

<ParamField body="cloud_storage_url" type="string" required={true} nullable={true}>
  文字起こし対象ファイルの HTTPS リンク。file と cloud\_storage\_url のいずれか一方を指定する必要があります。ファイルは HTTPS 経由でアクセス可能かつ 2GB 未満である必要があり、クラウドストレージ（AWS S3、GCS、Cloudflare R2 など）、CDN、その他の HTTPS ソースを含む任意の有効な HTTPS アドレスをサポートします。token 付きの事前署名済みリンクや URL クエリパラメータによる認証もサポートします。
</ParamField>

<ParamField body="use_multi_channel" type="boolean" default={false}>
  音声ファイルがマルチチャンネルであり、各チャンネルに単一の話者のみが含まれるかどうか。有効にすると、各チャンネルを個別に文字起こしして結果を合成し、出力内容の各単語には channel\_index フィールドが含まれます。最大 5 チャンネルをサポートします。
</ParamField>

<ParamField body="diarization_threshold" type="number" nullable={true}>
  話者分離（diarization）のしきい値。値が大きいほど、1 人が複数人として分割される確率は低くなりますが、異なる人が 1 人として結合される確率は高くなります（識別される話者数は少なくなります）。値が小さいほど、1 人が複数人として分割される確率は高くなりますが、異なる人が 1 人として結合される確率は低くなります（話者数は多くなります）。diarize=True かつ num\_speakers=None の場合にのみ設定できます。デフォルトは None で、モデル id に基づいてしきい値が選択されます（通常は 0.22）。

  値の範囲：\[0.1, 0.4]
</ParamField>

<ParamField body="timestamps_granularity" type="string" default="word">
  文字起こし内容におけるタイムスタンプの粒度。'word' は単語レベルのタイムスタンプを提供し、'character' は各文字のタイムスタンプを提供します。

  選択可能な値：`none`, `word`, `character`
</ParamField>

## レスポンス情報

<Note>
  レスポンスは以下のレスポンスタイプのいずれかになる場合があります：
</Note>

<Accordion title="レスポンスタイプ 1">
  <ResponseField name="text" type="string" required={true}>
    文字起こしされた元のテキスト。
  </ResponseField>

  <ResponseField name="words" type="object[]" required={true}>
    単語とその時間情報のリスト。

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="end" type="number" required={false}>
        この単語または音の音声内での終了時間（秒）。
      </ResponseField>

      <ResponseField name="text" type="string" required={true}>
        文字起こしされた単語または音の内容。
      </ResponseField>

      <ResponseField name="type" type="string" required={true}>
        この単語または音のタイプ。'audio\_event' は、笑い声や足音などの単語ではない音に使用されます。

        選択可能な値：`word`, `spacing`, `audio_event`
      </ResponseField>

      <ResponseField name="start" type="number" required={false}>
        この単語または音の音声内での開始時間（秒）。
      </ResponseField>

      <ResponseField name="logprob" type="number" required={true}>
        この単語を予測した際の対数確率。logprob の範囲は \[-infinity, 0] で、値が高いほどモデルの予測の信頼度が高いことを示します。
      </ResponseField>

      <ResponseField name="characters" type="object[]" required={false}>
        単語を構成する文字と、それに対応する時間情報。

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            文字の音声内での終了時間（秒）。
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            文字起こしされた文字の内容。
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            文字の音声内での開始時間（秒）。
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="speaker_id" type="string" required={false}>
        この単語に対応する話者の一意の識別子。
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="channel_index" type="integer" required={false}>
    この文字起こしに対応するチャンネルインデックス（マルチチャンネル音声の場合に有効）。
  </ResponseField>

  <ResponseField name="language_code" type="string" required={true}>
    検出された言語コード（例：'eng' は英語を表します）。
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    このレスポンスの文字起こしの一意の ID。
  </ResponseField>

  <ResponseField name="language_probability" type="number" required={true}>
    言語検出の信頼度（0 から 1 の間）。
  </ResponseField>
</Accordion>

<Accordion title="レスポンスタイプ 2">
  <ResponseField name="transcripts" type="object[]" required={true}>
    各音声チャンネルに対応する文字起こしのリスト。各文字起こしには、対応するチャンネルのテキストと単語レベルの詳細情報が含まれます。

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="text" type="string" required={true}>
        文字起こしされた元のテキスト。
      </ResponseField>

      <ResponseField name="words" type="object[]" required={true}>
        単語とその時間情報のリスト。

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            この単語または音の音声内での終了時間（秒）。
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            文字起こしされた単語または音の内容。
          </ResponseField>

          <ResponseField name="type" type="string" required={true}>
            この単語または音のタイプ。'audio\_event' は、笑い声や足音などの単語ではない音に使用されます。

            選択可能な値：`word`, `spacing`, `audio_event`
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            この単語または音の音声内での開始時間（秒）。
          </ResponseField>

          <ResponseField name="logprob" type="number" required={true}>
            この単語を予測した際の対数確率。logprob の範囲は \[-infinity, 0] で、値が高いほどモデルの予測の信頼度が高いことを示します。
          </ResponseField>

          <ResponseField name="characters" type="object[]" required={false}>
            単語を構成する文字と、それに対応する時間情報。

            <Expandable title="properties" defaultOpen={true}>
              <ResponseField name="end" type="number" required={false}>
                文字の音声内での終了時間（秒）。
              </ResponseField>

              <ResponseField name="text" type="string" required={true}>
                文字起こしされた文字の内容。
              </ResponseField>

              <ResponseField name="start" type="number" required={false}>
                文字の音声内での開始時間（秒）。
              </ResponseField>
            </Expandable>
          </ResponseField>

          <ResponseField name="speaker_id" type="string" required={false}>
            この単語に対応する話者の一意の識別子。
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="channel_index" type="integer" required={false}>
        この文字起こしに対応するチャンネルインデックス（マルチチャンネル音声の場合に有効）。
      </ResponseField>

      <ResponseField name="language_code" type="string" required={true}>
        検出された言語コード（例：'eng' は英語を表します）。
      </ResponseField>

      <ResponseField name="transcription_id" type="string" required={false}>
        このレスポンスの文字起こしの一意の ID。
      </ResponseField>

      <ResponseField name="language_probability" type="number" required={true}>
        言語検出の信頼度（0 から 1 の間）。
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    このレスポンスの文字起こしの一意の ID。
  </ResponseField>
</Accordion>
