> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabs voz a texto V2

Transcribe archivos de audio o video. Cuando use\_multi\_channel es true y el audio subido tiene varios canales, devuelve un objeto 'transcripts', con una transcripción por cada canal. De lo contrario, devuelve un único resultado de transcripción.

## Encabezados de la solicitud

<ParamField header="Content-Type" type="string" required={true}>
  Valor enumerado: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticación Bearer: Bearer \{\{API Key}}.
</ParamField>

## Cuerpo de la solicitud

<ParamField body="seed" type="integer" nullable={true}>
  Si se especifica, el sistema hará todo lo posible por muestrear de forma determinista; las solicitudes con el mismo seed y los mismos parámetros deberían devolver el mismo resultado, aunque no se garantiza un determinismo absoluto. Debe ser un entero entre 0 y 2147483647.

  Rango de valores: \[0, 2147483647]
</ParamField>

<ParamField body="diarize" type="boolean" default={false}>
  Si se debe etiquetar al hablante actual en el archivo subido.
</ParamField>

<ParamField body="file_format" type="string" default="other">
  Formato del audio de entrada. Puede ser 'pcm\_s16le\_16' u 'other'. pcm\_s16le\_16 requiere que el audio tenga una frecuencia de muestreo de 16 kHz, enteros de 16 bits, mono y formato little-endian; ofrece menor latencia que una forma de onda codificada.

  Valores posibles: `pcm_s16le_16`, `other`
</ParamField>

<ParamField body="temperature" type="number" nullable={true}>
  Controla la aleatoriedad de la salida de la transcripción. El rango de valores es de 0.0 a 2.0; cuanto mayor sea el valor, más variados y menos deterministas serán los resultados. Si se omite, se usará la temperatura predeterminada del modelo seleccionado (normalmente 0).

  Rango de valores: \[0, 2]
</ParamField>

<ParamField body="num_speakers" type="integer" nullable={true}>
  Número máximo de hablantes en el archivo subido. Puede usarse para ayudar a distinguir hablantes, con un máximo de 32 hablantes.

  Rango de valores: \[1, 32]
</ParamField>

<ParamField body="language_code" type="string" nullable={true}>
  Especifica el código de idioma ISO-639-1 o ISO-639-3 del archivo de audio. Indicarlo de antemano a veces puede mejorar el rendimiento de la transcripción. El valor predeterminado es null, lo que detectará automáticamente el idioma.
</ParamField>

<ParamField body="tag_audio_events" type="boolean" default={true}>
  Si se deben marcar en la transcripción eventos de audio como (laughter), (footsteps), etc.
</ParamField>

<ParamField body="cloud_storage_url" type="string" required={true} nullable={true}>
  Enlace HTTPS del archivo que se va a transcribir. Debe proporcionarse uno de file o cloud\_storage\_url. El archivo debe ser accesible mediante HTTPS y tener menos de 2 GB. Se admite cualquier dirección HTTPS válida, incluido almacenamiento en la nube (AWS S3, GCS, Cloudflare R2, etc.), CDN u otros orígenes HTTPS, así como enlaces prefirmados con token o autenticación mediante parámetros de consulta de URL.
</ParamField>

<ParamField body="use_multi_channel" type="boolean" default={false}>
  Si el archivo de audio es multicanal y cada canal contiene un único hablante. Al habilitarlo, se transcribirá cada canal de forma independiente y se combinarán los resultados; cada palabra del contenido de salida incluirá el campo channel\_index. Se admiten hasta 5 canales.
</ParamField>

<ParamField body="diarization_threshold" type="number" nullable={true}>
  Umbral de separación de hablantes (diarization). Con valores altos, disminuye la probabilidad de que una persona se divida en varias, pero aumenta la probabilidad de que distintas personas se fusionen en una sola (se identifican menos hablantes); con valores bajos, aumenta la probabilidad de que una persona se divida en varias, pero disminuye la probabilidad de que distintas personas se fusionen en una sola (más hablantes). Solo puede establecerse cuando diarize=True y num\_speakers=None. El valor predeterminado es None; el umbral se seleccionará según el id del modelo (normalmente 0.22).

  Rango de valores: \[0.1, 0.4]
</ParamField>

<ParamField body="timestamps_granularity" type="string" default="word">
  Granularidad de las marcas de tiempo en el contenido transcrito. 'word' proporciona marcas de tiempo a nivel de palabra; 'character' proporciona marcas de tiempo para cada carácter.

  Valores posibles: `none`, `word`, `character`
</ParamField>

## Información de respuesta

<Note>
  La respuesta puede ser uno de los siguientes tipos de respuesta:
</Note>

<Accordion title="Tipo de respuesta 1">
  <ResponseField name="text" type="string" required={true}>
    Texto sin procesar de la transcripción.
  </ResponseField>

  <ResponseField name="words" type="object[]" required={true}>
    Lista de palabras y su información temporal.

    <Expandable title="propiedades" defaultOpen={true}>
      <ResponseField name="end" type="number" required={false}>
        Hora de finalización de esta palabra o sonido en el audio (en segundos).
      </ResponseField>

      <ResponseField name="text" type="string" required={true}>
        Contenido de la palabra o sonido transcrito.
      </ResponseField>

      <ResponseField name="type" type="string" required={true}>
        Tipo de esta palabra o sonido. 'audio\_event' se usa para sonidos que no son palabras, como risas o pasos.

        Valores posibles: `word`, `spacing`, `audio_event`
      </ResponseField>

      <ResponseField name="start" type="number" required={false}>
        Hora de inicio de esta palabra o sonido en el audio (en segundos).
      </ResponseField>

      <ResponseField name="logprob" type="number" required={true}>
        Logaritmo de la probabilidad al predecir esta palabra. El rango de logprob es \[-infinity, 0]; un valor más alto indica que el modelo tiene más confianza en su predicción.
      </ResponseField>

      <ResponseField name="characters" type="object[]" required={false}>
        Caracteres que componen la palabra y su información temporal correspondiente.

        <Expandable title="propiedades" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Hora de finalización del carácter en el audio (en segundos).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Contenido del carácter transcrito.
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Hora de inicio del carácter en el audio (en segundos).
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="speaker_id" type="string" required={false}>
        Identificador único del hablante correspondiente a esta palabra.
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="channel_index" type="integer" required={false}>
    Índice del canal correspondiente a esta transcripción (válido para audio multicanal).
  </ResponseField>

  <ResponseField name="language_code" type="string" required={true}>
    Código de idioma detectado (por ejemplo, 'eng' para inglés).
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    ID único de transcripción de esta respuesta.
  </ResponseField>

  <ResponseField name="language_probability" type="number" required={true}>
    Confianza de la detección de idioma (entre 0 y 1).
  </ResponseField>
</Accordion>

<Accordion title="Tipo de respuesta 2">
  <ResponseField name="transcripts" type="object[]" required={true}>
    Lista de transcripciones correspondientes a cada canal de audio. Cada transcripción contiene el texto del canal correspondiente y detalles a nivel de palabra.

    <Expandable title="propiedades" defaultOpen={true}>
      <ResponseField name="text" type="string" required={true}>
        Texto sin procesar de la transcripción.
      </ResponseField>

      <ResponseField name="words" type="object[]" required={true}>
        Lista de palabras y su información temporal.

        <Expandable title="propiedades" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Hora de finalización de esta palabra o sonido en el audio (en segundos).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Contenido de la palabra o sonido transcrito.
          </ResponseField>

          <ResponseField name="type" type="string" required={true}>
            Tipo de esta palabra o sonido. 'audio\_event' se usa para sonidos que no son palabras, como risas o pasos.

            Valores posibles: `word`, `spacing`, `audio_event`
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Hora de inicio de esta palabra o sonido en el audio (en segundos).
          </ResponseField>

          <ResponseField name="logprob" type="number" required={true}>
            Logaritmo de la probabilidad al predecir esta palabra. El rango de logprob es \[-infinity, 0]; un valor más alto indica que el modelo tiene más confianza en su predicción.
          </ResponseField>

          <ResponseField name="characters" type="object[]" required={false}>
            Caracteres que componen la palabra y su información temporal correspondiente.

            <Expandable title="propiedades" defaultOpen={true}>
              <ResponseField name="end" type="number" required={false}>
                Hora de finalización del carácter en el audio (en segundos).
              </ResponseField>

              <ResponseField name="text" type="string" required={true}>
                Contenido del carácter transcrito.
              </ResponseField>

              <ResponseField name="start" type="number" required={false}>
                Hora de inicio del carácter en el audio (en segundos).
              </ResponseField>
            </Expandable>
          </ResponseField>

          <ResponseField name="speaker_id" type="string" required={false}>
            Identificador único del hablante correspondiente a esta palabra.
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="channel_index" type="integer" required={false}>
        Índice del canal correspondiente a esta transcripción (válido para audio multicanal).
      </ResponseField>

      <ResponseField name="language_code" type="string" required={true}>
        Código de idioma detectado (por ejemplo, 'eng' para inglés).
      </ResponseField>

      <ResponseField name="transcription_id" type="string" required={false}>
        ID único de transcripción de esta respuesta.
      </ResponseField>

      <ResponseField name="language_probability" type="number" required={true}>
        Confianza de la detección de idioma (entre 0 y 1).
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    ID único de transcripción de esta respuesta.
  </ResponseField>
</Accordion>
