> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabs voz a texto V1

Transcribe archivos de audio o video. Cuando use\_multi\_channel es true y el audio cargado tiene varios canales, devuelve un objeto 'transcripts', con una transcripción por canal. De lo contrario, devuelve un único resultado de transcripción.

## Encabezados de solicitud

<ParamField header="Content-Type" type="string" required={true}>
  Valores de enumeración: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticación Bearer: Bearer \{\{API Key}}.
</ParamField>

## Cuerpo de la solicitud

<ParamField body="seed" type="integer" nullable={true}>
  Si se especifica, el sistema hará todo lo posible por muestrear de forma determinista; las solicitudes con el mismo seed y los mismos parámetros deberían devolver el mismo resultado, pero no se garantiza un determinismo absoluto. Debe ser un entero entre 0 y 2147483647.

  Rango de valores: \[0, 2147483647]
</ParamField>

<ParamField body="diarize" type="boolean" default={false}>
  Indica si se debe etiquetar al hablante actual en el archivo cargado.
</ParamField>

<ParamField body="file_format" type="string" default="other">
  Formato de audio de entrada. Puede ser 'pcm\_s16le\_16' u 'other'. pcm\_s16le\_16 requiere que el audio tenga una frecuencia de muestreo de 16kHz, enteros de 16 bits, mono y formato little-endian; ofrece menor latencia que una forma de onda codificada.

  Valores posibles: `pcm_s16le_16`, `other`
</ParamField>

<ParamField body="temperature" type="number" nullable={true}>
  Controla la aleatoriedad de la salida de transcripción. El rango de valores es de 0.0 a 2.0; los valores más altos producen resultados más variados y menos deterministas. Si se omite, se utilizará la temperatura predeterminada del modelo seleccionado (normalmente 0).

  Rango de valores: \[0, 2]
</ParamField>

<ParamField body="num_speakers" type="integer" nullable={true}>
  Número máximo de hablantes en el archivo cargado. Puede utilizarse para ayudar a distinguir hablantes; admite hasta 32 hablantes.

  Rango de valores: \[1, 32]
</ParamField>

<ParamField body="language_code" type="string" nullable={true}>
  Especifica el código de idioma ISO-639-1 o ISO-639-3 del archivo de audio. Indicarlo de antemano a veces puede mejorar el rendimiento de la transcripción. El valor predeterminado es null, y el idioma se detectará automáticamente.
</ParamField>

<ParamField body="tag_audio_events" type="boolean" default={true}>
  Indica si se deben etiquetar en la transcripción eventos de audio como (laughter) o (footsteps).
</ParamField>

<ParamField body="cloud_storage_url" type="string" required={true} nullable={true}>
  Enlace HTTPS del archivo que se va a transcribir. Debe proporcionarse file o cloud\_storage\_url. El archivo debe ser accesible mediante HTTPS y tener menos de 2GB; se admite cualquier dirección HTTPS válida, incluido almacenamiento en la nube (AWS S3, GCS, Cloudflare R2, etc.), CDN u otros orígenes HTTPS, así como enlaces prefirmados con token o autenticación mediante parámetros de consulta de URL.
</ParamField>

<ParamField body="use_multi_channel" type="boolean" default={false}>
  Indica si el archivo de audio es multicanal y cada canal contiene solo un hablante. Al habilitarlo, se transcribe cada canal de forma independiente y se combinan los resultados; cada palabra de la salida incluye el campo channel\_index, con soporte para hasta 5 canales.
</ParamField>

<ParamField body="diarization_threshold" type="number" nullable={true}>
  Umbral de diarización de hablantes. Con un valor alto, disminuye la probabilidad de dividir a una persona en varias, pero aumenta la probabilidad de combinar a distintas personas en una sola (se identifican menos hablantes); con un valor bajo, aumenta la probabilidad de dividir a una persona en varias, pero disminuye la probabilidad de combinar a distintas personas en una sola (más hablantes). Solo se puede establecer cuando diarize=True y num\_speakers=None. El valor predeterminado es None, y el umbral se seleccionará según el id del modelo (normalmente 0.22).

  Rango de valores: \[0.1, 0.4]
</ParamField>

<ParamField body="timestamps_granularity" type="string" default="word">
  Granularidad de las marcas de tiempo en el contenido transcrito. 'word' proporciona marcas de tiempo a nivel de palabra, y 'character' proporciona marcas de tiempo para cada carácter.

  Valores posibles: `none`, `word`, `character`
</ParamField>

## Información de respuesta

<Note>
  La respuesta puede ser uno de los siguientes tipos de respuesta:
</Note>

<Accordion title="Tipo de respuesta 1">
  <ResponseField name="text" type="string" required={true}>
    Texto original de la transcripción.
  </ResponseField>

  <ResponseField name="words" type="object[]" required={true}>
    Lista de palabras y su información temporal.

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="end" type="number" required={false}>
        Hora de finalización de esta palabra o sonido en el audio (en segundos).
      </ResponseField>

      <ResponseField name="text" type="string" required={true}>
        Contenido transcrito de la palabra o sonido.
      </ResponseField>

      <ResponseField name="type" type="string" required={true}>
        Tipo de esta palabra o sonido. 'audio\_event' se utiliza para sonidos que no son palabras, como risas o pasos.

        Valores posibles: `word`, `spacing`, `audio_event`
      </ResponseField>

      <ResponseField name="start" type="number" required={false}>
        Hora de inicio de esta palabra o sonido en el audio (en segundos).
      </ResponseField>

      <ResponseField name="logprob" type="number" required={true}>
        Logaritmo de la probabilidad al predecir esta palabra. El rango de logprob es \[-infinity, 0]; cuanto mayor sea el valor, mayor confianza tendrá el modelo en la predicción.
      </ResponseField>

      <ResponseField name="characters" type="object[]" required={false}>
        Caracteres que componen la palabra y su información temporal correspondiente.

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Hora de finalización del carácter en el audio (en segundos).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Contenido transcrito del carácter.
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Hora de inicio del carácter en el audio (en segundos).
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="speaker_id" type="string" required={false}>
        Identificador único del hablante correspondiente a esta palabra.
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="channel_index" type="integer" required={false}>
    Índice del canal correspondiente a esta transcripción (válido para audio multicanal).
  </ResponseField>

  <ResponseField name="language_code" type="string" required={true}>
    Código de idioma detectado (por ejemplo, 'eng' para inglés).
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    ID único de transcripción de esta respuesta.
  </ResponseField>

  <ResponseField name="language_probability" type="number" required={true}>
    Confianza de la detección de idioma (entre 0 y 1).
  </ResponseField>
</Accordion>

<Accordion title="Tipo de respuesta 2">
  <ResponseField name="transcripts" type="object[]" required={true}>
    Lista de transcripciones correspondientes a cada canal de audio. Cada transcripción contiene el texto del canal correspondiente y detalles a nivel de palabra.

    <Expandable title="properties" defaultOpen={true}>
      <ResponseField name="text" type="string" required={true}>
        Texto original de la transcripción.
      </ResponseField>

      <ResponseField name="words" type="object[]" required={true}>
        Lista de palabras y su información temporal.

        <Expandable title="properties" defaultOpen={true}>
          <ResponseField name="end" type="number" required={false}>
            Hora de finalización de esta palabra o sonido en el audio (en segundos).
          </ResponseField>

          <ResponseField name="text" type="string" required={true}>
            Contenido transcrito de la palabra o sonido.
          </ResponseField>

          <ResponseField name="type" type="string" required={true}>
            Tipo de esta palabra o sonido. 'audio\_event' se utiliza para sonidos que no son palabras, como risas o pasos.

            Valores posibles: `word`, `spacing`, `audio_event`
          </ResponseField>

          <ResponseField name="start" type="number" required={false}>
            Hora de inicio de esta palabra o sonido en el audio (en segundos).
          </ResponseField>

          <ResponseField name="logprob" type="number" required={true}>
            Logaritmo de la probabilidad al predecir esta palabra. El rango de logprob es \[-infinity, 0]; cuanto mayor sea el valor, mayor confianza tendrá el modelo en la predicción.
          </ResponseField>

          <ResponseField name="characters" type="object[]" required={false}>
            Caracteres que componen la palabra y su información temporal correspondiente.

            <Expandable title="properties" defaultOpen={true}>
              <ResponseField name="end" type="number" required={false}>
                Hora de finalización del carácter en el audio (en segundos).
              </ResponseField>

              <ResponseField name="text" type="string" required={true}>
                Contenido transcrito del carácter.
              </ResponseField>

              <ResponseField name="start" type="number" required={false}>
                Hora de inicio del carácter en el audio (en segundos).
              </ResponseField>
            </Expandable>
          </ResponseField>

          <ResponseField name="speaker_id" type="string" required={false}>
            Identificador único del hablante correspondiente a esta palabra.
          </ResponseField>
        </Expandable>
      </ResponseField>

      <ResponseField name="channel_index" type="integer" required={false}>
        Índice del canal correspondiente a esta transcripción (válido para audio multicanal).
      </ResponseField>

      <ResponseField name="language_code" type="string" required={true}>
        Código de idioma detectado (por ejemplo, 'eng' para inglés).
      </ResponseField>

      <ResponseField name="transcription_id" type="string" required={false}>
        ID único de transcripción de esta respuesta.
      </ResponseField>

      <ResponseField name="language_probability" type="number" required={true}>
        Confianza de la detección de idioma (entre 0 y 1).
      </ResponseField>
    </Expandable>
  </ResponseField>

  <ResponseField name="transcription_id" type="string" required={false}>
    ID único de transcripción de esta respuesta.
  </ResponseField>
</Accordion>
