> ## Documentation Index
> Fetch the complete documentation index at: https://docs.jiekou.ai/llms.txt
> Use this file to discover all available pages before exploring further.

# ElevenLabs texto a voz Flash V2

Convierte texto en voz con la voz que elija y devuelve el audio.

## Encabezados de solicitud

<ParamField header="Content-Type" type="string" required={true}>
  Valores enumerados: `application/json`
</ParamField>

<ParamField header="Authorization" type="string" required={true}>
  Formato de autenticación Bearer: Bearer \{\{API Key}}.
</ParamField>

## Cuerpo de la solicitud

<ParamField body="seed" type="integer">
  Si se especifica, el sistema intentará muestrear de forma determinista. Las solicitudes repetidas con el mismo seed y los mismos parámetros deberían devolver el mismo resultado, pero no se garantiza una determinación completa.

  Rango de valores: \[0, 4294967295]
</ParamField>

<ParamField body="text" type="string" required={true}>
  El texto que se convertirá en voz.
</ParamField>

<ParamField body="stream" type="boolean">
  Si se debe activar el modo Stream.
</ParamField>

<ParamField body="voice_id" type="string" required={true}>
  El ID de la voz que se utilizará.
</ParamField>

<ParamField body="next_text" type="string">
  El texto posterior al texto de la solicitud actual. Se utiliza para mejorar la continuidad de la voz al concatenar varias generaciones.
</ParamField>

<ParamField body="language_code" type="string">
  Código de idioma (ISO 639-1) utilizado para el modelo y la normalización de texto. Si el modelo no admite este código de idioma, se devolverá un error.
</ParamField>

<ParamField body="output_format" type="string" default="mp3_44100_128">
  Formato de salida del audio generado. El formato es codec\_sample\_rate\_bitrate. La tasa de bits de 192 kbps para MP3 requiere una cuenta Creator o superior; la frecuencia de muestreo de 44.1 kHz para PCM requiere una cuenta Pro o superior.

  Valores opcionales: `mp3_22050_32`, `mp3_24000_48`, `mp3_44100_32`, `mp3_44100_64`, `mp3_44100_96`, `mp3_44100_128`, `mp3_44100_192`, `pcm_8000`, `pcm_16000`, `pcm_22050`, `pcm_24000`, `pcm_32000`, `pcm_44100`, `pcm_48000`, `ulaw_8000`, `alaw_8000`, `opus_48000_32`, `opus_48000_64`, `opus_48000_96`, `opus_48000_128`, `opus_48000_192`
</ParamField>

<ParamField body="previous_text" type="string">
  El texto anterior al texto de la solicitud actual. Se utiliza para mejorar la continuidad de la voz al concatenar varias generaciones.
</ParamField>

<ParamField body="use_pvc_as_ivc" type="boolean" default={false}>
  Si es `true`, se utiliza la versión IVC de la voz en lugar de la versión PVC. Esta es una solución temporal para la mayor latencia de la versión PVC.
</ParamField>

<ParamField body="voice_settings" type="object">
  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="speed" type="number" default={1}>
      Ajusta la velocidad de la voz. 1.0 es la velocidad predeterminada; un valor inferior a 1.0 ralentiza el habla, y uno superior a 1.0 la acelera.
    </ParamField>

    <ParamField body="style" type="number" default={0}>
      Determina el grado de exageración del estilo de la voz. Intenta amplificar el estilo del hablante original. Cuando se establece en un valor distinto de 0, consume más recursos de cómputo y puede aumentar la latencia.
    </ParamField>

    <ParamField body="stability" type="number" default={0.5}>
      Determina la estabilidad de la generación de voz y la aleatoriedad entre cada generación. Los valores más bajos aportan un rango emocional más amplio; los valores más altos pueden hacer que la voz resulte monótona.
    </ParamField>

    <ParamField body="similarity_boost" type="number" default={0.75}>
      Determina el grado de ajuste de la IA al intentar replicar la voz original.
    </ParamField>

    <ParamField body="use_speaker_boost" type="boolean" default={true}>
      Mejora la similitud con el hablante original. Requiere una carga de cómputo ligeramente mayor y aumentará la latencia.
    </ParamField>
  </Expandable>
</ParamField>

<ParamField body="next_request_ids" type="string[]">
  Lista de request\_id de muestras posteriores. Se utiliza para mantener la continuidad de la voz al regenerar muestras. Se pueden pasar como máximo 3 request\_id.

  Longitud del array: 0 - 3
</ParamField>

<ParamField body="previous_request_ids" type="string[]">
  Lista de request\_id de muestras ya generadas antes de la generación actual. Puede utilizarse para mejorar la continuidad de la voz. Se pueden pasar como máximo 3 request\_id.

  Longitud del array: 0 - 3
</ParamField>

<ParamField body="apply_text_normalization" type="string" default="auto">
  Controla la normalización del texto. 'auto' deja que el sistema decida, 'on' siempre normaliza y 'off' la omite.

  Valores opcionales: `auto`, `on`, `off`
</ParamField>

<ParamField body="apply_language_text_normalization" type="boolean" default={false}>
  Controla la normalización de texto específica del idioma para ciertos idiomas admitidos, con el fin de lograr una pronunciación más natural. Advertencia: puede aumentar considerablemente la latencia. Actualmente solo se admite japonés.
</ParamField>

<ParamField body="pronunciation_dictionary_locators" type="object[]">
  Lista de localizadores de diccionarios de pronunciación (id, version\_id) que se deben aplicar al texto. Se aplican en orden. Cada solicitud puede tener como máximo 3 localizadores.

  Longitud del array: 0 - 3

  <Expandable title="properties" defaultOpen={true}>
    <ParamField body="version_id" type="string">
      El ID de la versión del diccionario de pronunciación. Si no se especifica, se utiliza la versión más reciente.
    </ParamField>

    <ParamField body="pronunciation_dictionary_id" type="string" required={true}>
      El ID del diccionario de pronunciación.
    </ParamField>
  </Expandable>
</ParamField>

## Información de respuesta

Archivo de audio generado

Formato: `binary`
