跳转到主要内容
POST
Elevenlabs TTS v3 时间戳语音生成
将文本转换为语音,并返回 Base64 音频和字符级时间戳信息。

请求头

Content-Type
string
必填
枚举值: application/json
Authorization
string
必填
Bearer 身份验证格式: Bearer {{API 密钥}}。

请求体

seed
integer
可选的确定性生成种子,但不保证完全确定。取值范围:[0, 4294967295]
text
string
必填
需要转换为语音的文本。长度限制:1 - 无限制
voice_id
string
必填
用于语音生成的音色 ID。
language_code
string
输入文本的语言代码,模型支持显式语言选择时使用。
output_format
string
默认值:"mp3_44100_128"
生成音频的输出格式,格式为 codec_sample_rate_bitrate,例如 mp3_22050_32。部分格式可能需要账号等级支持。可选值:alaw_8000, mp3_22050_32, mp3_24000_48, mp3_44100_128, mp3_44100_192, mp3_44100_32, mp3_44100_64, mp3_44100_96, opus_48000_128, opus_48000_192, opus_48000_32, opus_48000_64, opus_48000_96, pcm_16000, pcm_22050, pcm_24000, pcm_32000, pcm_44100, pcm_48000, pcm_8000, ulaw_8000, wav_16000, wav_22050, wav_24000, wav_32000, wav_44100, wav_48000, wav_8000
voice_settings
object
语音生成设置。留空时使用所选音色的默认配置。
next_request_ids
array
用于改善连续性的后续请求 ID,最多 3 个。数组长度:0 - 3
previous_request_ids
array
用于改善连续性的历史请求 ID,最多 3 个。数组长度:0 - 3
apply_text_normalization
string
默认值:"auto"
文本规范化模式。可选值:auto, on, off
apply_language_text_normalization
boolean
默认值:false
是否应用特定语言的文本规范化。
pronunciation_dictionary_locators
array
要应用的发音词典,最多 3 个。数组长度:0 - 3

响应信息

alignment
object
原始文本的字符级时间戳信息。
audio_base64
string
Base64 编码的生成音频。
normalized_alignment
object
规范化文本的字符级时间戳信息。