文本转语音
文本转语音
了解如何使用 ElevenLabs 将文本转换为逼真的语音音频。
概述
ElevenLabs 文本转语音 (TTS) API 可将文本转换为逼真音频,具备细腻的语调、节奏和情感感知能力。我们的模型可根据 32 种语言和多种音色风格中的文本线索进行调整,可用于:
- 为全球媒体宣传活动和广告配音
- 制作具有复杂情感表达的多语言有声书
- 根据文本实时流式传输音频
试听示例:
浏览我们的声音库,为项目找到理想音色。
音色质量
对于实时应用,Flash v2.5 提供低至 75ms 的超低延迟,而 Multilingual v2 则以更细腻的表达提供最高质量音频。
音色选项
ElevenLabs 通过多种创建方式,提供覆盖 32 种语言的数千种音色:
详细了解音色选项。
支持的输出格式
默认响应格式为 mp3,也支持 pcm 和 ulaw 等其他格式。
- MP3
- 采样率:22.05kHz - 44.1kHz
- 比特率:32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps、64kbps、96kbps、128kbps、192kbps
- PCM (S16LE)
- 采样率:16kHz - 44.1kHz
- 比特率:8kHz、16kHz、22.05kHz、24kHz、44.1kHz、48kHz
- 16 位深度
- μ-law
- 8kHz 采样率
- 针对电话应用优化
- A-law
- 8kHz 采样率
- 针对电话应用优化
- Opus
- 采样率:48kHz
- 比特率:32kbps - 192kbps
更高质量的音频选项仅适用于付费套餐,详情请参阅价格 页面。
支持的语言
多语言 v2 模型支持 29 种语言:
英语(美国、英国、澳大利亚、加拿大)、日语、中文、德语、印地语、法语(法国、加拿大)、韩语、葡萄牙语(巴西、葡萄牙)、意大利语、西班牙语(西班牙、墨西哥)、印尼语、荷兰语、土耳其语、菲律宾语、波兰语、瑞典语、保加利亚语、罗马尼亚语、阿拉伯语(沙特阿拉伯、阿联酋)、捷克语、希腊语、芬兰语、克罗地亚语、马来语、斯洛伐克语、丹麦语、泰米尔语、乌克兰语和俄语。
Flash v2.5 支持 32 种语言——包括 v2 模型支持的所有语言,以及:
匈牙利语、挪威语和越南语
只需输入任一支持语言的文本,并从声音库中选择匹配的音色。为获得最自然的效果,请选择与目标语言和地区口音相符的音色。
提示词
模型会直接从输入文本中理解情感语境。例如,添加“她兴奋地说道”等描述性文字,或使用感叹号,都会影响语音情感。稳定性和相似度等音色设置有助于控制一致性,而底层情感则来自文本线索。
更多详情请阅读提示词指南。
描述性文字会被模型朗读。如需去除,必须手动从音频中裁剪或删除。
常见问题
我拥有生成音频的所有权吗?
是。你保留所生成音频的所有权。但商业使用权仅适用于付费套餐。订阅付费套餐后,如果你拥有输入内容的知识产权,便可将生成音频用于商业用途并通过其获利。
什么情况下可以免费重新生成?
在符合以下条件时,可免费重新生成相同的文本转语音内容,无需额外付费:
- 每段内容最多可免费重新生成 2 次
- 内容必须与上次生成完全相同。若更改文本、音色设置或其他参数,则需进行新的付费生成
当音频输出出现轻微失真时,免费重新生成功能会很有帮助。根据 ElevenLabs 的内部基准测试,重新生成可解决约一半的质量问题,其余问题通常由较差的训练数据造成。
为什么输出有时不一致?
模型具有非确定性。为提高一致性,可使用可选的 seed 参数,但仍可能出现细微差异。
转换大段文本的最佳做法是什么?
将长文本拆分为多个片段,并使用流式传输实现实时播放和高效处理。 为保持片段之间自然的韵律衔接,请包含上一段/下一段文本或上一请求/下一请求 ID 参数。
关键信息
- 确定性:输出具有非确定性 — 使用
seed参数可获得更一致的结果 - 免费重新生成:每次生成最多可免费重新生成 2 次(仅限内容和参数相同)
- 所有权:你保留生成音频的所有权;商业使用需订阅付费套餐
- 低延迟用途:使用 Flash 模型(
eleven_flash_v2或eleven_flash_v2_5)— 参阅延迟优化指南 - 长文本:将长文本拆分为多个片段;使用
previous_text/next_text参数保持片段间自然的韵律