文本转对话
文本转对话
了解如何使用 ElevenLabs 创建沉浸式、自然流畅的对话。
概述
ElevenLabs 文本转对话 API 使用 Eleven v4 和 Eleven v3,根据文本生成自然、富有表现力的对话。建议使用 Eleven v4。常见用途包括:
- 为视频游戏生成自然精准的对话
- 为播客和其他音频内容创建沉浸式对话
- 用富有表现力的旁白让有声书更生动
可能需要多次生成才能达到理想效果。将文本转对话集成到应用时,建议生成多个版本,让用户选择最佳结果。
试听示例:
音色选项
ElevenLabs 通过多种创建方式提供数千种音色。Eleven v4 支持超过 90 种语言,Eleven v3 支持超过 70 种语言。
详细了解音色选项。
提示词
模型会直接从输入文本中理解情感语境。例如,添加“她兴奋地说道”等描述性文字,或使用感叹号,都会影响语音情感。稳定性和相似度等音色设置有助于控制一致性,而底层情感则来自文本线索。
更多详情请阅读提示词指南。
使用音频标签表达情感
Eleven v4 和 Eleven v3 支持使用非语音音频事件来影响对话的表达方式。只需将音频事件用方括号包裹后插入文本输入即可。
在文本转对话中,每一轮对话都有各自的文本和音色。在需要影响的对话轮次文本中添加音频标签。voice_id 仍用于选择该轮次的说话人音色,而标签则用于引导表达方式。
例如,一位说话人可使用一种音色,并让文本以 [giggling] 开头;下一位说话人则可使用另一种音色,并让文本以 [whispering] 开头。有关结合标签和 voice_id 的 API 示例,请参阅文本转对话快速入门。
音频标签是自然语言指令,而非枚举参数。请用方括号包裹指令,并将其置于需要改变表达方式的文本位置。以下示例并不详尽;如需了解如何有效使用标签,请参阅提示词指南。
音频标签有几种不同形式:
情感与表达方式
例如:[sad]、[laughing] 和 [whispering]
音频事件
例如:[leaves rustling]、[gentle footsteps] 和 [applause]。
整体指导
例如:[football]、[wrestling match] 和 [auctioneer]。
示例:
还可以使用标点符号来表示对话节奏,例如打断:
省略号可用于表示未说完的句子:
支持的输出格式
默认响应格式为 mp3,也支持 pcm 和 ulaw 等其他格式。
- MP3
- 采样率:22.05kHz - 44.1kHz
- 比特率:32kbps - 192kbps
- 22.05kHz @ 32kbps
- 44.1kHz @ 32kbps、64kbps、96kbps、128kbps、192kbps
- PCM (S16LE)
- 采样率:16kHz - 44.1kHz
- 比特率:8kHz、16kHz、22.05kHz、24kHz、44.1kHz、48kHz
- 16 位深度
- μ-law
- 8kHz 采样率
- 针对电话应用优化
- A-law
- 8kHz 采样率
- 针对电话应用优化
- Opus
- 采样率:48kHz
- 比特率:32kbps - 192kbps
更高质量的音频选项仅适用于付费套餐,详情请参阅价格 页面。
支持的语言
Eleven v4 支持超过 90 种语言。Eleven v3 支持超过 70 种语言。完整列表请参阅 Eleven v4 和 Eleven v3。
常见问题
可以使用哪些模型?
文本转对话适用于 Eleven v4 和 Eleven v3 模型。
我拥有生成音频的所有权吗?
是。你保留所生成音频的所有权。但商业使用权仅适用于付费套餐。订阅付费套餐后,如果你拥有输入内容的知识产权,便可将生成音频用于商业用途并通过其获利。
什么情况下可以免费重新生成?
在符合以下条件时,可免费重新生成相同的文本转语音内容,无需额外付费:
- 仅可在 ElevenLabs 控制台中使用。
- 每段内容最多可免费重新生成 2 次。
- 内容必须与上次生成完全相同。若更改文本、音色设置或其他参数,则需进行新的付费生成。
当音频输出出现轻微失真时,免费重新生成功能会很有帮助。根据 ElevenLabs 的内部基准测试,重新生成可解决约一半的质量问题,其余问题通常由较差的训练数据造成。
对话可以有多少位说话人?
对话中的说话人数没有限制。
为什么输出有时不一致?
模型具有非确定性。为提高一致性,可使用可选的 seed 参数,但仍可能出现细微差异。
转换大段文本的最佳做法是什么?
为确保生成稳定,每次请求中所有 inputs[].text 值的总长度应不超过 2,000 个字符。将较长文本拆分为多个片段,并在应用中拼接生成的音频。
关键信息
- 模型:支持 Eleven v4 和 Eleven v3
- 说话人:每段对话的说话人数不限
- 请求大小:每次请求中所有
inputs[].text值的总长度应不超过 2,000 个字符 - 确定性:输出具有非确定性 — 使用
seed参数可获得更一致的结果 - 免费重新生成:每次生成最多可免费重新生成 2 次(内容和参数相同,仅限控制台)
- 所有权:你保留生成音频的所有权;商业使用需订阅付费套餐