文本转语音与文本转对话 WebSocket 对比
文本转语音与文本转对话 WebSocket 对比
本指南介绍如何为流式语音选择合适的 WebSocket,以及两种协议的区别。
ElevenLabs 提供两种不同的 WebSocket 产品,用于流式传输合成语音。它们解决的问题不同,接受的消息格式不同,面向的模型也不同。
应该使用哪种 WebSocket?
当你为 每个连接使用一个音色(音色固定在 URL 中)流式传输纯文本,并且需要 非 v3 模型(如 Flash 或 Multilingual v2)、可选 SSML、分块计划,或用于智能体式打断处理的 多上下文 变体时,请使用 文本转语音(TTS)WebSocket。
当你需要 Eleven v3 对话能力时,请使用 文本转对话(TTD)WebSocket:富有表现力的语音、每个分块的 voice_id、轮次边界(new_turn),以及与服务器端 v3 相同的面向对话的缓冲机制。
如需进行 批量或 HTTP 流式传输 对话(一次调用提交完整请求),请使用创建对话或流式传输对话,而不是 WebSocket。
对比
何时更适合使用 TTS WebSocket
- 你已集成 Flash 或 Multilingual v2,以满足延迟或语言覆盖需求。
- 每个连接需要一个旁白音色,并希望使用简单的每帧文本协议。
- 需要用于打断和并行话语的 多上下文 编排(多上下文指南)。
有关 TTS WebSocket 的完整操作说明,请参阅实时生成音频。
何时更适合使用 TTD WebSocket
- 面向 Eleven v4 对话(表现力标签、自然对话节奏、多说话人台词)。
- 流式传输脚本化或由 LLM 生成的对话,并且无需新建连接即可按行切换说话音色。
- 希望使用 WebSocket 形式的增量输入,以及服务器端仅适用于 v4 的对话生成。
如需实际操作指南,请参阅实时文本转对话。协议详情请参阅 API 参考文档。