Dust 使用 ElevenLabs 为 AI 驱动的企业 workflow 添加多语言语音功能
- 发布时间
Dust是面向 AI 原生企业的操作系统,现已接入由 ElevenLabs 提供支持的多语言语音输入与输出功能。Dust 旨在将模型融入日常工作,因此需要具备低延迟、高真实感的语音能力,可跨语言、设备和场景运行。
这并非探索性尝试。客户多次提出需求后,语音成为产品优先事项。最终形成的系统支持通勤时免手操作智能体、全球团队多语言协作,以及用于异步 workflow 的专业音频输出。
语音为何对企业至关重要
Dust 明确了工作场景中语音功能的 4 项关键要求:
- 经得起检验的自然品质:语音输出必须专业、自然,适合分享至客户邮件、播客或产品演示。
- 默认支持多语言:团队分布在全球各地,使用不同语言。在一次会话中切换法语、英语和德语不应是特殊情况。
- 低延迟:无论输入还是输出,响应速度都必须跟上思考和对话节奏。
- 企业级数据处理:零数据保留、基于区域的路由,以及符合 SOC 2 和 GDPR,都是不可妥协的要求。
Dust 为何选择 ElevenLabs
在评估 OpenAI、Google、Deepgram 和 AssemblyAI 等服务商后,Dust 因 ElevenLabs 出色的质量和部署就绪能力而选择了我们:
- 文本转语音音色始终具备高真实感和丰富的情感表现力,这对 Dust 的 Speech Generator 和 Sound Studio 工具至关重要。
- 语音转文本支持 99 种转写语言,跨语言准确性出色。
- 零数据保留和多区域路由开箱即用,确保符合企业合规要求。
- 生产级 SDK 和 API支持快速集成,并在各平台保持稳定表现。
Dust 如何集成语音功能
Dust 在两项核心 workflow 中构建了语音支持:
1. 语音输入:与智能体对话
借助 ElevenLabs 的 scribe_v1 模型,用户现在可以通过麦克风与 智能体对话。系统会自动识别口语语言、进行转写并相应路由请求,甚至能从自然语音中推断智能体名称。
移动端也支持语音输入,适用于不便打字的场景。
2. 语音输出:由智能体生成音频
通过 Speech Generator,Dust 智能体可使用 ElevenLabs 的 eleven_multilingual_v2 和 eleven_v3 模型创建音频内容。输出包括播客、简报和叙事类音频内容,可供内部使用或对外分享。
由 文本音效生成提供支持的 Sound Studio,可为培训和内容场景添加非语言音频层。
Dust 的经验
- 区域路由很重要:启用欧盟/美国区域选择后,既降低了延迟,也简化了合规沟通。
- 精选优于海量:精选 12 种音色,既覆盖所有核心需求,也减少了决策疲劳。
- 质量 > 速度:尽管有更快的模型可选,用户仍始终为生产内容选择保真度更高的音色。
这带来了什么
- 移动优先的生产力:随时记录想法并开展协作。
- 多语言协作:用自己的语言自然交流,其余交给智能体处理。
易用的异步 workflow:将研究内容转为音频,降低输入门槛,支持多样化工作方式。
下一步计划
Dust 正在探索实时 对话式语音智能体、超越转写的更深层音频理解,以及对会议、演示等长内容输入的支持。通过集成 ElevenLabs,Dust 让语音成为 企业 AI不可或缺的一部分。
.png&w=3840&q=80)



