推出 Scribe v2
- 发布时间
Scribe v2 专为大规模批量转录、字幕和说明文字生成而打造。相比 Scribe v1,其稳定性和准确性更高,能更好地处理长音频、停顿、语调变化和长时间静音。

Scribe v2 Realtime 针对超低延迟和 智能体 使用场景优化,而 Scribe v2 则面向长篇复杂录音,在不同说话人、口音和表达风格下保持准确。无论现实音频条件如何,都能稳定输出可靠的转录结果。
Scribe v2 在行业标准基准测试中实现了有记录以来最低的词错误率。

利用关键词提示实现上下文感知转录
关键词提示会利用转录文本的上下文,超越标准 Custom Vocabulary。最多可选择 100 个词或短语,Scribe v2 会准确判断何时转录这些术语。这项功能尤其适合技术领域、品牌名称和行业专业用语。

内置实体检测,提供精确时间戳
Scribe v2 内置实体检测,可进行结构化音频分析。
可从个人身份信息、健康数据和支付详情中选择最多 56 个类别。Scribe v2 会自动在转录文本中识别这些内容及其精确时间戳,便于大规模审核、脱敏或处理敏感信息。
查看 API 文档了解更多:https://elevenlabs.io/docs/developers/guides/cookbooks/speech-to-text/batch/entity-detection
自动多语言转录
Scribe v2 开箱即支持智能多语言 workflow。
可在单个文件中上传包含多种语言的音频。模型会自动识别每种语言并正确转录,无需手动分段或配置。
适用于生产 workflow 的更多功能
Scribe v2 提供一系列面向企业和开发者使用场景的功能:
- 智能说话人分离,提供清晰直观的说话人标注
- 精确到词级的时间戳,便于字幕精准对齐和构建交互体验
- 动态音频标签,可检测笑声、脚步声等非语音事件
- 企业级支持,符合 SOC 2、ISO 27001、PCI DSS L1、HIPAA 和 GDPR 标准,支持欧盟和印度数据驻留及零留存模式
Scribe v2 现已登陆 ElevenLabs Studio
Scribe v2 现已用于 ElevenLabs Studio,提供更精准的字幕、说明文字和转录服务,帮助团队管理营销、媒体、研究、培训和合规场景中的大量音频与视频资料。

立即试用:https://elevenlabs.io/app/studio
使用 API 开发
借助 Scribe v2,开发者和企业可自动化复杂音频流程,提升全球内容 workflow 的准确性,并通过全面的合规与数据驻留控制安全扩展。

Scribe v2 现已通过 API 和 Creative 平台提供。
立即试用:https://elevenlabs.io/app/speech-to-text


