跳至内容

推出 Scribe v2

发布时间

收听收听本文

Scribe v2 专为批量转录、大规模字幕制作和字幕添加而打造。相比 Scribe v1,它在稳定性和准确性上有所提升,能更好地处理长音频、停顿、语调变化和长时间静音。

Introducing Scribe v2

Scribe v2 Realtime 针对超低延迟和智能体使用场景进行了优化,而 Scribe v2 则专为长且复杂的录音优化,在不同说话人、口音和表达风格下均能保持准确。无论实际音频条件如何,都能持续提供可靠的转录文本。


Scribe v2 在行业标准基准测试中取得了目前最低的词错误率。

Scribe v2 FLEURS benchmark

基于上下文的关键词提示转录

关键词提示会利用转录文本的上下文,超越标准自定义词汇的能力。最多可选择 100 个单词或短语,Scribe v2 会准确判断何时转录这些术语。特别适合技术领域、品牌名称和行业专用语言。

Scribe v2 keyterm prompting

内置实体检测,提供精确时间戳

Scribe v2 内置原生实体检测功能,可用于结构化音频分析。

最多可从个人身份信息、健康数据和付款详情中选择 56 个类别。Scribe v2 会自动在转录文本中检测这些内容及其精确时间戳,便于大规模审核、脱敏或处理敏感信息。

在 API 文档中了解更多:https://elevenlabs.io/docs/developers/guides/cookbooks/speech-to-text/batch/entity-detection

自动多语言转录

Scribe v2 开箱即支持智能多语言 workflow。

可在单个文件中上传包含多种语言的音频。模型会自动识别每种语言并正确转录,无需手动分段或配置。

适用于生产 workflow 的更多功能

Scribe v2 提供一系列面向企业和开发者使用场景的功能:

  • 智能说话人分离,提供清晰直观的说话人标签
  • 精确到单词级别的时间戳,实现准确字幕对齐和交互体验
  • 动态音频标签,可检测笑声、脚步声等非语音事件
  • 具备企业级支持,包括符合 SOC 2、ISO 27001、PCI DSS L1、HIPAA 和 GDPR 标准,支持欧盟和印度数据驻留及零保留模式

Scribe v2 现已集成 ElevenLabs Studio

Scribe v2 现已用于 ElevenLabs Studio,提供更准确的字幕、说明文字和转录,支持团队管理营销、媒体、研究、培训和合规等场景中的大量音频和视频资料。

Scribe v2 in Studio

立即试用:https://elevenlabs.io/app/studio

使用 API 构建

借助 Scribe v2,开发者和企业可自动化复杂的音频处理流程,提高全球内容 workflow 的准确性,并通过完整的合规和数据驻留控制安全扩展。

Scribe v2 Keyterm prompting code snippet

Scribe v2 现已通过我们的 API 和 Creative 平台提供。

立即试用:https://elevenlabs.io/app/speech-to-text

阅读文档:https://elevenlabs.io/docs/capabilities/speech-to-text

在此注册:https://elevenlabs.io/speech-to-text

相关内容

用高质量 AI 音频创作