跳至内容

推出 Scribe v2

发布时间

收听收听本文

Scribe v2 专为大规模批量转录、字幕和说明文字生成而打造。相比 Scribe v1,其稳定性和准确性更高,能更好地处理长音频、停顿、语调变化和长时间静音。

Introducing Scribe v2

Scribe v2 Realtime 针对超低延迟和 智能体 使用场景优化,而 Scribe v2 则面向长篇复杂录音,在不同说话人、口音和表达风格下保持准确。无论现实音频条件如何,都能稳定输出可靠的转录结果。


Scribe v2 在行业标准基准测试中实现了有记录以来最低的词错误率。

Scribe v2 FLEURS benchmark

利用关键词提示实现上下文感知转录

关键词提示会利用转录文本的上下文,超越标准 Custom Vocabulary。最多可选择 100 个词或短语,Scribe v2 会准确判断何时转录这些术语。这项功能尤其适合技术领域、品牌名称和行业专业用语。

Scribe v2 keyterm prompting

内置实体检测,提供精确时间戳

Scribe v2 内置实体检测,可进行结构化音频分析。

可从个人身份信息、健康数据和支付详情中选择最多 56 个类别。Scribe v2 会自动在转录文本中识别这些内容及其精确时间戳,便于大规模审核、脱敏或处理敏感信息。

查看 API 文档了解更多:https://elevenlabs.io/docs/developers/guides/cookbooks/speech-to-text/batch/entity-detection

自动多语言转录

Scribe v2 开箱即支持智能多语言 workflow。

可在单个文件中上传包含多种语言的音频。模型会自动识别每种语言并正确转录,无需手动分段或配置。

适用于生产 workflow 的更多功能

Scribe v2 提供一系列面向企业和开发者使用场景的功能:

  • 智能说话人分离,提供清晰直观的说话人标注
  • 精确到词级的时间戳,便于字幕精准对齐和构建交互体验
  • 动态音频标签,可检测笑声、脚步声等非语音事件
  • 企业级支持,符合 SOC 2、ISO 27001、PCI DSS L1、HIPAA 和 GDPR 标准,支持欧盟和印度数据驻留及零留存模式

Scribe v2 现已登陆 ElevenLabs Studio

Scribe v2 现已用于 ElevenLabs Studio,提供更精准的字幕、说明文字和转录服务,帮助团队管理营销、媒体、研究、培训和合规场景中的大量音频与视频资料。

Scribe v2 in Studio

立即试用:https://elevenlabs.io/app/studio

使用 API 开发

借助 Scribe v2,开发者和企业可自动化复杂音频流程,提升全球内容 workflow 的准确性,并通过全面的合规与数据驻留控制安全扩展。

Scribe v2 Keyterm prompting code snippet

Scribe v2 现已通过 API 和 Creative 平台提供。

立即试用:https://elevenlabs.io/app/speech-to-text

阅读文档:https://elevenlabs.io/docs/capabilities/speech-to-text

在此注册:https://elevenlabs.io/speech-to-text

相关内容

用高质量 AI 音频创作