了解 Scribe
- 发布时间
Scribe 是我们的首个 文本转语音模型,也是全球最准确的转录模型。Scribe 专为应对真实音频的不可预测性而打造,支持转录 99 种语言,并提供词级时间戳、说话人分离和音频事件标记,全部以结构化响应交付,便于无缝集成。

Scribe 专为精准而设计。在涵盖 99 种语言的 FLEURS 和 Common Voice 基准测试中,它持续优于 Gemini 2.0 Flash、Whisper Large V3 和 Deepgram Nova-3 等领先模型。无论是会议摘要、电影字幕还是歌词,Scribe 在意大利语(98.7%)、英语(96.7%)及其他 97 种语言中均实现了最低的自动转录词错误率。
Scribe 让 ASR 人人可用,大幅降低了塞尔维亚语、粤语和马拉雅拉姆语等长期缺乏支持的语言中的错误率;竞争模型在这些语言中的词错误率通常超过 40%。

开发者现在可通过我们的 文本转语音 API 集成 Scribe,获取包含 说话人分离、词级时间戳和非语音事件标记(如笑声)的结构化 JSON 转录文本。适用于实时应用的低延迟版本即将发布。
创作者和企业可直接通过 ElevenLabs 控制台 上传音频或视频文件,生成格式化转录文本。
使用 Scribe 开始构建:
基准测试
FLEURS - 词错误率 % - 102 种语言

Common Voice - 词错误率 % - 102 种语言

贡献者
研究负责人、训练、架构
Flavio Schneider
项目负责人、预训练数据、微调数据
Tim von Känel
推理、优化
Maximiliano Levi
研究贡献者
Johan Nordberg、Piotr Dabkowski
前端
Austin Malerba
后端
Hristo Stoychev
数据采集
Alex George

.webp&w=3840&q=80)


