跳至内容

了解 Scribe

发布时间

收听收听本文

Scribe 是我们的首个 文本转语音模型,也是全球最准确的转录模型。Scribe 专为应对真实音频的不可预测性而打造,支持转录 99 种语言,并提供词级时间戳、说话人分离和音频事件标记,全部以结构化响应交付,便于无缝集成。

Scribe 专为精准而设计。在涵盖 99 种语言的 FLEURS 和 Common Voice 基准测试中,它持续优于 Gemini 2.0 Flash、Whisper Large V3 和 Deepgram Nova-3 等领先模型。无论是会议摘要、电影字幕还是歌词,Scribe 在意大利语(98.7%)、英语(96.7%)及其他 97 种语言中均实现了最低的自动转录词错误率。

Scribe 让 ASR 人人可用,大幅降低了塞尔维亚语、粤语和马拉雅拉姆语等长期缺乏支持的语言中的错误率;竞争模型在这些语言中的词错误率通常超过 40%。

The world's most accurate ASR model by IIElevenLabs.

开发者现在可通过我们的 文本转语音 API 集成 Scribe,获取包含 说话人分离、词级时间戳和非语音事件标记(如笑声)的结构化 JSON 转录文本。适用于实时应用的低延迟版本即将发布。

创作者和企业可直接通过 ElevenLabs 控制台 上传音频或视频文件,生成格式化转录文本。

使用 Scribe 开始构建:

API 文档 | 在 ElevenLabs 控制台中试用

基准测试

FLEURS - 词错误率 % - 102 种语言

Bar chart comparing word error rates for different languages and speech recognition models.

Common Voice - 词错误率 % - 102 种语言

Bar chart comparing word error rates for different voice recognition models across various countries.

贡献者

研究负责人、训练、架构

Flavio Schneider

项目负责人、预训练数据、微调数据

Tim von Känel

推理、优化

Maximiliano Levi

研究贡献者

Johan Nordberg、Piotr Dabkowski

前端

Austin Malerba

后端

Hristo Stoychev

数据采集

Alex George

相关内容

用高质量 AI 音频创作