Scribe v2 Medical 现已面向所有人开放
- 作者
- Min Kim
- 发布时间
收听收听本文
临床音频是检验语音识别准确性的最难场景之一。药物名称长且罕见,容易混淆(hydroxyzine 和 hydralazine 仅因一个音节误听就会混淆)。词汇密集,剂量、单位、解剖学和病理学术语可能快速连续出现。风险也更高,因为转录错误可能影响患者护理。
因此,ElevenLabs 今日发布 Scribe v2 Medical,这是一款针对临床音频微调的文本转语音模型,现已在 ElevenAPI 正式全面上线。在 ElevenLabs 测试中,它在医疗 ASR 基准测试中实现了最低词错误率(WER),与基础版 Scribe v2 相比,临床音频的 WER 降低了 18%。
通用模型擅长处理日常语音,但在临床工作流程最需要的场景中表现会下降。我们基于任何人都可复现的公开基准,为 Scribe v2 训练了医疗微调版本,重点优化药物名称和临床听写。
Scribe v2 Medical 是临床应用的明确之选
Eka 医疗 ASR 基准测试
在内部测试中,Scribe v2 Medical 的 WER 低于 Eka 医疗 ASR 基准测试 上发布的所有结果。该评测数据集包含 3,619 段英语临床音频样本,涵盖独立的药物和病症名称、临床句子,以及临床医生与患者之间的对话,并提供逐术语标注和数据集页面上的公开排行榜。

Omi Health 医疗文本转语音基准测试
性能不止体现在单一基准测试中。Omi Health 维护了一份公开排行榜,对 30 个文本转语音系统进行评测,数据来自 1,513 段英语临床音频(57 次诊疗,共计 7.2 小时)。
Omi 直接在该基准上评测了 Scribe v2 Medical。它在测试的全部 30 个系统中取得最低的总体 WER(5.88%),并显著提高了相较基础版 Scribe v2 的剂量准确率(86.2% 对比 79.8%)。
Omi 将于 9 月 25 日更新基准测试结果,加入 Scribe v2 Medical;经其许可,我们在更新前提前分享上述数据。
已投入生产的客户
客户已在生产环境中使用 Scribe v2 Medical,并看到临床音频效果的提升。
CareCo CEO 兼创始人 Mendel Erlenwein 表示:“从 Deepgram 切换到 ElevenLabs Scribe v2 Medical 后,我们在临床术语上的准确率显著提高,这改变了团队的工作方式。协调员信赖转录内容后,可以少花时间修正记录,多花时间与患者通话。患者的治疗方案很复杂,护理团队阅读的记录必须准确无误。”
最关键的改进
完整转录的 WER 有时会掩盖临床场景中最关键的问题,因为即使是临床对话,主要也由日常语言组成。Eka 对每个样本中的医疗术语进行了标注,因此可以单独评估这些术语。在仅医疗术语的 WER 上,Scribe v2 Medical 比基础版少犯 14% 的错误(9.5% 对比 11.1%);当术语出现在完整句子中时,提升最明显(7.5% 对比 9.9%)。

同一数据也表明,独立的单词音频(没有上下文、仅说出一个药物名称)仍是排行榜上所有模型最难处理的情况,包括 Scribe v2 Medical。它对独立术语的 WER 为 14.3%,而术语出现在句子中时为 7.5%。在完全没有上下文的情况下,一个听错的音节就可能导致令人印象深刻的错误:
- etodolac(一种 NSAID)→ “It'll do the luck”
- levomilnacipran(一种抗抑郁药)→ “Leave me alone now, Sephora.”
- methdilazine(一种抗组胺药)→ “Let's play our scene.”
减少这类错误的方法之一是使用 关键词提示,通过突出显示药物名称或医学短语,引导模型更准确地转录这些内容。
不止领先基准测试
v2 Medical 的准确性不只适用于英语。
在 Corti 的 MedDictate 基准测试(一个公开的临床听写数据集)中,与基础版 Scribe v2 相比,Scribe v2 Medical 将 WER 降低约 36%,且三种语言均有提升:

团队还验证了医疗微调不会降低其他领域的性能。对于来自 CommonVoice 的 6,000 段日常非医疗语音样本,Scribe v2 Medical 与基础版 Scribe v2 的得分四舍五入后相同,两者的 WER 均为 5.3%。因此,v2 Medical 可提供专业医疗模型的优势,同时不牺牲该基准上的准确率。
专为受保护健康信息打造
对于已签署业务伙伴协议(BAA)并启用 零保留模式(ZRM)的企业版客户,Scribe v2 Medical 符合 HIPAA 适用资格。
为文本转语音 API 请求启用 ZRM 后,每次请求完成后都会立即删除音频输入和文本输出。ElevenLabs 不会保留两者,应用程序将收到完整的 API 响应,并自行控制转录内容的保留方式。
快速开始
Scribe v2 Medical 已在 文本转语音 API 中提供。只需传入新的模型 ID:scribe_v2_medical
该模型运行在批量文本转语音端点。



