跳至内容

Scribe v2 Medical 现已面向所有人开放

作者
Min Kim
发布时间

收听收听本文

临床音频是检验语音识别准确性的最难场景之一。药物名称长且罕见,容易混淆(hydroxyzine 和 hydralazine 仅因一个音节误听就会混淆)。词汇密集,剂量、单位、解剖学和病理学术语可能快速连续出现。风险也更高,因为转录错误可能影响患者护理。

因此,ElevenLabs 今日发布 Scribe v2 Medical,这是一款针对临床音频微调的文本转语音模型,现已在 ElevenAPI 正式全面上线。在 ElevenLabs 测试中,它在医疗 ASR 基准测试中实现了最低词错误率(WER),与基础版 Scribe v2 相比,临床音频的 WER 降低了 18%。

通用模型擅长处理日常语音,但在临床工作流程最需要的场景中表现会下降。我们基于任何人都可复现的公开基准,为 Scribe v2 训练了医疗微调版本,重点优化药物名称和临床听写。

Scribe v2 Medical 是临床应用的明确之选 

Eka 医疗 ASR 基准测试

在内部测试中,Scribe v2 Medical 的 WER 低于 Eka 医疗 ASR 基准测试 上发布的所有结果。该评测数据集包含 3,619 段英语临床音频样本,涵盖独立的药物和病症名称、临床句子,以及临床医生与患者之间的对话,并提供逐术语标注和数据集页面上的公开排行榜。 

Eka

Omi Health 医疗文本转语音基准测试

性能不止体现在单一基准测试中。Omi Health 维护了一份公开排行榜,对 30 个文本转语音系统进行评测,数据来自 1,513 段英语临床音频(57 次诊疗,共计 7.2 小时)。

Omi 直接在该基准上评测了 Scribe v2 Medical。它在测试的全部 30 个系统中取得最低的总体 WER(5.88%),并显著提高了相较基础版 Scribe v2 的剂量准确率(86.2% 对比 79.8%)。 

Omi 将于 9 月 25 日更新基准测试结果,加入 Scribe v2 Medical;经其许可,我们在更新前提前分享上述数据。

已投入生产的客户

客户已在生产环境中使用 Scribe v2 Medical,并看到临床音频效果的提升。

CareCo CEO 兼创始人 Mendel Erlenwein 表示:“从 Deepgram 切换到 ElevenLabs Scribe v2 Medical 后,我们在临床术语上的准确率显著提高,这改变了团队的工作方式。协调员信赖转录内容后,可以少花时间修正记录,多花时间与患者通话。患者的治疗方案很复杂,护理团队阅读的记录必须准确无误。”

最关键的改进

完整转录的 WER 有时会掩盖临床场景中最关键的问题,因为即使是临床对话,主要也由日常语言组成。Eka 对每个样本中的医疗术语进行了标注,因此可以单独评估这些术语。在仅医疗术语的 WER 上,Scribe v2 Medical 比基础版少犯 14% 的错误(9.5% 对比 11.1%);当术语出现在完整句子中时,提升最明显(7.5% 对比 9.9%)。

Fine-tuning lowers medical term error rates overall and in clinical sentences, but not conversation.

同一数据也表明,独立的单词音频(没有上下文、仅说出一个药物名称)仍是排行榜上所有模型最难处理的情况,包括 Scribe v2 Medical。它对独立术语的 WER 为 14.3%,而术语出现在句子中时为 7.5%。在完全没有上下文的情况下,一个听错的音节就可能导致令人印象深刻的错误:

  • etodolac(一种 NSAID)→ “It'll do the luck”
  • levomilnacipran(一种抗抑郁药)→ “Leave me alone now, Sephora.”
  • methdilazine(一种抗组胺药)→ “Let's play our scene.”

减少这类错误的方法之一是使用 关键词提示,通过突出显示药物名称或医学短语,引导模型更准确地转录这些内容。

不止领先基准测试

v2 Medical 的准确性不只适用于英语。 

Corti 的 MedDictate 基准测试(一个公开的临床听写数据集)中,与基础版 Scribe v2 相比,Scribe v2 Medical 将 WER 降低约 36%,且三种语言均有提升:

Error rates are lower with Scribe v2 Medical than Scribe v2 across all languages.

团队还验证了医疗微调不会降低其他领域的性能。对于来自 CommonVoice 的 6,000 段日常非医疗语音样本,Scribe v2 Medical 与基础版 Scribe v2 的得分四舍五入后相同,两者的 WER 均为 5.3%。因此,v2 Medical 可提供专业医疗模型的优势,同时不牺牲该基准上的准确率。

专为受保护健康信息打造

对于已签署业务伙伴协议(BAA)并启用 零保留模式(ZRM)的企业版客户,Scribe v2 Medical 符合 HIPAA 适用资格。

为文本转语音 API 请求启用 ZRM 后,每次请求完成后都会立即删除音频输入和文本输出。ElevenLabs 不会保留两者,应用程序将收到完整的 API 响应,并自行控制转录内容的保留方式。

快速开始

Scribe v2 Medical 已在 文本转语音 API 中提供。只需传入新的模型 ID:scribe_v2_medical

import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({ apiKey: "YOUR_API_KEY" });

const fileData = await fs.promises.readFile("clinical_audio.mp3");

const transcription = await elevenlabs.speechToText.convert({
  file: new Blob([fileData], { type: "audio/mp3" });,
  modelId: "scribe_v2_medical",
});

console.log(transcription.text);

该模型运行在批量文本转语音端点。

相关内容

用高质量 AI 音频创作