Hoppa till innehållet

Scribe v2 Medical är nu tillgängligt för alla

Skriven av
Min Kim
Publicerad

LyssnaLyssna på den här artikeln

Kliniskt ljud är ett av de svåraste testen för träffsäker taligenkänning. Läkemedelsnamn är långa, ovanliga och lätta att förväxla (hydroxyzin och hydralazin skiljs åt av en enda feluppfattad stavelse). Ordförrådet är tätt, med doseringar, enheter samt anatomiska och patologiska termer som kan komma i snabb följd. Insatserna är också högre eftersom ett transkriberingsfel kan påverka en patients vård.

Därför lanserar ElevenLabs idag Scribe v2 Medical, vår Speech to Text-modell finjusterad för kliniskt ljud, som nu är allmänt tillgänglig på ElevenAPI. I ElevenLabs tester har den den lägsta ordfelfrekvensen (WER) på medicinska ASR-riktmärken och minskar WER för kliniskt ljud med 18 % jämfört med vår grundmodell Scribe v2.

Modeller för allmänna ändamål är bra på vardagligt tal, men presterar sämre där kliniska arbetsflöden behöver dem som mest. Vi tränade en medicinsk finjustering av Scribe v2 med fokus på läkemedelsnamn och klinisk diktering, utifrån offentliga riktmärken som vem som helst kan reproducera.

Scribe v2 Medical är det självklara valet för kliniska användningsfall 

Eka Medical ASR-riktmärke

I interna tester uppnår Scribe v2 Medical en lägre WER i ElevenLabs tester än alla resultat som publicerats på Eka Medical ASR-riktmärket. Utvärderingsdatasetet innehåller 3 619 engelska kliniska ljudprov — med enskilda läkemedels- och tillståndsnamn, kliniska meningar och samtal mellan vårdpersonal och patienter — med annoteringar per term och en publicerad topplista på datasetkortet. 

Eka

Omi Healths riktmärke för medicinsk Speech to Text

Resultaten styrks även utöver ett enskilt riktmärke. Omi Health har en offentlig topplista över 30 Speech to Text-system som bedömts på 1 513 engelska kliniska klipp (7,2 timmar från 57 konsultationer).

Omi utvärderade Scribe v2 Medical direkt på detta riktmärke. Modellen har den lägsta totala WER:en av alla 30 testade system (5,88 %) och förbättrar doseringsprecisionen avsevärt jämfört med grundmodellen Scribe v2 (86,2 % jämfört med 79,8 %). 

Omis riktmärke uppdateras med resultaten för Scribe v2 Medical den 25 september, och siffrorna ovan delas med deras tillstånd före den uppdateringen.

Kunder i produktion

Kunder använder redan Scribe v2 Medical i produktion och ser förbättringar för kliniskt ljud.

”Sedan vi bytte från Deepgram till ElevenLabs Scribe v2 Medical ser vi mycket högre träffsäkerhet för klinisk terminologi, och det har förändrat hur teamet arbetar”, säger Mendel Erlenwein, VD och grundare av CareCo. ”När våra samordnare litar på transkriptionerna kan de lägga mindre tid på att rätta anteckningar och mer tid på att prata med patienter i telefon. Våra patienter har komplicerade behandlingsregimer, och anteckningen som vårdteamet läser måste vara korrekt.”

Förbättringar som betyder mest

WER för en fullständig transkription kan ibland dölja det som betyder mest i en klinisk miljö, eftersom även kliniska samtal främst består av vanligt tal. Eka annoterar de medicinska termerna i varje prov, så det går att bedöma enbart dessa termer. För WER enbart för medicinska termer gör Scribe v2 Medical 14 % färre fel än grundmodellen (9,5 % jämfört med 11,1 %), och förbättringarna är störst när termerna förekommer i fullständiga meningar (7,5 % jämfört med 9,9 %).

Fine-tuning lowers medical term error rates overall and in clinical sentences, but not conversation.

En begränsning i samma data är att isolerade klipp med ett enda ord (ett ensamt läkemedelsnamn som sägs utan omgivande sammanhang) fortfarande är det svåraste fallet för alla modeller på topplistan, inklusive Scribe v2 Medical. Den fick 14,3 % WER för isolerade termer, jämfört med 7,5 % när termerna förekommer i meningar. Utan något sammanhang kan en felhörd stavelse leda till minnesvärda fel:

  • etodolac (ett NSAID) → "It'll do the luck"
  • levomilnacipran (ett antidepressivt läkemedel) → "Leave me alone now, Sephora."
  • methdilazine (ett antihistamin) → "Let's play our scene."

Ett sätt att minska dessa fel är med nyckeltermsstyrning, som låter dig lyfta fram läkemedelsnamn eller medicinska fraser för att öka modellens chans att transkribera dem korrekt.

Bortom huvudriktmärket

Träffsäkerheten hos v2 Medical håller i sig även utanför engelskan. 

Cortis MedDictate-riktmärke, ett offentligt dataset för klinisk diktering, minskar Scribe v2 Medical WER med ungefär 36 % jämfört med grundmodellen Scribe v2, och förbättringen gäller för alla tre språk:

Error rates are lower with Scribe v2 Medical than Scribe v2 across all languages.

Teamet bekräftade också att den medicinska finjusteringen inte försämrar prestandan på andra områden. På 6 000 prov av vardagligt, icke-medicinskt tal hämtat från CommonVoice får Scribe v2 Medical samma resultat som grundmodellen Scribe v2 vid avrundning: 5,3 % WER i båda fallen. Med v2 Medical får du alltså fördelarna med en specialiserad medicinsk modell — utan att ge upp träffsäkerhet på detta riktmärke.

Byggd för skyddad hälsoinformation

Scribe v2 Medical är HIPAA-kvalificerad för företagskunder med Business Associate Agreements (BAA) på plats och med Läge utan datalagring (ZRM) aktiverat.

När ZRM är aktiverat för förfrågningar till Speech to Text API raderas ljudindata och textutdata direkt när varje förfrågan har slutförts. ElevenLabs behåller inget av dem, och din applikation får hela API-svaret och styr hur transkriptioner lagras.

Kom i gång

Scribe v2 Medical finns tillgänglig på Speech to Text API. Skicka bara det nya modell-id:t: scribe_v2_medical

import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({ apiKey: "YOUR_API_KEY" });

const fileData = await fs.promises.readFile("clinical_audio.mp3");

const transcription = await elevenlabs.speechToText.convert({
  file: new Blob([fileData], { type: "audio/mp3" });,
  modelId: "scribe_v2_medical",
});

console.log(transcription.text);

Modellen körs på batch-slutpunkten för Speech to Text. 

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet