Scribe v2 Medical jest już dostępny dla wszystkich
- Autor
- Min Kim
- Opublikowano
PosłuchajPosłuchaj tego artykułu
Audio kliniczne to jeden z najtrudniejszych testów dokładnego rozpoznawania mowy. Nazwy leków są długie, rzadkie i łatwo je pomylić (hydroksyzyna i hydralazyna różnią się jedną źle usłyszaną sylabą). Słownictwo jest gęste: dawki, jednostki, terminy z anatomii i patologii mogą padać w szybkim tempie. Stawka jest też wyższa, bo błąd w transkrypcji może wpłynąć na opiekę nad pacjentem.
Dlatego ElevenLabs udostępnia dziś Scribe v2 Medical, nasz model Speech to Text dostrojony do audio klinicznego, dostępny teraz dla wszystkich w ElevenAPI. W testach ElevenLabs osiąga najniższy współczynnik błędów słów (WER) w medycznych benchmarkach ASR i obniża WER dla audio klinicznego o 18% względem naszego podstawowego modelu Scribe v2.
Modele ogólnego przeznaczenia dobrze radzą sobie z codzienną mową, ale zawodzą tam, gdzie workflow kliniczne najbardziej ich potrzebują. Wytrenowaliśmy medyczną wersję Scribe v2, skupioną na nazwach leków i dyktowaniu klinicznym, na publicznych benchmarkach, które każdy może odtworzyć.
Scribe v2 Medical to oczywisty wybór do zastosowań klinicznych
Benchmark Eka Medical ASR
W testach wewnętrznych Scribe v2 Medical osiąga niższy WER niż każdy wynik opublikowany w benchmarku Eka Medical ASR. Zbiór ewaluacyjny zawiera 3619 angielskich próbek audio klinicznego — pojedyncze nazwy leków i schorzeń, zdania kliniczne oraz rozmowy lekarzy z pacjentami — z adnotacjami dla każdego terminu i opublikowanym rankingiem na stronie zbioru danych.

Benchmark Omi Health Medical Speech to Text
Wyniki potwierdzają się także poza jednym benchmarkiem. Omi Health prowadzi publiczny ranking 30 systemów zamiany mowy na tekst, ocenionych na 1513 angielskich nagraniach klinicznych (7,2 godziny z 57 konsultacji).
Omi oceniło Scribe v2 Medical bezpośrednio w tym benchmarku. Model uzyskał najniższy łączny WER spośród wszystkich 30 testowanych systemów (5,88%) i wyraźnie poprawia dokładność rozpoznawania dawek względem podstawowego Scribe v2 (86,2% vs. 79,8%).
Benchmark Omi zostanie zaktualizowany o wyniki Scribe v2 Medical 25 września. Powyższe dane publikujemy za zgodą Omi przed tą aktualizacją.
Klienci w produkcji
Klienci już korzystają z Scribe v2 Medical w produkcji i widzą poprawę w audio klinicznym.
„Od przejścia z Deepgram na ElevenLabs Scribe v2 Medical widzimy znacznie większą dokładność w terminologii klinicznej, co zmieniło sposób pracy zespołu” — mówi Mendel Erlenwein, CEO i założyciel CareCo. „Gdy nasi koordynatorzy ufają transkrypcjom, mogą poświęcać mniej czasu na poprawianie notatek, a więcej na rozmowy telefoniczne z pacjentami. Nasi pacjenci stosują złożone terapie, więc notatka czytana przez zespół opieki musi być poprawna.”
Ulepszenia, które mają największe znaczenie
WER dla całej transkrypcji może czasem ukrywać to, co najważniejsze w środowisku klinicznym, ponieważ nawet rozmowy kliniczne składają się głównie ze zwykłej mowy. Eka oznacza terminy medyczne w każdej próbce, więc można oceniać tylko te terminy. WER wyłącznie dla terminów medycznych jest w Scribe v2 Medical o 14% niższy niż w modelu podstawowym (9,5% vs. 11,1%), a największa poprawa dotyczy terminów występujących w pełnych zdaniach (7,5% vs. 9,9%).

Te same dane pokazują jednak, że odizolowane jednawyrazowe nagrania (pojedyncza nazwa leku wypowiedziana bez kontekstu) nadal są najtrudniejszym przypadkiem dla każdego modelu w rankingu, w tym Scribe v2 Medical. Model uzyskał 14,3% WER dla pojedynczych terminów, wobec 7,5%, gdy występują one w zdaniach. Bez żadnego kontekstu źle usłyszana sylaba może prowadzić do pamiętnych błędów:
- etodolak (NLPZ) → „It'll do the luck”
- lewomilnacipran (lek przeciwdepresyjny) → „Leave me alone now, Sephora.”
- metdylazyna (lek przeciwhistaminowy) → „Let's play our scene.”
Jednym ze sposobów na ograniczenie tych błędów jest podpowiadanie słów kluczowych, które pozwala wyróżnić nazwy leków lub frazy medyczne, aby zwiększyć szansę, że model poprawnie je przetranskrybuje.
Poza głównym benchmarkiem
Dokładność v2 Medical nie ogranicza się tylko do języka angielskiego.
W benchmarku Corti MedDictate, publicznym zbiorze danych z dyktowaniem klinicznym, Scribe v2 Medical obniża WER o około 36% względem podstawowego modelu Scribe v2, a poprawa utrzymuje się we wszystkich trzech językach:

Zespół sprawdził też, że medyczne dostrojenie nie pogarsza wyników w innych obszarach. W 6000 próbek codziennej, niemedycznej mowy pochodzących z CommonVoice, Scribe v2 Medical po zaokrągleniu osiąga taki sam wynik jak podstawowy Scribe v2: w obu przypadkach WER wynosi 5,3%. Dzięki v2 Medical zyskujesz więc korzyści ze specjalistycznego modelu medycznego — bez utraty dokładności w tym benchmarku.
Stworzony z myślą o chronionych informacjach zdrowotnych
Scribe v2 Medical kwalifikuje się do HIPAA dla klientów enterprise, którzy mają umowę Business Associate Agreement (BAA) oraz włączony Tryb zerowego przechowywania danych (ZRM).
Gdy ZRM jest włączony dla żądań Speech to Text API, wejściowe audio i tekst wyjściowy są usuwane natychmiast po zakończeniu każdego żądania. ElevenLabs nie przechowuje żadnych z nich, a twoja aplikacja otrzymuje pełną odpowiedź API i kontroluje sposób przechowywania transkrypcji.
Jak zacząć
Scribe v2 Medical jest dostępny w API Speech to Text. Wystarczy przekazać nowy identyfikator modelu: scribe_v2_medical
Model działa w batchowym endpoincie Speech to Text.



