Aller au contenu

Scribe v2 Medical est désormais accessible à tous

Rédigé par
Min Kim
Publié

ÉcouterÉcouter cet article

L’audio clinique constitue l’un des tests les plus exigeants pour la précision de la reconnaissance vocale. Les noms de médicaments sont longs, rares et faciles à confondre (hydroxyzine et hydralazine ne diffèrent que d’une syllabe mal entendue). Le vocabulaire est dense, avec des posologies, des unités et des termes d’anatomie et de pathologie qui peuvent se succéder rapidement. Les enjeux sont également plus importants, car une erreur de transcription peut avoir des répercussions sur la prise en charge d’un patient.

C’est pourquoi ElevenLabs lance aujourd’hui Scribe v2 Medical, notre modèle Speech to Text affiné pour l’audio clinique, désormais disponible pour tous sur l’API ElevenLabs. Lors des tests d’ElevenLabs, il obtient le taux d’erreur sur les mots (WER) le plus faible sur les benchmarks ASR médicaux et réduit le WER sur l’audio clinique de 18 % par rapport à notre modèle Scribe v2 de base.

Les modèles généralistes traitent efficacement la parole courante, mais leurs performances diminuent là où les flux de travail cliniques en ont le plus besoin. Nous avons affiné Scribe v2 pour le domaine médical, en ciblant les noms de médicaments et la dictée clinique, sur des benchmarks publics que chacun peut reproduire.

Scribe v2 Medical, le choix évident pour les cas d’usage cliniques 

Benchmark Eka Medical ASR

Lors de tests internes, Scribe v2 Medical obtient, dans les évaluations d’ElevenLabs, un WER inférieur à tous les résultats publiés sur le benchmark Eka Medical ASR. Le jeu de données d’évaluation contient 3 619 échantillons audio cliniques en anglais — noms isolés de médicaments et d’affections, phrases cliniques et conversations entre cliniciens et patients — avec des annotations pour chaque terme et un classement publié sur la fiche du jeu de données. 

Eka

Benchmark Omi Health Medical Speech to Text

Les performances se vérifient au-delà d’un seul benchmark. Omi Health publie un classement de 30 systèmes de reconnaissance vocale, évalués sur 1 513 extraits cliniques en anglais (7,2 heures réparties sur 57 consultations).

Omi a évalué Scribe v2 Medical directement sur ce benchmark. Il enregistre le WER global le plus faible parmi les 30 systèmes testés (5,88 %) et améliore sensiblement la précision des posologies par rapport à Scribe v2 de base (86,2 % contre 79,8 %). 

Le benchmark d’Omi sera mis à jour avec les résultats de Scribe v2 Medical le 25 septembre. Les chiffres ci-dessus sont publiés avec leur autorisation avant cette mise à jour.

Des clients déjà en production

Des clients utilisent déjà Scribe v2 Medical en production et constatent des améliorations sur l’audio clinique.

« Depuis que nous avons adopté ElevenLabs Scribe v2 Medical à la place d’autres solutions vocales, nous constatons une précision bien supérieure sur la terminologie clinique, ce qui a transformé la façon dont l’équipe travaille », explique Mendel Erlenwein, PDG et fondateur de CareCo. « Lorsque nos coordinateurs font confiance aux transcriptions, ils passent moins de temps à corriger les notes et davantage de temps au téléphone avec les patients. Nos patients suivent des traitements complexes, et la note lue par l’équipe soignante doit être exacte. »

Les améliorations les plus importantes

Le WER d’une transcription complète peut parfois masquer l’essentiel en contexte clinique, car même les conversations cliniques se composent principalement de parole courante. Eka annote les termes médicaux de chaque échantillon, ce qui permet d’évaluer ces termes seuls. Pour le WER limité aux termes médicaux, Scribe v2 Medical commet 14 % d’erreurs de moins que le modèle de base (9,5 % contre 11,1 %), avec les gains les plus importants lorsque les termes apparaissent dans des phrases complètes (7,5 % contre 9,9 %).

Fine-tuning lowers medical term error rates overall and in clinical sentences, but not conversation.

Les mêmes données révèlent toutefois que les extraits isolés d’un seul mot — un nom de médicament prononcé sans aucun contexte — restent le cas le plus difficile pour tous les modèles du classement, y compris Scribe v2 Medical. Il obtient un WER de 14,3 % sur les termes isolés, contre 7,5 % lorsque ces termes apparaissent dans des phrases. Sans contexte, une syllabe mal entendue peut entraîner des erreurs mémorables :

  • etodolac (un AINS) → « It'll do the luck »
  • levomilnacipran (un antidépresseur) → « Leave me alone now, Sephora. »
  • methdilazine (un antihistaminique) → « Let's play our scene. »

Pour réduire ces erreurs, vous pouvez recourir au invitation par mots-clés, qui permet de mettre en évidence des noms de médicaments ou des expressions médicales afin d’orienter le modèle vers leur transcription correcte.

Au-delà du benchmark principal

La précision de v2 Medical se confirme au-delà de l’anglais. 

Sur le benchmark MedDictate de Corti, un jeu de données public de dictée clinique, Scribe v2 Medical réduit le WER d’environ 36 % par rapport au modèle Scribe v2 de base, et cette amélioration se vérifie dans les trois langues :

Error rates are lower with Scribe v2 Medical than Scribe v2 across all languages.

L’équipe a également vérifié que l’affinage médical ne dégrade pas les performances dans d’autres domaines. Sur 6 000 échantillons de parole courante non médicale issus de CommonVoice, Scribe v2 Medical obtient, après arrondi, le même score que Scribe v2 de base : un WER de 5,3 % dans les deux cas. Avec v2 Medical, vous bénéficiez donc d’un modèle médical spécialisé sans compromettre la précision sur ce benchmark.

Conçu pour les informations de santé protégées

Scribe v2 Medical est éligible à la conformité HIPAA pour les clients Enterprise disposant d’un Business Associate Agreement (BAA) et du mode Mode sans conservation des données (ZRM) activé.

Lorsque le ZRM est activé pour les requêtes de l’API Speech to Text, l’entrée audio et la sortie texte sont supprimées dès la fin de chaque requête. ElevenLabs ne conserve ni l’une ni l’autre, et votre application reçoit la réponse complète de l’API et contrôle la conservation des transcriptions.

Premiers pas

Scribe v2 Medical est disponible sur l’API Speech to Text. Il vous suffit de transmettre le nouvel identifiant de modèle : scribe_v2_medical

import { ElevenLabsClient } from "@elevenlabs/elevenlabs-js";

const elevenlabs = new ElevenLabsClient({ apiKey: "YOUR_API_KEY" });

const fileData = await fs.promises.readFile("clinical_audio.mp3");

const transcription = await elevenlabs.speechToText.convert({
  file: new Blob([fileData], { type: "audio/mp3" });,
  modelId: "scribe_v2_medical",
});

console.log(transcription.text);

Le modèle fonctionne sur l’endpoint Speech to Text par lots. 

Articles similaires

Créez avec l'audio IA de la plus haute qualité