Aller au contenu

Découvrez Scribe

Publié

ÉcouterÉcouter cet article

Scribe, notre premier modèle Speech to Text, offre une transcription d'une grande précision. Conçu pour gérer l'imprévisibilité des enregistrements réels, Scribe transcrit la parole dans 99 langues, avec horodatage au mot près, diarisation des locuteurs et balisage des événements audio, le tout dans une réponse structurée pour une intégration fluide.

Scribe est conçu pour la précision. Lors des tests de référence FLEURS et Common Voice couvrant 99 langues, il surpasse systématiquement d'autres modèles de référence. Pour les résumés de réunions, les sous-titres de films ou les paroles de chansons, Scribe affiche le plus faible taux d'erreur de transcription automatisée en italien (98,7 %), en anglais (96,7 %) et dans 97 autres langues.

Scribe rend la reconnaissance automatique de la parole accessible à tous et réduit considérablement les erreurs dans des langues traditionnellement peu prises en charge, comme le serbe, le cantonais et le malayalam, où d'autres modèles dépassent souvent 40 % de taux d'erreur par mot.

The world's most accurate ASR model by IIElevenLabs.

Les développeurs peuvent intégrer Scribe dès aujourd'hui via notre API Speech to Text pour obtenir des transcriptions JSON structurées avec diarisation des locuteurs et horodatage au mot près, ainsi que des marqueurs d'événements non vocaux, comme les rires. Une version à faible latence pour les applications en temps réel sera bientôt disponible.

Les créateurs et les entreprises peuvent utiliser Scribe directement depuis le Dashboard ElevenLabs pour importer des fichiers audio ou vidéo et générer des transcriptions mises en forme.

Commencez à développer avec Scribe :

Documentation de l'API | Essayer dans le Dashboard ElevenLabs

Tests de référence

FLEURS - Taux d'erreur par mot % - 102 langues

Bar chart comparing word error rates for different languages and speech recognition models.

Common Voice - Taux d'erreur par mot % - 102 langues

Bar chart comparing word error rates for different voice recognition models across various countries.

Contributions

Responsable de la recherche, entraînement, architecture

Flavio Schneider

Responsable du projet, données de pré-entraînement, données de fine-tuning

Tim von Känel

Inférence, optimisations

Maximiliano Levi

Contributeurs à la recherche

Johan Nordberg, Piotr Dabkowski

Interface utilisateur

Austin Malerba

Infrastructure serveur

Hristo Stoychev

Acquisition de données

Alex George

Articles similaires

Créez avec l'audio IA de la plus haute qualité