Przejdź do treści

Poznaj Scribe

Opublikowano

PosłuchajPosłuchaj tego artykułu

Scribe, nasz pierwszy model Speech to Text, to najdokładniejszy na świecie model transkrypcji. Stworzony z myślą o nieprzewidywalności dźwięku w rzeczywistych warunkach, Scribe transkrybuje mowę w 99 językach, oferując znaczniki czasu dla każdego słowa, diarizację mówców i oznaczanie zdarzeń audio — wszystko w ustrukturyzowanej odpowiedzi, gotowej do łatwej integracji.

Scribe stworzono z myślą o precyzji. W testach porównawczych FLEURS i Common Voice w 99 językach konsekwentnie przewyższa czołowe modele, takie jak Gemini 2.0 Flash, Whisper Large V3 i Deepgram Nova-3. Niezależnie od tego, czy chodzi o podsumowania spotkań, napisy do filmów, czy teksty piosenek, Scribe osiąga najniższy współczynnik błędów automatycznej transkrypcji słów w języku włoskim (98,7%), angielskim (96,7%) i 97 innych językach.

Scribe sprawia, że ASR jest dostępne dla każdego — znacznie ogranicza błędy w językach, które tradycyjnie były pomijane, takich jak serbski, kantoński i malajalam. W tych językach konkurencyjne modele często przekraczają współczynnik błędów słów na poziomie 40%.

The world's most accurate ASR model by IIElevenLabs.

Deweloperzy mogą już dziś zintegrować Scribe przez nasze Speech to Text API i otrzymywać ustrukturyzowane transkrypcje JSON z diaryzacją mówców oraz znacznikami czasu dla każdego słowa i zdarzeń pozamownych (np. śmiechu). Wkrótce udostępnimy też wersję o niskich opóźnieniach do aplikacji działających w czasie rzeczywistym.

Twórcy i firmy mogą korzystać ze Scribe bezpośrednio w panelu ElevenLabs — przesyłać pliki audio lub wideo i tworzyć sformatowane transkrypcje.

Zacznij tworzyć z Scribe:

Dokumentacja API | Wypróbuj w panelu ElevenLabs

Testy porównawcze

FLEURS - Współczynnik błędów słów % - 102 języki

Bar chart comparing word error rates for different languages and speech recognition models.

Common Voice - Współczynnik błędów słów % - 102 języki

Bar chart comparing word error rates for different voice recognition models across various countries.

Autorzy

Kierownictwo badań, trening, architektura

Flavio Schneider

Kierownictwo projektu, dane do wstępnego treningu, dane do dostrajania

Tim von Känel

Inferencja, optymalizacje

Maximiliano Levi

Współtwórcy badań

Johan Nordberg, Piotr Dabkowski

Frontend

Austin Malerba

Backend

Hristo Stoychev

Pozyskiwanie danych

Alex George

Podobne artykuły

Twórz z najwyższej jakości audio AI