Transkrypcja
Dowiedz się, jak zamieniać nagrania mowy na tekst z ElevenLabs.
Omówienie
Interfejs Speech to Text (STT) API od ElevenLabs zamienia mowę na tekst z najnowocześniejszą dokładnością. Nasz model Scribe v2 dostosowuje się do wskazówek tekstowych w ponad 90 językach i do różnych stylów mowy. Aby wypróbować demo na żywo, odwiedź stronę prezentującą Speech to Text.
Firmy wymagające zgodności z HIPAA muszą skontaktować się z działem sprzedaży ElevenLabs Sales, aby podpisać umowę Business Associate Agreement (BAA). Upewnij się, że ten krok został wykonany przed wdrożeniem lub integracją związaną z HIPAA.
Modele
Przykładowa odpowiedź API
Poniższy przykład pokazuje wynik API Speech to Text dla przykładowego pliku audio z użyciem modelu Scribe v2.
Zobacz pełną odpowiedź JSON
Dane wyjściowe są klasyfikowane w trzech kategoriach:
word– słowo w języku audiospacing– odstęp między słowami; nie dotyczy języków bez spacji, takich jak japoński, mandaryński, tajski, laotański, birmański i kantońskiaudio_event– dźwięki inne niż mowa, np. śmiech lub oklaski
Współbieżność i priorytet
Współbieżność oznacza liczbę żądań, które mogą być przetwarzane jednocześnie.
W Speech to Text pliki dłuższe niż 8 minut są wewnętrznie transkrybowane równolegle, aby przyspieszyć przetwarzanie. Audio jest dzielone na cztery segmenty transkrybowane jednocześnie.
Limit współbieżności możesz obliczyć tak:
Na przykład plik audio o długości 15 minut zostanie transkrybowany ze współbieżnością 2, a plik o długości 120 minut – ze współbieżnością 4.
Powyższe obliczenie dotyczy tylko Scribe v2 i Scribe v2 Medical. W przypadku Scribe v2 Realtime zobacz wykres limitów współbieżności.
Zaawansowane funkcje
Podpowiedzi keyterm i edycja transkrypcji wiążą się z dodatkową opłatą. Szczegółowe informacje o cenach znajdziesz na stronie cennika API.
Podpowiedzi keyterm
Podpowiedzi keyterm są dostępne w Scribe v2, Scribe v2 Medical (batch) i Scribe v2 Realtime.
Wyróżnij słowa lub frazy, aby zwiększyć prawdopodobieństwo ich transkrypcji przez model. Przydaje się to do transkrypcji rzadko występujących w audio konkretnych słów lub zdań, np. nazw produktów, imion i nazwisk czy innych określonych terminów. Keyterms są skuteczniejsze niż słowa kluczowe z preferencją lub własne słowniki oferowane przez inne modele, ponieważ wykorzystują kontekst, by zdecydować, czy transkrybować dany termin. Tryb batch obsługuje do 1000 keyterms (po 50 znaków), a realtime – do 50 keyterms (po 20 znaków).
Aby dowiedzieć się więcej o podpowiedziach keyterm, zobacz dokumentację podpowiedzi keyterm.
Tryb bez dosłownej transkrypcji
Tryb bez dosłownej transkrypcji jest dostępny w Scribe v2, Scribe v2 Medical (batch) i Scribe v2 Realtime.
Gdy no_verbatim jest włączone, model usuwa z transkrypcji wypełniacze, fałszywe początki i niepłynności mowy. Zapewnia to czystszy wynik, odpowiedni dla napisów, podsumowań i zastosowań, w których czytelność jest ważniejsza niż zapisanie każdego wypowiedzianego słowa.
Wykrywanie encji
Modele batch i Scribe v2 Realtime mogą wykrywać w transkrypcji kilka kategorii encji oraz podawać ich dokładne znaczniki czasu. Przydaje się to do wyróżniania numerów kart kredytowych, imion i nazwisk, schorzeń lub numerów SSN.
Pełną listę obsługiwanych encji znajdziesz w dokumentacji wykrywania encji.
Edycja transkrypcji
Edycja transkrypcji to eksperymentalna funkcja dostępna we wszystkich modelach batch i Scribe v2 Realtime.
Przekaż instrukcję w języku naturalnym za pomocą parametru transcript_edit, a zostanie zastosowana do gotowej transkrypcji. Edytowany tekst jest zwracany w edited_transcript obok oryginalnej transkrypcji, więc znaczniki czasu i etykiety mówców pozostają bez zmian. Przydaje się to do ujednolicania zapisu dat, godzin lub jednostek, stosowania innego stylu albo przeredagowania transkrypcji w jednym żądaniu.
Więcej informacji znajdziesz w dokumentacji edycji transkrypcji oraz przewodniku edycji transkrypcji w czasie rzeczywistym.
Obsługiwane języki
Scribe v2 obsługuje ponad 90 języków, w tym:
Afrykanerski (afr), amharski (amh), arabski (ara), armeński (hye), asamski (asm), asturyjski (ast), azerski (aze), białoruski (bel), bengalski (ben), bośniacki (bos), bułgarski (bul), birmański (mya), kantoński (yue), kataloński (cat), cebuański (ceb), cziczewa (nya), chorwacki (hrv), czeski (ces), duński (dan), niderlandzki (nld), angielski (eng), estoński (est), filipiński (fil), fiński (fin), francuski (fra), fulani (ful), galicyjski (glg), ganda (lug), gruziński (kat), niemiecki (deu), grecki (ell), gudżaracki (guj), hausa (hau), hebrajski (heb), hindi (hin), węgierski (hun), islandzki (isl), igbo (ibo), indonezyjski (ind), irlandzki (gle), włoski (ita), japoński (jpn), jawajski (jav), kriolu kabowerdeńskie (kea), kannada (kan), kazachski (kaz), khmerski (khm), koreański (kor), kurdyjski (kur), kirgiski (kir), laotański (lao), łotewski (lav), lingala (lin), litewski (lit), luo (luo), luksemburski (ltz), macedoński (mkd), malajski (msa), malajalam (mal), maltański (mlt), mandaryński chiński (zho), maoryski (mri), marathi (mar), mongolski (mon), nepalski (nep), sotho północny (nso), norweski (nor), oksytański (oci), odia (ori), paszto (pus), perski (fas), polski (pol), portugalski (por), pendżabski (pan), rumuński (ron), rosyjski (rus), serbski (srp), shona (sna), sindhi (snd), syngaleski (sin), słowacki (slk), słoweński (slv), somalijski (som), hiszpański (spa), suahili (swa), szwedzki (swe), tamilski (tam), tadżycki (tgk), telugu (tel), tajski (tha), turecki (tur), ukraiński (ukr), umbundu (umb), urdu (urd), uzbecki (uzb), wietnamski (vie), walijski (cym), wolof (wol), xhosa (xho) i zulu (zul).
Szczegóły obsługi języków
Współczynnik błędów słów (WER) to kluczowa miara oceny dokładności systemów transkrypcji. Mierzy liczbę błędów w transkrypcji w porównaniu z transkrypcją referencyjną. Poniżej znajdziesz WER dla każdego języka obsługiwanego przez Scribe v2.
Doskonale (≤ 5% WER)
białoruski (bel), bośniacki (bos), bułgarski (bul), kataloński (cat), chorwacki (hrv), czeski (ces), duński (dan), niderlandzki (nld), angielski (eng), estoński (est), fiński (fin), francuski (fra), galicyjski (glg), niemiecki (deu), grecki (ell), węgierski (hun), islandzki (isl), indonezyjski (ind), włoski (ita), japoński (jpn), kannada (kan), łotewski (lav), macedoński (mkd), malajski (msa), malajalam (mal), norweski (nor), polski (pol), portugalski (por), rumuński (ron), rosyjski (rus), słowacki (slk), hiszpański (spa), szwedzki (swe), turecki (tur), ukraiński (ukr) i wietnamski (vie).
Wysoka dokładność (>5% do ≤10% WER)
ormiański (hye), azerski (aze), bengalski (ben), kantoński (yue), filipiński (fil), gruziński (kat), gudżarati (guj), hindi (hin), kazachski (kaz), litewski (lit), maltański (mlt), mandaryński (cmn), marathi (mar), nepalski (nep), orija (ori), perski (fas), serbski (srp), słoweński (slv), suahili (swa), tamilski (tam) i telugu (tel)
Dobrze (>10% do ≤20% WER)
afrikaans (afr), arabski (ara), asamski (asm), asturyjski (ast), birmański (mya), hausa (hau), hebrajski (heb), jawajski (jav), koreański (kor), kirgiski (kir), luksemburski (ltz), maoryski (mri), oksytański (oci), pendżabski (pan), tadżycki (tgk), tajski (tha), uzbecki (uzb) i walijski (cym).
Umiarkowanie (>25% do ≤50% WER)
amharski (amh), ganda (lug), igbo (ibo), irlandzki (gle), khmerski (khm), kurdyjski (kur), laotański (lao), mongolski (mon), sotho północny (nso), paszto (pus), shona (sna), sindhi (snd), syngaleski (sin), somalijski (som), urdu (urd), wolof (wol), xhosa (xho), joruba (yor) i zulu (zul).
FAQ
Czy mogę używać API zamiany mowy na tekst z plikami wideo?
Tak, API obsługuje przesyłanie plików audio i wideo do transkrypcji.
Jakie są limity rozmiaru pliku i czasu trwania w API Speech to Text?
Obsługiwane są pliki do 3 GB. Limity czasu trwania zależą od trybu transkrypcji:
- Tryb standardowy (
use_multi_channel=false): do 10 godzin - Tryb wielokanałowy (
use_multi_channel=true): łączny czas trwania wszystkich kanałów musi być krótszy niż 10 godzin
Jakie formaty audio i wideo obsługuje API?
API obsługuje następujące formaty audio i wideo:
- audio/aac
- audio/x-aac
- audio/x-aiff
- audio/ogg
- audio/mpeg
- audio/mp3
- audio/mpeg3
- audio/x-mpeg-3
- audio/opus
- audio/wav
- audio/x-wav
- audio/webm
- audio/flac
- audio/x-flac
- audio/mp4
- audio/aiff
- audio/x-m4a
Obsługiwane formaty wideo obejmują:
- video/mp4
- video/x-msvideo
- video/x-matroska
- video/quicktime
- video/x-ms-wmv
- video/x-flv
- video/webm
- video/mpeg
- video/3gpp
Kiedy będziecie obsługiwać więcej języków?
ElevenLabs stale rozszerza liczbę języków obsługiwanych przez nasze modele. Zaglądaj tu często, aby sprawdzać aktualizacje.
Czy API zamiany mowy na tekst obsługuje webhooki?
Tak, asynchroniczne wyniki transkrypcji można wysyłać do webhooków skonfigurowanych w ustawieniach webhooków w interfejsie. Więcej informacji znajdziesz w przewodniku po webhookach.
Czy API obsługuje tryb transkrypcji wielokanałowej?
Tak, funkcja wielokanałowego STT pozwala transkrybować audio, w którym każdy kanał jest przetwarzany niezależnie i otrzymuje identyfikator mówcy na podstawie numeru kanału. Funkcja obsługuje do 5 kanałów. Więcej informacji znajdziesz w przewodniku po transkrypcji wielokanałowej.
Jak działa rozliczanie za API zamiany mowy na tekst?
ElevenLabs nalicza opłaty za zamianę mowy na tekst na podstawie czasu trwania audio przesłanego do transkrypcji. Rozliczenie jest obliczane za godzinę audio, a stawki zależą od planu i modelu. Szczegółowe informacje znajdziesz na stronie cennika API.
Kluczowe informacje
- Obsługiwane dane wejściowe: akceptowane są pliki audio i wideo
- Maksymalny rozmiar pliku: 3 GB
- Maksymalny czas trwania: 10 godzin (tryb standardowy), 1 godzina (tryb wielokanałowy)
- Tryb wielokanałowy: do 5 kanałów; każdy przetwarzany niezależnie z identyfikatorem mówcy przypisanym według numeru kanału
- Webhooki: asynchroniczne wyniki transkrypcji mogą być dostarczane do webhooka — skonfiguruj go w ustawieniach obszaru roboczego
- Obsługiwane formaty audio: AAC, AIFF, OGG, MP3, OPUS, WAV, FLAC, M4A, WebM
- Obsługiwane formaty wideo: MP4, AVI, MKV, MOV, WMV, FLV, WebM, MPEG, 3GPP