Czym jest Speech to Text?
Speech to Text zamienia mowę w tekst. W ElevenLabs naszym modelem Speech to Text jest Scribe. Pozwala dokładnie transkrybować mowę w ponad 90 językach, dzięki czemu łatwo zmienisz audio w czytelny tekst z możliwością wyszukiwania.
Główne funkcje Scribe
- Wiodąca w branży dokładność — 98% w głównych językach, takich jak angielski, francuski, włoski, portugalski, hiszpański i niemiecki.
- Precyzyjne znaczniki czasu dla każdego słowa, dzięki którym dokładnie wiesz, kiedy dane słowo zostało wypowiedziane.
- Inteligentna diarizacja mówców, która automatycznie rozpoznaje i rozdziela różnych mówców.
- Dynamiczne tagowanie audio wykrywające dźwięki inne niż mowa.
- Obsługa do 32 mówców przy zachowaniu wysokiej dokładności.
Co nowego w Scribe v2
Scribe v2 rozwija podstawowy model o dodatkowe możliwości stworzone z myślą o bardziej wymagających zastosowaniach.
- Prompting słów kluczowych. Możesz podać do 100 słów lub fraz, aby pomóc modelowi poprawnie transkrybować ważne terminy. Użycie promptingu słów kluczowych zwiększa koszt o 20%.
- Wykrywanie encji. Możesz wybrać konkretne kategorie informacji do wykrycia w transkrypcji, na przykład numery kart kredytowych, imiona i nazwiska lub schorzenia. Wykrywanie encji jest dostępne tylko przez API i zwiększa koszt o 30%.
- Inteligentna obsługa wielu języków. Możesz przesłać audio zawierające wiele języków, a Scribe v2 automatycznie wykryje i poprawnie transkrybuje każdy z nich.
- Lepsza stabilność. Scribe v2 radzi sobie z przerwami, zmianami tonu i długimi okresami ciszy
bez utraty działania ani dokładności.
Której wersji użyć?
Gdy potrzebujesz bardzo dokładnej transkrypcji, polecamy Scribe v2. Jest dostępny na naszej stronie i przez API. Na stronie Speech to Text Scribe v2 jest modelem domyślnym.
Do audio medycznego i klinicznego użyj Scribe v2 Medical (scribe_v2_medical) przez to samo API. Jego cena jest taka sama jak Scribe v2.
Do zastosowań w czasie rzeczywistym polecamy Scribe v2 Realtime, dostępny przez ElevenAgents i API.
Więcej informacji znajdziesz w naszej dokumentacji Speech to Text.