Czym jest Speech to Text?

Speech to Text zamienia mowę w tekst. W ElevenLabs naszym modelem Speech to Text jest Scribe. Pozwala dokładnie transkrybować mowę w ponad 90 językach, dzięki czemu łatwo zmienisz audio w czytelny tekst z możliwością wyszukiwania.

Główne funkcje Scribe

  • Wiodąca w branży dokładność — 98% w głównych językach, takich jak angielski, francuski, włoski, portugalski, hiszpański i niemiecki.
  • Precyzyjne znaczniki czasu dla każdego słowa, dzięki którym dokładnie wiesz, kiedy dane słowo zostało wypowiedziane.
  • Inteligentna diarizacja mówców, która automatycznie rozpoznaje i rozdziela różnych mówców.
  • Dynamiczne tagowanie audio wykrywające dźwięki inne niż mowa.
  • Obsługa do 32 mówców przy zachowaniu wysokiej dokładności.

Co nowego w Scribe v2

Scribe v2 rozwija podstawowy model o dodatkowe możliwości stworzone z myślą o bardziej wymagających zastosowaniach.

  • Prompting słów kluczowych. Możesz podać do 100 słów lub fraz, aby pomóc modelowi poprawnie transkrybować ważne terminy. Użycie promptingu słów kluczowych zwiększa koszt o 20%.
  • Wykrywanie encji. Możesz wybrać konkretne kategorie informacji do wykrycia w transkrypcji, na przykład numery kart kredytowych, imiona i nazwiska lub schorzenia. Wykrywanie encji jest dostępne tylko przez API i zwiększa koszt o 30%.
  • Inteligentna obsługa wielu języków. Możesz przesłać audio zawierające wiele języków, a Scribe v2 automatycznie wykryje i poprawnie transkrybuje każdy z nich.
  • Lepsza stabilność. Scribe v2 radzi sobie z przerwami, zmianami tonu i długimi okresami ciszy bez utraty działania ani dokładności.

Której wersji użyć?

Gdy potrzebujesz bardzo dokładnej transkrypcji, polecamy Scribe v2. Jest dostępny na naszej stronie i przez API. Na stronie Speech to Text Scribe v2 jest modelem domyślnym.

Do audio medycznego i klinicznego użyj Scribe v2 Medical (scribe_v2_medical) przez to samo API. Jego cena jest taka sama jak Scribe v2.

Do zastosowań w czasie rzeczywistym polecamy Scribe v2 Realtime, dostępny przez ElevenAgents i API.

Więcej informacji znajdziesz w naszej dokumentacji Speech to Text.