Mowa na tekst

Przewodnik po transkrypcji audio z ElevenLabs
Funkcja produktu Text to Speech

Omówienie

Dzięki zamianie mowy na tekst możesz transkrybować nagrane wypowiedzi na tekst z najwyższą dokładnością. Automatyczne wykrywanie języka pozwala transkrybować audio w wielu językach.

Tworzenie transkrypcji

1

Prześlij audio

W panelu ElevenLabs przejdź do strony Mowa na tekst i kliknij przycisk „Transcribe files”. W oknie możesz przesłać plik audio lub wideo do transkrypcji.

Przesyłanie pliku Mowa na tekst

2

Wybierz opcje

  • Wybierz główny język audio, jeśli go znasz. Możesz zostawić opcję „Detect” — języki obecne w nagraniu zostaną wykryte automatycznie.

  • Zdecyduj, czy chcesz oznaczać zdarzenia audio, takie jak śmiech lub oklaski, przełącznikiem „Tag audio events”.

  • Promptowanie słowami kluczowymi pozwala dodać do 1000 słów lub fraz, aby model częściej wybierał je w transkrypcji. Przydaje się to przy konkretnych słowach lub zdaniach rzadko występujących w audio, takich jak nazwy produktów, imiona czy inne specyficzne terminy.

Gdy wszystko jest gotowe, kliknij „Upload files”, aby przesłać pliki.

3

Zobacz wyniki

Kliknij nazwę przesłanego pliku audio w środkowym panelu, aby zobaczyć wyniki. Możesz kliknąć słowo, aby odtworzyć audio od tego momentu.

Kliknij przycisk „Export” w prawym górnym rogu, aby pobrać wyniki w różnych formatach.

Edytor transkrypcji

Po utworzeniu transkrypcji możesz ją edytować w naszym Edytorze transkrypcji. Dowiedz się więcej w tym przewodniku.

FAQ

Tak, narzędzie obsługuje przesyłanie plików audio i wideo. Maksymalny rozmiar obu typów plików to 3 GB.

Zmiana nazw mówców

Tak, możesz zmienić nazwę mówcy, klikając przycisk „edit” obok etykiety „Speakers”.

Speech to Text zamienia mowę w tekst. W ElevenLabs naszym modelem Speech to Text jest Scribe. Pozwala dokładnie transkrybować mowę w ponad 90 językach, dzięki czemu łatwo zmienisz audio w czytelny tekst z możliwością wyszukiwania.

Główne funkcje Scribe

  • Wiodąca w branży dokładność — 98% w głównych językach, takich jak angielski, francuski, włoski, portugalski, hiszpański i niemiecki.
  • Precyzyjne znaczniki czasu dla każdego słowa, dzięki którym dokładnie wiesz, kiedy dane słowo zostało wypowiedziane.
  • Inteligentna diarizacja mówców, która automatycznie rozpoznaje i rozdziela różnych mówców.
  • Dynamiczne tagowanie audio wykrywające dźwięki inne niż mowa.
  • Obsługa do 32 mówców przy zachowaniu wysokiej dokładności.

Co nowego w Scribe v2

Scribe v2 rozwija podstawowy model o dodatkowe możliwości stworzone z myślą o bardziej wymagających zastosowaniach.

  • Prompting słów kluczowych. Możesz podać do 100 słów lub fraz, aby pomóc modelowi poprawnie transkrybować ważne terminy. Użycie promptingu słów kluczowych zwiększa koszt o 20%.
  • Wykrywanie encji. Możesz wybrać konkretne kategorie informacji do wykrycia w transkrypcji, na przykład numery kart kredytowych, imiona i nazwiska lub schorzenia. Wykrywanie encji jest dostępne tylko przez API i zwiększa koszt o 30%.
  • Inteligentna obsługa wielu języków. Możesz przesłać audio zawierające wiele języków, a Scribe v2 automatycznie wykryje i poprawnie transkrybuje każdy z nich.
  • Lepsza stabilność. Scribe v2 radzi sobie z przerwami, zmianami tonu i długimi okresami ciszy bez utraty działania ani dokładności.

Której wersji użyć?

Gdy potrzebujesz bardzo dokładnej transkrypcji, polecamy Scribe v2. Jest dostępny na naszej stronie i przez API. Na stronie Speech to Text Scribe v2 jest modelem domyślnym.

Do audio medycznego i klinicznego użyj Scribe v2 Medical (scribe_v2_medical) przez to samo API. Jego cena jest taka sama jak Scribe v2.

Do zastosowań w czasie rzeczywistym polecamy Scribe v2 Realtime, dostępny przez ElevenAgents i API.

Więcej informacji znajdziesz w naszej dokumentacji Speech to Text.

Speech to Text obsługuje ponad 90 języków.

Pełną listę obsługiwanych języków znajdziesz w sekcji obsługi języków naszej dokumentacji Speech to Text.

Limit współbieżności (liczba równoległych zapytań) zależy od subskrypcji oraz od tego, czy korzystasz z Speech to Text, czy Realtime Speech to Text.

Poniżej znajdziesz aktualne limity współbieżności dla Speech to Text.

PlanLimit współbieżności Speech to TextLimit współbieżności Realtime Speech to Text
Free86
Starter129
Creator2015
Pro4030
Scale6045
Business6045
EnterpriseZwiększonyZwiększony

Jeśli potrzebujesz większej liczby równoległych zapytań, skontaktuj się bezpośrednio z naszym działem Enterprise przez tę stronę. Chętnie omówimy plan dopasowany do twoich potrzeb.

No results