Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

Jak działa transkrypcja audio ze znacznikami czasu i tagami zdarzeń?

Opublikowano

PosłuchajPosłuchaj tego artykułu

Natywny model transkrypcji na poziomie słów przyjmuje nagranie audio lub strumień w czasie rzeczywistym i zwraca uporządkowaną tablicę obiektów tokenów z tagami i znacznikami czasu, reprezentujących mowę i dźwięki inne niż mowa. Każdy token należy do jednego z trzech typów: word, spacing lub audio_event. Zdarzeniami audio mogą być śmiech, oklaski lub inne dźwięki w tle.

W tym artykule wyjaśniamy, jak działa transkrypcja audio ze znacznikami czasu i dlaczego jest bardziej elastyczna i skuteczniejsza niż tradycyjna transkrypcja oparta na wymuszonym dopasowaniu.

Podsumowanie

  • Transkrypcja na poziomie słów bezpośrednio zwraca uporządkowane tablice danych mowy i niewerbalnych zdarzeń audio ze znacznikami czasu.
  • To różni ją od standardowych modeli automatycznego rozpoznawania mowy, które zwracają całe bloki tekstu. Aby dodać do nich znaczniki czasu z surowego audio, musisz wykonać drugi proces wymuszonego dopasowania, co trwa dłużej i zwiększa zapotrzebowanie na moc obliczeniową.
  • Tagi zdarzeń pomagają uchwycić treści niewerbalne, takie jak śmiech czy oklaski. Ponieważ dane te można przeszukiwać, pomogą ci znaleźć najciekawsze lub viralowe momenty na podstawie reakcji odbiorców.
  • Uporządkowane dane wyjściowe możesz przekazywać do aplikacji w wielu zastosowaniach, takich jak bardzo dokładne napisy, przeszukiwalne archiwa audio czy automatyczne tworzenie klipów do mediów społecznościowych.
  • Transkrypcja Scribe na poziomie słów obsługuje do 5 kanałów, z których każdy jest transkrybowany niezależnie.

Czym jest transkrypcja audio ze znacznikami czasu i tagami zdarzeń?

Transkrypcja ze znacznikami czasu to forma automatycznego rozpoznawania mowy (ASR), która podczas transkrypcji śledzi dokładne momenty rozpoczęcia i zakończenia słów oraz innych zdarzeń audio, takich jak oklaski. Jej wynik to w pełni uporządkowane dane, po których można swobodnie się poruszać.

Tradycyjna transkrypcja ASR przetwarza audio na duże bloki tekstu czytelnego dla człowieka. Daje napisy i transkrypcję dla odbiorców, ale jako dane nie jest zbyt przydatna.

Jeśli chcesz uporządkować ją za pomocą znaczników czasu, musisz ponownie przesłać ją do dodatkowej usługi uczenia maszynowego, która dopasuje tekst do audio. Możesz ostatecznie uzyskać podobny wynik, ale wymaga to wielu etapów przetwarzania zamiast natywnego wyniku z API, więc zwiększa opóźnienia i zapotrzebowanie na moc obliczeniową.

Nawigacja po audio

Kluczową zaletą transkrypcji ze znacznikami czasu i tagami zdarzeń jest to, że jest czytelna zarówno dla ludzi, jak i maszyn. Ma to kilka ważnych zastosowań biznesowych:

  • Audyt zgodności: Możesz przeszukać transkrypcję pod kątem słów kluczowych i uzyskać dokładne znaczniki czasu dla każdej wzmianki o danych wrażliwych.
  • Produkcja i montaż wideo: Oprogramowanie do produkcji wideo może synchronizować napisy z wypowiedziami na ekranie z dokładnością do milisekundy. Może też odpowiednio oznaczać reakcje odbiorców.
  • Przeszukiwalne archiwa: Zespoły PR, sprzedaży i szkoleń mogą transkrybować duże ilości wywiadów z klientami, przemówień na targach, webinarów czy spotkań otwartych na ogromne, przeszukiwalne archiwa.
  • Analityka marketingowa i nastroje klientów: Tagi zdarzeń mogą oznaczać reakcje odbiorców, które mogą zniknąć w podstawowej transkrypcji tekstowej.

Jakie są zalety natywnych znaczników czasu na poziomie słów?

Standardowe modele zamiany mowy na tekst przetwarzają mowę partiami, zwykle całymi zdaniami lub akapitami. Jeśli potrzebujesz znaczników czasu dla każdego słowa, musisz zaprojektować dodatkową warstwę przetwarzania, która w drugim przebiegu wykona tak zwane wymuszone dopasowanie. To zwiększa wymagania infrastrukturalne i opóźnienia, a także liczbę potencjalnych punktów awarii. Na przykład znaczniki mogą się rozjechać lub całkowicie zawieść przy szybkiej mowie albo mowie zagłuszanej przez głośny hałas w tle.

Transkrypcja ze znacznikami czasu, taka jak oferowana przez Scribe, omija ten problem, transkrybując na bardziej szczegółowym poziomie — słowo po słowie. Robi to w jednym wywołaniu API. Nie wymaga dodatkowej infrastruktury ani skryptów. Model oblicza znaczniki czasu podczas transkrypcji, więc dane mowy zawsze dokładnie odzwierciedlają audio.

Audio transcription with timestamps guide. Native transcription provides word timestamps in one API call, avoiding forced-alignment drift.

Jak działa transkrypcja ze znacznikami czasu i tagami zdarzeń?

Weźmy jako przykład Scribe.

Natywny model transkrypcji na poziomie słów mapuje dźwięki mowy w strumieniu audio na uporządkowaną tablicę obiektów tokenów. Oznacza każdy token jako jeden z trzech typów: word, spacing lub audio_event.

  • word: Rozpoznane, pojedyncze wypowiedziane słowo z zapisanym czasem rozpoczęcia i zakończenia oraz tagiem speaker_id.
  • spacing: Jawnie oznaczona cisza lub pauzy w trakcie wypowiedzi. Pomaga usługom tworzenia napisów zachować właściwe tempo. Nie jest używany w rozpoznanych językach bez spacji między słowami, takich jak japoński, mandaryński, tajski, lao, birmański i kantoński.
  • audio_event: Istotny dźwięk niewerbalny, taki jak śmiech lub oklaski. Model potrafi zapisać go jako osobny typ zdarzenia i nie zamienia audio na halucynowaną mowę.
Timestamped token array separates speech, silence, and laughter across two speakers.

Parametry strumieniowania w czasie rzeczywistym

Modele transkrypcji na poziomie słów mogą też oferować specjalne funkcje wspierające transkrypcję audio na żywo przez WebSocket. Na przykład:

  • include_timestamps=true: Ten parametr sprawia, że połączenie uwzględnia znaczniki czasu na poziomie słów w komunikatach JSON committed_transcript_with_timestamps wysyłanych na końcu każdego sfinalizowanego fragmentu audio. Dzięki temu otrzymujesz znaczniki czasu, gdy strumień nadal trwa. Tagi zdarzeń audio są uwzględniane tylko wtedy, gdy włączysz także tag_audio_events.
  • include_language_detection=true: Ten parametr nakazuje połączeniu tagować różne wykryte języki mówione wraz z poziomem pewności modelu. Pomaga to tworzyć wielojęzyczne napisy na żywo.

Jak model Speech to Text taguje zdarzenia inne niż mowa?

Scribe będzie tagować zdarzenia audio, gdy włączysz parametr tag_audio_events. Oznaczy wtedy ich konkretne czasy rozpoczęcia i zakończenia, tak jak w przypadku słów. Może tagować różne reakcje, najczęściej śmiech i oklaski, ale też inne dźwięki otoczenia, które mogą mieć znaczenie w kontekście, w tym kroki czy muzykę w tle.

Przede wszystkim wzbogaca to transkrypcje i napisy o ważny kontekst. Czytelnikowi może być trudniej wychwycić sarkazm w prostym, płaskim tekście. Tag [laughter] wzbogaca transkrypcję i nadaje jej więcej emocji.

Lepsza analityka

Tagowanie zdarzeń porządkuje też dalszą analitykę, ponieważ narzędzia nie muszą analizować jednego bloku nieuporządkowanego tekstu. Natywna transkrypcja na poziomie słów oddziela zdarzenia audio jako uporządkowane dane, dzięki czemu twoje narzędzia mogą je w razie potrzeby odfiltrować i pracować wyłącznie na treści słownej.

Ponieważ tokeny spacing uwidaczniają pauzy, możesz je analizować. To może być przydatne w analizie nastrojów i kontroli jakości, na przykład do mierzenia, jak długo pracownik obsługi klienta milczał podczas rozmowy.

Łatwiejsze wyszukiwanie znaczników czasu

Możesz też wyszukiwać je bezpośrednio. Jeśli analizujesz nastroje w wywiadzie podczas testów produktu, możesz wyodrębnić istotne reakcje emocjonalne. Jeśli prowadzisz konto w mediach społecznościowych, szybko wyszukasz śmiech w godzinnym przemówieniu, by znaleźć klipy, które według ciebie mają największą szansę stać się viralowe.

Integruj STT ze swoimi aplikacjami na dużą skalę

Szukasz czegoś innego? Zajrzyj do Centrum pomocy

Jakie są praktyczne zastosowania uporządkowanych transkrypcji ze znacznikami czasu?

Natywne uporządkowane dane w transkrypcjach mają kilka ważnych zastosowań.

Tworzenie napisów i napisów dialogowych

Możesz eksportować transkrypcje ze znacznikami czasu bezpośrednio do produkcyjnych formatów napisów, w tym SRT i VTT, bez pośredniego przetwarzania. Narzędzie do montażu wideo może użyć synchronizacji słów, by podświetlać je w napisach, gdy są wypowiadane.

Model transkrypcji łatwo przetwarza szybką mowę, ponieważ robi to słowo po słowie. Tam, gdzie tradycyjny model może mieć problem z bardzo szybką mową lub nakładającymi się głosami, model na poziomie słów, taki jak Scribe, może zwrócić czystą, uporządkowaną transkrypcję.

Wyszukiwanie w audio i wideo

Tradycyjna transkrypcja pozwala dopasować słowa kluczowe w bloku tekstu, ale bez wymuszonego dopasowania nie możesz przejść do chwili, w której padła dana fraza. Wyszukiwanie słów kluczowych w transkrypcji na poziomie słów jest w pełni indeksowane i przenosi cię dokładnie do sekundy, w której fraza została wypowiedziana. W ten sposób archiwum audio staje się w pełni przeszukiwalnym katalogiem referencyjnym. Jest to szczególnie przydatne przy zarządzaniu dużymi bibliotekami mediów, sieciami podcastów i archiwami firmowymi.

Audyt zgodności i ryzyka

Często warto nagrywać audio zawierające informacje wrażliwe, na przykład rozmowy z obsługą klienta do kontroli jakości. Takie rozmowy najczęściej zawierają wrażliwe lub regulowane dane osobowe. 

Aby zachować zgodność i nadal mieć dane audio do analityki, potrzebujesz sposobu na redagowanie danych wrażliwych z transkrypcji w czasie rzeczywistym. Natywne znaczniki czasu na poziomie słów pozwalają korzystać z funkcji takich jak Entity Detection od ElevenLabs, która oznacza wrażliwe encje, takie jak numery kart kredytowych lub imiona i nazwiska, oraz zwraca ich przesunięcia i znaczniki czasu, dzięki czemu możesz je ukryć w napływających transkrypcjach.

Na przykład możesz wykrywać i redagować numer karty kredytowej, nazwisko panieńskie matki, datę urodzenia i nazwisko klienta, gdy są wypowiadane podczas rozmowy weryfikującej tożsamość.

Automatyczne tworzenie klipów do mediów społecznościowych

Możesz też programowo automatyzować wyszukiwanie słów kluczowych, aby znajdować najciekawsze fragmenty dłuższych treści. Możesz na przykład wyróżnić ważne momenty przemówienia wyborczego lub firmowego seminarium. Dzięki temu zamienisz najnowsze treści w profesjonalnie zmontowane klipy na YouTube, LinkedIn lub TikToka.

Synchronizacja wielu kanałów i mówców

Scribe może transkrybować do pięciu kanałów niezależnie i równolegle. Każdy otrzymuje identyfikator mówcy i znaczniki czasu. To bardziej niezawodne niż standardowa akustyczna diaryzacja mówców, która często ma problemy z dialogiem naprzemiennym. W nagraniach wielokanałowych przypisanie mówców przez Scribe jest całkowicie deterministyczne. Oznacza to, że kanał 0 odpowiada speaker_0, kanał 1 — speaker_1 itd.

Potrafi rozpoznać mówców próbujących mówić jednocześnie i nadal generować niezależne znaczniki czasu dla ich wypowiedzi. Mogą też mówić w różnych językach.

Multichannel transcription keeps five channels separate, mapping each to speaker 0–4.

Eksport danych ze znacznikami czasu w potrzebnym formacie

Jeśli potrzebujesz tradycyjnych transkrypcji w wielu formatach, prawdopodobnie musisz samodzielnie napisać skrypty do ich przetwarzania. Scribe może eksportować transkrypcje w wielu formatach, zależnie od sposobu użycia. Pełne definicje schematów znajdziesz w dokumentacji API ElevenLabs Create Transcript.

Uporządkowane dane dla deweloperów: JSON

Scribe obsługuje eksport do JSON dla deweloperów, którzy chcą przekazywać dane w określonym schemacie do kolejnych aplikacji. Na przykład deweloperzy mogą użyć tych danych JSON do tworzenia interaktywnych mediów lub bazy wyszukiwania semantycznego dla swojej organizacji. Pełna tablica tokenów word, spacing i audio_event zawiera przesunięcia początku i końca oraz identyfikatory mówców.

Napisy do mediów: SRT i VTT

Scribe może zwracać transkrypcje SRT i VTT, które możesz przekazać bezpośrednio do Adobe Premiere lub innych aplikacji produkcyjnych bez ręcznej synchronizacji.

Czytelne dla człowieka: TXT, DOCX i PDF

Może też zwracać transkrypcje w formatach przyjaznych dla czytelnika. W tych formatach Scribe usuwa szczegółowe znaczniki czasu, aby tekst był bardziej czytelny i nadawał się do dokumentacji prawnej lub audytowej. Jest to przydatne na przykład, gdy chcesz sprawnie rozesłać protokół z posiedzenia zarządu tuż po spotkaniu, opublikować transkrypcje podcastów dla SEO lub archiwizować dokumentację prawną.

Scribe exports one transcript as JSON, SRT/VTT, or TXT/DOCX/PDF for different uses.

Zacznij korzystać z transkrypcji ElevenLabs ze znacznikami czasu i tagami zdarzeń 

Natywna transkrypcja na poziomie słów szybko i sprawnie zapewnia uporządkowane dane potrzebne w twoich workflow.

Zacznij już dziś transkrybować audio za pomocą Scribe w ElevenAPI lub dowiedz się więcej o transkrypcji na poziomie słów.

FAQ: znaczniki czasu i transkrypcja z tagami zdarzeń

Podobne artykuły

Twórz z najwyższej jakości audio AI