Czym są Audio Tags? Kompletny przewodnik po emocjonalnym TTS
- Autor
- Jack Limebear
- Opublikowano
- Ostatnia aktualizacja
PosłuchajPosłuchaj tego artykułu
Audio Tags to wskazówki w nawiasach kwadratowych, zapisane naturalnym językiem, np. [laughs], [gasps], [excited] i [worried]. Eleven v3 odczytuje je jako wskazówki dotyczące wykonania, a nie słowa do wypowiedzenia. Gdy piszesz skrypt dla modelu zamiany tekstu na mowę, Audio Tags dają ci precyzyjną kontrolę nad emocjonalnym brzmieniem tekstu.
Eleven v3 stał się publicznie dostępny w marcu 2026 roku. Przed v3 uzyskanie konkretnego emocjonalnego wykonania z modelu Text to Speech wymagał wielokrotnego generowania treści i liczenia na najlepszy rezultat. Audio Tags eliminują zgadywanie, dając ci pełną kontrolę nad emocjonalnym wykonaniem tekstu przez model zamiany tekstu na mowę.
W tym przewodniku wyjaśniamy, czym są Audio Tags, jak działają, jakie kategorie tagów są dostępne i czym różnią się od SSML (Speech Synthesis Markup Language). Omówimy też typowe zastosowania — każde z linkiem do osobnego poradnika.
Podsumowanie
- Audio Tags to wskazówki w nawiasach kwadratowych, takie jak [shouts] czy [excited], które kierują emocjami, tempem, sposobem mówienia i tonem TTS w Eleven v3.
- Eleven v3 nie obsługuje SSML, ale zastępuje go Audio Tags, dzięki czemu pisanie jest bardziej naturalne.
- Tagi obejmują kilka kategorii, takich jak emocje, sposób wykonania i tempo, ludzkie reakcje, akcenty oraz efekty dźwiękowe.
- Interpunkcja i wielkie litery pozwalają kształtować tempo wykonania przez głos AI.
- Z Audio Tags w ElevenLabs możesz korzystać w interfejsie lub przez API.
Jak działają Audio Tags?
Audio Tags umieszcza się bezpośrednio w transkrypcji i zapisuje w nawiasach kwadratowych. Gdy chcesz zmienić sposób mówienia, na przykład z normalnego na [worried], po prostu dodaj audio tag.
W jednym zdaniu możesz też użyć więcej niż jednego tagu i łączyć je, by uzyskać bardziej złożone wykonanie, np. [tired] To był długi dzień… [upset] Ile jeszcze dni to wytrzymam?
Architektura Eleven v3 pozwala modelowi lepiej rozumieć kontekst niż wcześniejsze modele. Dzięki temu śledzi wskazówki emocjonalne, zmiany tonu, przejścia między mówcami i sygnały kontekstowe bez osobnych parametrów czy ustawień. Po prostu powiedz modelowi, czego wymaga dana chwila, a wykona kwestię dokładnie tak, jak planujesz.
Eleven v3 obsługuje też spontanicznie brzmiące dialogi wielu mówców, w tym przerwania, zmiany nastroju i naturalną wymianę zdań — wyłącznie na podstawie tagów i struktury skryptu.
Audio Tags a SSML
Jeśli pracujesz z innymi systemami TTS, prawdopodobnie znasz Speech Synthesis Markup Language. Platformy takie jak Amazon Polly i Microsoft Azure Speech używają tagów SSML, np. <break> czy <emphasis>, by dodać kontekst do skryptu TTS.
Eleven v3 nie obsługuje tagów przerw ani pozostałych tagów SSML. Ich rolę przejmują Audio Tags, interpunkcja i sama struktura tekstu — nadal dając ci precyzyjną kontrolę nad sposobem mówienia.
Skorzystaj z tabeli poniżej, aby porównać popularne tagi SSML z ich odpowiednikami w Eleven v3.
Z perspektywy autora dodanie [whispers] do kwestii wymaga znacznie mniej wysiłku niż ustawienie tempa prozodii.
Kategorie Audio Tags w v3: kierowanie wykonaniem za pomocą Audio Tags
Audio Tags możesz umieścić w dowolnym miejscu skryptu, by na bieżąco kształtować sposób mówienia. Możesz też łączyć tagi w skrypcie, a nawet w jednym zdaniu.
Tagi dzielą się na następujące główne kategorie.
Emocje
Te tagi pomagają nadać głosowi emocjonalny ton — ponury, intensywny lub pogodny. Możesz na przykład użyć jednego tagu albo połączyć [sad], [angry], [happily] i [sorrowful].
Sposób wykonania i tempo
Dotyczą głównie tonu i wykonania. Używaj ich, by dostosować głośność i energię w scenach wymagających powściągliwości albo siły. Przykłady to [whispers], [shouts] i [softly].
Ludzkie reakcje
Prawdziwie naturalna mowa zawiera reakcje. Możesz dodać realizmu, wplatając w wypowiedź naturalne, nieskryptowane momenty. Tagi takie jak [laughs], [clears throat] i [sighs] pomagają stworzyć model TTS, który przekazuje ludzkie emocje.
Inne przykłady kategorii audio tagów:
- Akcenty i głosy postaci: Tagi akcentów zmieniają głos na konkretny regionalny akcent lub personę bez zmiany modelu, np. [French accent], [British accent] czy [pirate voice]. Dzięki nim jeden głos może stać się elastyczną obsadą zamiast jednego stałego wykonania.
- Efekty dźwiękowe: Tagi efektów dźwiękowych dodają dźwięki inne niż mowa bezpośrednio do generowania, np. [gunshot], [explosion] i [clapping]. Dobrze sprawdzają się w immersyjnym audio, grach i narracji dramatycznej, gdy scena potrzebuje czegoś więcej niż głosu. Możesz też użyć generatora efektów dźwiękowych AI ElevenCreative.
Tagi dają dużą kontrolę, ale rytm i akcenty możesz też kształtować interpunkcją. Na przykład dodaj wielokropek, by uzyskać naturalną pauzę, albo użyj przecinków, by stworzyć naturalny rytm oddechu. Spróbuj zapisać słowo wielkimi literami, aby je podkreślić: „Chcę tego WŁAŚNIE TERAZ.”
Co możesz zrobić z Audio Tags?
Audio Tags w intuicyjny sposób dodają skryptom emocjonalnej głębi. Pisz naturalnie i dodawaj tagi po drodze.
Oto kilka przykładów zastosowania emocjonalnego TTS z Audio Tags.
Świadomość sytuacyjna w audio AI
Tagi takie jak [whisper] czy [shouting] pozwalają Eleven v3 reagować na sytuację. Od złagodzenia ostrzeżenia po wydłużoną pauzę budującą napięcie — możesz dodać do skryptu dynamiczną świadomość sytuacyjną.
Pełne omówienie znajdziesz w naszym przewodniku o świadomości sytuacyjnej w audio AI.
Reżyserowanie wykonania postaci w mowie
Tworząc skrypt z wieloma postaciami, warto wyraźnie pokazać, czym różni się każdy głos. Od eksperymentowania z osobowością za pomocą [sarcastically] po określanie sposobu mówienia przez [British accent] — nasz silnik TTS pozwala oddać pełną gamę emocji.
Dowiedz się więcej o reżyserowaniu wykonania postaci w mowie AI.
Wyrażanie emocjonalnego kontekstu w mowie
Audio Tags pozwalają kształtować emocjonalne wykonanie wypowiedzi w miarę jej rozwoju. Możesz stopniowo budować emocje, aż do kulminacji w momencie, gdy twoja postać osiąga pełnię możliwości. Tagi takie jak [awe], [booming] i [big laugh] pomagają nadać wykonaniu przez głos AI pełną gamę emocji.
Przeczytaj więcej o używaniu emocjonalnego kontekstu w mowie AI.
Ożywianie dialogów wielu postaci
Tworząc dialogi wielu postaci, możesz zaczynać każdą kwestię od audio tagu, by budować wyraziste rozmowy między postaciami.
Spójrz na ten przykład: Tom: [coughing] [beginning to speak] przepraszam, jestem dziś trochę chory— Emma: [interrupting] —Chory? Wiesz, jak nie znoszę kaszlu, Tom! Tom: [surprised] To tylko lekki kaszel, nic poważnego. Jak byś się czuła, gdybym— Emma: [overlapping] [annoyed] —Myślę, że powinieneś iść do domu.
Zobacz, co jeszcze możesz zrobić z dialogami wielu postaci w Eleven v3.
Precyzyjna kontrola wykonania mowy AI
Tempo mowy w Eleven v3 możesz kontrolować za pomocą Audio Tags lub interpunkcji. Tagi takie jak [pause], [rushed] czy [drawn out] pozwalają precyzyjnie kształtować wypowiedź. Możesz też dodać wielokropki, kropki i wykrzykniki, by naturalnie wpleść emocje w wykonanie TTS.
Przygotowaliśmy szczegółowy przewodnik o precyzyjnej kontroli wykonania w Eleven v3.
Emocjonalne TTS jest dostępne w API
Audio Tags działają tak samo przez Text to Speech API jak w interfejsie ElevenLabs. Wpisz tag bezpośrednio w tekście skryptu, a API zwróci oznaczone nim wykonanie w wygenerowanym audio — od procesów tworzenia audiobooków po nałożone głosy do reklam.
Dowiedz się więcej o Eleven v3 lub skontaktuj się z działem sprzedaży i zacznij już dziś.










