Czym są tagi audio? Kompletny przewodnik po emocjonalnym TTS
- Autor
- Jack Limebear
- Opublikowano
- Ostatnia aktualizacja
PosłuchajPosłuchaj tego artykułu
Tagi audio to wskazówki w nawiasach kwadratowych, takie jak [laughs], [gasps], [excited] i [worried], które Eleven v3 odczytuje jako wskazówki wykonawcze, a nie słowa do wypowiedzenia. Gdy piszesz skrypt dla modelu zamiany tekstu na mowę, tagi audio dają ci precyzyjną kontrolę nad emocjonalnym przekazem tekstu.
Eleven v3 został publicznie udostępniony w marcu 2026 roku. Przed v3 uzyskanie konkretnego emocjonalnego wykonania z modelu Text to Speech wymagało ponownego generowania treści i liczenia na najlepsze. Tagi audio eliminują to zgadywanie i dają ci pełną kontrolę nad emocjonalnym wykonaniem zamiany tekstu na mowę.
Ten przewodnik wyjaśnia, czym są tagi audio, jak działają, jakie są ich kategorie i jak wypadają na tle SSML (Speech Synthesis Markup Language). Omówimy też typowe zastosowania — każde z linkiem do osobnego przewodnika.
Podsumowanie:
- Tagi audio to wskazówki w nawiasach kwadratowych, takie jak [shouts] czy [excited], które sterują emocjami, tempem, sposobem mówienia i tonem TTS w Eleven v3.
- Eleven v3 nie obsługuje SSML, ale zastępuje go tagami audio, dzięki czemu pisanie jest bardziej naturalne.
- Tagi należą do kilku kategorii, m.in. emocji, sposobu mówienia i tempa, ludzkich reakcji, akcentów oraz efektów dźwiękowych.
- Interpunkcja i wielkie litery pozwalają ci kształtować tempo wypowiedzi głosu AI.
- Z tagów audio w ElevenLabs możesz korzystać w UI lub przez API.
Jak działają tagi audio?
Tagi audio umieszczasz bezpośrednio w transkrypcji, w nawiasach kwadratowych. Gdy chcesz zmienić sposób mówienia, na przykład z normalnego na [worried], po prostu dodaj tag audio.
Możesz też użyć kilku tagów w jednym zdaniu i łączyć je, aby uzyskać bardziej złożone wykonanie, np. [tired] It’s been a long day… [upset] How many more days can I take?
Architektura Eleven v3 pozwala modelowi lepiej rozumieć kontekst niż wcześniejsze modele. Dzięki temu rozpoznaje wskazówki emocjonalne, zmiany tonu, przejścia między mówcami i kontekst bez osobnych parametrów czy ustawień. Po prostu powiedz modelowi, czego wymaga dana chwila, a wykona kwestię zgodnie z twoim planem.
Eleven v3 obsługuje też spontanicznie brzmiące dialogi wielu osób — z przerwami, zmianami nastroju i naturalną wymianą zdań — wyłącznie na podstawie tagów i struktury skryptu.
Tagi audio a SSML
Jeśli korzystasz z innych systemów TTS, prawdopodobnie znasz Speech Synthesis Markup Language. Platformy takie jak Amazon Polly i Microsoft Azure Speech używają tagów SSML, np. <break> czy <emphasis>, aby dodać kontekst do skryptu TTS.
Eleven v3 nie obsługuje tagów przerw SSML ani pozostałych tagów SSML. Zamiast nich tę rolę przejmują tagi audio, interpunkcja i sama struktura tekstu, nadal dając precyzyjną kontrolę nad wykonaniem.
W tabeli poniżej możesz porównać popularne tagi SSML z ich odpowiednikami w Eleven v3.
Z perspektywy autora dodanie [whispers] do kwestii wymaga znacznie mniej wysiłku niż ustawienie tempa prozodii.
Kategorie tagów audio w v3: sterowanie wykonaniem za pomocą tagów audio
Tagi audio możesz umieścić w dowolnym miejscu skryptu, aby na bieżąco kształtować sposób mówienia. Możesz też łączyć tagi w skrypcie, a nawet w jednym zdaniu.
Tagi dzielą się na następujące główne kategorie.
Emocje
Te tagi pomagają określić emocjonalny ton głosu — ponury, intensywny lub pogodny. Możesz na przykład użyć jednego tagu albo połączyć [sad], [angry], [happily] i [sorrowful].
Sposób mówienia i tempo
Dotyczą bardziej tonu i wykonania. Za ich pomocą dostosujesz głośność i energię w scenach wymagających powściągliwości lub siły. Przykłady to [whispers], [shouts] i [softly].
Ludzkie reakcje
Naturalna mowa zawiera reakcje. Możesz dodać realizmu, wplatając w wypowiedź naturalne, nieskryptowane momenty. Tagi takie jak [laughs], [clears throat] i [sighs] pomagają modelowi TTS oddać ludzkie emocje.
Inne przykłady kategorii tagów audio:
- Akcenty i głosy postaci: Tagi akcentów zmieniają głos na konkretny region lub postać bez zmiany modelu, np. [French accent], [British accent] czy [pirate voice]. Dzięki nim jeden głos staje się elastyczną obsadą, a nie jednym stałym wykonaniem.
- Efekty dźwiękowe: Tagi efektów dźwiękowych dodają dźwięki inne niż mowa bezpośrednio do generacji, np. [gunshot], [explosion] i [clapping]. Sprawdzają się w immersyjnym audio, grach i narracji dramatycznej, gdy scena potrzebuje czegoś więcej niż głosu. Możesz też użyć generatora efektów dźwiękowych AI ElevenCreative.
Tagi dają ci dużą kontrolę, ale rytm i akcent możesz też kształtować interpunkcją. Dodaj wielokropek, aby uzyskać naturalną pauzę, albo przecinki, by odwzorować naturalny oddech. Aby dodać nacisk, zapisz słowo wielkimi literami: „Chcę tego WŁAŚNIE TERAZ”.
Co możesz zrobić z tagami audio?
Tagi audio pozwalają intuicyjnie wykorzystać emocjonalną złożoność skryptów. Pisz naturalnie i dodawaj tagi w trakcie.
Oto kilka zastosowań emocjonalnego TTS z tagami audio.
Świadomość sytuacyjna w audio AI
Tagi takie jak [whisper] czy [shouting] pozwalają Eleven v3 reagować na sytuację. Od złagodzenia ostrzeżenia po wydłużoną pauzę budującą napięcie — możesz wprowadzić do skryptu dynamiczną świadomość sytuacyjną.
Pełne omówienie znajdziesz w naszym przewodniku o świadomości sytuacyjnej w audio AI.
Reżyserowanie postaci w mowie
Tworząc skrypt z wieloma postaciami, chcesz wyraźnie pokazać, czym różni się każdy głos. Od zmiany osobowości za pomocą [sarcastically] po określenie sposobu mówienia przez [British accent] — nasz silnik TTS pozwala uchwycić pełen zakres emocji.
Dowiedz się więcej o reżyserowaniu postaci w mowie AI.
Wyrażanie kontekstu emocjonalnego w mowie
Tagi audio pozwalają kształtować emocjonalny przekaz kwestii w miarę jej rozwoju. Możesz budować emocje przez całą wypowiedź, osiągając kulminację w momencie, w którym twoja postać pokazuje pełnię możliwości. Tagi takie jak [awe], [booming] i [big laugh] pomagają wprowadzić pełną gamę emocji do wypowiedzi głosu AI.
Przeczytaj więcej o używaniu kontekstu emocjonalnego w mowie AI.
Ożywianie dialogów wielu postaci
Tworząc dialogi wielu postaci, możesz rozpoczynać każdą kwestię tagiem audio, aby budować bogate rozmowy między bohaterami.
Oto przykład: Tom: [coughing] [beginning to speak] przepraszam, jestem dziś trochę chory— Emma: [interrupting] —Chory? Wiesz, jak nie znoszę kaszlu, Tom! Tom: [surprised] To tylko lekki kaszel, nic poważnego. Co byś powiedziała, gdybym— Emma: [overlapping] [annoyed] —Myślę, że powinieneś iść do domu.
Zobacz, co jeszcze możesz zrobić z dialogami wielu postaci w Eleven v3.
Precyzyjna kontrola sposobu mówienia w mowie AI
W Eleven v3 możesz sterować tempem mowy za pomocą tagów audio lub interpunkcji. Tagi takie jak [pause], [rushed] czy [drawn out] pozwalają precyzyjnie kształtować kwestię. Możesz też dodać wielokropki, kropki i wykrzykniki, aby naturalnie wprowadzić emocje do wykonania TTS.
Przygotowaliśmy szczegółowy przewodnik o precyzyjnej kontroli sposobu mówienia w Eleven v3.
Emocjonalne TTS jest dostępne przez API
Tagi audio działają przez Text to Speech API tak samo jak w UI ElevenLabs. Wpisz tag bezpośrednio w tekście skryptu, a API zwróci wygenerowane audio z odpowiednim wykonaniem — od procesów tworzenia audiobooków po głosy do reklam.
Dowiedz się więcej o Eleven v3 lub skontaktuj się ze sprzedażą i zacznij już dziś.







%20copy.webp&w=3840&q=80)


