Przejdź do treści

Czym są Audio Tags? Kompletny przewodnik po emocjonalnym TTS

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Audio Tags to wskazówki w nawiasach kwadratowych, zapisane naturalnym językiem, np. [laughs], [gasps], [excited] i [worried]. Eleven v3 odczytuje je jako wskazówki dotyczące wykonania, a nie słowa do wypowiedzenia. Gdy piszesz skrypt dla modelu zamiany tekstu na mowę, Audio Tags dają ci precyzyjną kontrolę nad emocjonalnym brzmieniem tekstu. 

Eleven v3 stał się publicznie dostępny w marcu 2026 roku. Przed v3 uzyskanie konkretnego emocjonalnego wykonania z modelu Text to Speech wymagał wielokrotnego generowania treści i liczenia na najlepszy rezultat. Audio Tags eliminują zgadywanie, dając ci pełną kontrolę nad emocjonalnym wykonaniem tekstu przez model zamiany tekstu na mowę.

W tym przewodniku wyjaśniamy, czym są Audio Tags, jak działają, jakie kategorie tagów są dostępne i czym różnią się od SSML (Speech Synthesis Markup Language). Omówimy też typowe zastosowania — każde z linkiem do osobnego poradnika.

Podsumowanie

  • Audio Tags to wskazówki w nawiasach kwadratowych, takie jak [shouts] czy [excited], które kierują emocjami, tempem, sposobem mówienia i tonem TTS w Eleven v3.
  • Eleven v3 nie obsługuje SSML, ale zastępuje go Audio Tags, dzięki czemu pisanie jest bardziej naturalne.
  • Tagi obejmują kilka kategorii, takich jak emocje, sposób wykonania i tempo, ludzkie reakcje, akcenty oraz efekty dźwiękowe.
  • Interpunkcja i wielkie litery pozwalają kształtować tempo wykonania przez głos AI.
  • Z Audio Tags w ElevenLabs możesz korzystać w interfejsie lub przez API.

Jak działają Audio Tags?

Audio Tags umieszcza się bezpośrednio w transkrypcji i zapisuje w nawiasach kwadratowych. Gdy chcesz zmienić sposób mówienia, na przykład z normalnego na [worried], po prostu dodaj audio tag.

W jednym zdaniu możesz też użyć więcej niż jednego tagu i łączyć je, by uzyskać bardziej złożone wykonanie, np. [tired] To był długi dzień… [upset] Ile jeszcze dni to wytrzymam?

Architektura Eleven v3 pozwala modelowi lepiej rozumieć kontekst niż wcześniejsze modele. Dzięki temu śledzi wskazówki emocjonalne, zmiany tonu, przejścia między mówcami i sygnały kontekstowe bez osobnych parametrów czy ustawień. Po prostu powiedz modelowi, czego wymaga dana chwila, a wykona kwestię dokładnie tak, jak planujesz.

Eleven v3 obsługuje też spontanicznie brzmiące dialogi wielu mówców, w tym przerwania, zmiany nastroju i naturalną wymianę zdań — wyłącznie na podstawie tagów i struktury skryptu. 

Audio Tags a SSML

Jeśli pracujesz z innymi systemami TTS, prawdopodobnie znasz Speech Synthesis Markup Language. Platformy takie jak Amazon Polly i Microsoft Azure Speech używają tagów SSML, np. <break> czy <emphasis>, by dodać kontekst do skryptu TTS. 

Eleven v3 nie obsługuje tagów przerw ani pozostałych tagów SSML. Ich rolę przejmują Audio Tags, interpunkcja i sama struktura tekstu — nadal dając ci precyzyjną kontrolę nad sposobem mówienia.

Skorzystaj z tabeli poniżej, aby porównać popularne tagi SSML z ich odpowiednikami w Eleven v3.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Z perspektywy autora dodanie [whispers] do kwestii wymaga znacznie mniej wysiłku niż ustawienie tempa prozodii.

Kategorie Audio Tags w v3: kierowanie wykonaniem za pomocą Audio Tags

Audio Tags możesz umieścić w dowolnym miejscu skryptu, by na bieżąco kształtować sposób mówienia. Możesz też łączyć tagi w skrypcie, a nawet w jednym zdaniu.

Tagi dzielą się na następujące główne kategorie.

Emocje

Te tagi pomagają nadać głosowi emocjonalny ton — ponury, intensywny lub pogodny. Możesz na przykład użyć jednego tagu albo połączyć [sad], [angry], [happily] i [sorrowful].

Background
Background

Sposób wykonania i tempo

Dotyczą głównie tonu i wykonania. Używaj ich, by dostosować głośność i energię w scenach wymagających powściągliwości albo siły. Przykłady to [whispers], [shouts] i [softly].

Background
Background

Ludzkie reakcje

Prawdziwie naturalna mowa zawiera reakcje. Możesz dodać realizmu, wplatając w wypowiedź naturalne, nieskryptowane momenty. Tagi takie jak [laughs], [clears throat] i [sighs] pomagają stworzyć model TTS, który przekazuje ludzkie emocje.

Inne przykłady kategorii audio tagów:

  • Akcenty i głosy postaci: Tagi akcentów zmieniają głos na konkretny regionalny akcent lub personę bez zmiany modelu, np. [French accent], [British accent] czy [pirate voice]. Dzięki nim jeden głos może stać się elastyczną obsadą zamiast jednego stałego wykonania.
  • Efekty dźwiękowe: Tagi efektów dźwiękowych dodają dźwięki inne niż mowa bezpośrednio do generowania, np. [gunshot], [explosion] i [clapping]. Dobrze sprawdzają się w immersyjnym audio, grach i narracji dramatycznej, gdy scena potrzebuje czegoś więcej niż głosu. Możesz też użyć generatora efektów dźwiękowych AI ElevenCreative.

Tagi dają dużą kontrolę, ale rytm i akcenty możesz też kształtować interpunkcją. Na przykład dodaj wielokropek, by uzyskać naturalną pauzę, albo użyj przecinków, by stworzyć naturalny rytm oddechu. Spróbuj zapisać słowo wielkimi literami, aby je podkreślić: „Chcę tego WŁAŚNIE TERAZ.”

Background
Background

Co możesz zrobić z Audio Tags?

Audio Tags w intuicyjny sposób dodają skryptom emocjonalnej głębi. Pisz naturalnie i dodawaj tagi po drodze.

Oto kilka przykładów zastosowania emocjonalnego TTS z Audio Tags.

Świadomość sytuacyjna w audio AI

Tagi takie jak [whisper] czy [shouting] pozwalają Eleven v3 reagować na sytuację. Od złagodzenia ostrzeżenia po wydłużoną pauzę budującą napięcie — możesz dodać do skryptu dynamiczną świadomość sytuacyjną.

Pełne omówienie znajdziesz w naszym przewodniku o świadomości sytuacyjnej w audio AI.

Reżyserowanie wykonania postaci w mowie

Tworząc skrypt z wieloma postaciami, warto wyraźnie pokazać, czym różni się każdy głos. Od eksperymentowania z osobowością za pomocą [sarcastically] po określanie sposobu mówienia przez [British accent] — nasz silnik TTS pozwala oddać pełną gamę emocji.

Dowiedz się więcej o reżyserowaniu wykonania postaci w mowie AI.

Wyrażanie emocjonalnego kontekstu w mowie

Audio Tags pozwalają kształtować emocjonalne wykonanie wypowiedzi w miarę jej rozwoju. Możesz stopniowo budować emocje, aż do kulminacji w momencie, gdy twoja postać osiąga pełnię możliwości. Tagi takie jak [awe], [booming] i [big laugh] pomagają nadać wykonaniu przez głos AI pełną gamę emocji.

Przeczytaj więcej o używaniu emocjonalnego kontekstu w mowie AI

Ożywianie dialogów wielu postaci

Tworząc dialogi wielu postaci, możesz zaczynać każdą kwestię od audio tagu, by budować wyraziste rozmowy między postaciami. 

Spójrz na ten przykład: Tom: [coughing] [beginning to speak] przepraszam, jestem dziś trochę chory— Emma: [interrupting] —Chory? Wiesz, jak nie znoszę kaszlu, Tom! Tom: [surprised] To tylko lekki kaszel, nic poważnego. Jak byś się czuła, gdybym— Emma: [overlapping] [annoyed] —Myślę, że powinieneś iść do domu. 

Zobacz, co jeszcze możesz zrobić z dialogami wielu postaci w Eleven v3.

Precyzyjna kontrola wykonania mowy AI

Tempo mowy w Eleven v3 możesz kontrolować za pomocą Audio Tags lub interpunkcji. Tagi takie jak [pause], [rushed] czy [drawn out] pozwalają precyzyjnie kształtować wypowiedź. Możesz też dodać wielokropki, kropki i wykrzykniki, by naturalnie wpleść emocje w wykonanie TTS.

Przygotowaliśmy szczegółowy przewodnik o precyzyjnej kontroli wykonania w Eleven v3.

Emocjonalne TTS jest dostępne w API

Audio Tags działają tak samo przez Text to Speech API jak w interfejsie ElevenLabs. Wpisz tag bezpośrednio w tekście skryptu, a API zwróci oznaczone nim wykonanie w wygenerowanym audio — od procesów tworzenia audiobooków po nałożone głosy do reklam. 

Dowiedz się więcej o Eleven v3 lub skontaktuj się z działem sprzedaży i zacznij już dziś.

Audio Tags i emocjonalny TTS — FAQ

Podobne artykuły

Twórz z najwyższej jakości audio AI