Przejdź do treści

Czym są tagi audio? Kompletny przewodnik po emocjonalnym TTS

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Audio tagi to wskazówki w nawiasach kwadratowych, zapisane naturalnym językiem, np. [laughs], [gasps], [excited] i [worried], które Eleven v3 odczytuje jako instrukcje wykonania, a nie słowa do wypowiedzenia. Gdy piszesz skrypt dla modelu zamiany tekstu na mowę, dodanie tych audio tagów daje ci precyzyjną kontrolę nad emocjonalnym przekazem tekstu. 

Eleven v3 stał się publicznie dostępny w marcu 2026 roku. Przed v3 uzyskanie konkretnego emocjonalnego wykonania z modelu Text to Speech oznaczało wielokrotne generowanie treści i liczenie na szczęście. Audio tagi eliminują to zgadywanie, dając ci pełną kontrolę nad emocjonalnym wykonaniem zamiany tekstu na mowę.

Ten przewodnik wyjaśnia, czym są audio tagi, jak działają, jakie są dostępne kategorie tagów i jak wypadają na tle SSML (Speech Synthesis Markup Language). Omówimy też typowe zastosowania — każde z linkiem do osobnego przewodnika.

Podsumowanie:

  • Audio tagi to wskazówki w nawiasach kwadratowych, np. [shouts] lub [excited], które sterują emocjami, tempem, sposobem wykonania i tonem TTS w Eleven v3.
  • Eleven v3 nie obsługuje SSML, ale zastępuje go audio tagami, dzięki czemu pisanie jest bardziej naturalne.
  • Tagi obejmują kilka kategorii, takich jak emocje, sposób wykonania i tempo, ludzkie reakcje, akcenty oraz efekty dźwiękowe.
  • Interpunkcja i wielkie litery pozwalają kształtować tempo wykonania przez głos AI.
  • Z audio tagów w ElevenLabs możesz korzystać w interfejsie lub przez API.

Jak działają audio tagi?

Audio tagi umieszcza się bezpośrednio w transkrypcie i zapisuje w nawiasach kwadratowych. Gdy chcesz zmienić sposób wykonania, na przykład z normalnego na [worried], wystarczy dodać audio tag.

W jednym zdaniu możesz też użyć więcej niż jednego tagu i łączyć je, by uzyskać bardziej złożone wykonanie, np. [tired] To był długi dzień… [upset] Ile jeszcze dni to wytrzymam?

Architektura Eleven v3 pozwala modelowi lepiej rozumieć kontekst niż wcześniejsze modele. Dzięki temu śledzi wskazówki emocjonalne, zmiany tonu, przejścia między mówcami i sygnały kontekstowe bez osobnych parametrów czy ustawień. Po prostu powiedz modelowi, czego wymaga dana chwila, a wykona kwestię dokładnie tak, jak planujesz.

Eleven v3 obsługuje też spontanicznie brzmiące dialogi wielu mówców, w tym przerwania, zmiany nastroju i naturalną wymianę zdań — wyłącznie na podstawie tagów i struktury skryptu. 

Audio tagi a SSML

Jeśli pracujesz z innymi systemami TTS, prawdopodobnie znasz Speech Synthesis Markup Language. Platformy takie jak Amazon Polly i Microsoft Azure Speech używają tagów SSML, np. <break> czy <emphasis>, by dodać kontekst do skryptu TTS. 

Eleven v3 nie obsługuje tagów przerw SSML ani pozostałych tagów SSML. Zamiast nich tę rolę przejmują audio tagi, interpunkcja i sama struktura tekstu, zapewniając precyzyjną kontrolę nad wykonaniem.

Skorzystaj z tabeli poniżej, aby porównać popularne tagi SSML z ich odpowiednikami w Eleven v3.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Z perspektywy autora dodanie [whispers] do kwestii wymaga znacznie mniej wysiłku niż ustawienie tempa prozodii.

Kategorie audio tagów w v3: sterowanie wykonaniem za pomocą audio tagów

Audio tagi możesz umieścić w dowolnym miejscu skryptu, aby na bieżąco kształtować wykonanie. Możesz też łączyć tagi w skrypcie, a nawet w jednym zdaniu.

Tagi dzielą się na następujące główne kategorie.

Emocje

Te tagi pomagają nadać głosowi emocjonalny ton — ponury, intensywny lub pogodny. Możesz na przykład użyć jednego tagu albo połączyć [sad], [angry], [happily] i [sorrowful].

Background
Background

Sposób wykonania i tempo

Dotyczą głównie tonu i wykonania. Używaj ich, by dostosować głośność i energię w scenach wymagających powściągliwości albo siły. Przykłady to [whispers], [shouts] i [softly].

Background
Background

Ludzkie reakcje

Prawdziwie naturalna mowa zawiera reakcje. Możesz dodać realizmu, wplatając w wypowiedź naturalne, nieskryptowane momenty. Tagi takie jak [laughs], [clears throat] i [sighs] pomagają stworzyć model TTS, który przekazuje ludzkie emocje.

Inne przykłady kategorii audio tagów:

  • Akcenty i głosy postaci: Tagi akcentów zmieniają głos na konkretny regionalny akcent lub personę bez zmiany modelu, np. [French accent], [British accent] czy [pirate voice]. Dzięki nim jeden głos może stać się elastyczną obsadą zamiast jednego stałego wykonania.
  • Efekty dźwiękowe: Tagi efektów dźwiękowych dodają dźwięki inne niż mowa bezpośrednio do generowania, np. [gunshot], [explosion] i [clapping]. Dobrze sprawdzają się w immersyjnym audio, grach i narracji dramatycznej, gdy scena potrzebuje czegoś więcej niż głosu. Możesz też użyć generatora efektów dźwiękowych AI ElevenCreative.

Tagi dają dużą kontrolę, ale rytm i akcenty możesz też kształtować interpunkcją. Na przykład dodaj wielokropek, by uzyskać naturalną pauzę, albo użyj przecinków, by stworzyć naturalny rytm oddechu. Spróbuj zapisać słowo wielkimi literami, aby je podkreślić: „Chcę tego WŁAŚNIE TERAZ.”

Background
Background

Co możesz zrobić z audio tagami?

Audio tagi w intuicyjny sposób odblokowują emocjonalną złożoność skryptów. Pisz naturalnie i dodawaj tagi po drodze.

Oto kilka zastosowań emocjonalnego TTS z audio tagami.

Świadomość sytuacyjna w audio AI

Tagi takie jak [whisper] czy [shouting] pozwalają Eleven v3 reagować na sytuację. Od złagodzenia ostrzeżenia po wydłużoną pauzę budującą napięcie — możesz dodać do skryptu dynamiczną świadomość sytuacyjną.

Pełne omówienie znajdziesz w naszym przewodniku o świadomości sytuacyjnej w audio AI.

Reżyserowanie wykonania postaci w mowie

Tworząc skrypt z wieloma postaciami, warto wyraźnie pokazać, czym różni się każdy głos. Od eksperymentowania z osobowością za pomocą [sarcastically] po określanie sposobu mówienia przez [British accent] — nasz silnik TTS pozwala oddać pełną gamę emocji.

Dowiedz się więcej o reżyserowaniu wykonania postaci w mowie AI.

Wyrażanie emocjonalnego kontekstu w mowie

Audio tagi pozwalają kształtować emocjonalne wykonanie kwestii w miarę jej rozwoju. Możesz stopniowo budować emocje, osiągając kulminację w momencie, gdy twoja postać pokazuje pełnię możliwości. Tagi takie jak [awe], [booming] i [big laugh] pomagają nadać wykonaniu głosu AI pełną skalę emocji.

Przeczytaj więcej o używaniu emocjonalnego kontekstu w mowie AI

Ożywianie dialogów wielu postaci

Tworząc dialogi wielu postaci, możesz zaczynać każdą kwestię od audio tagu, by budować wyraziste rozmowy między postaciami. 

Spójrz na ten przykład: Tom: [coughing] [beginning to speak] przepraszam, jestem dziś trochę chory— Emma: [interrupting] —Chory? Wiesz, jak nie znoszę kaszlu, Tom! Tom: [surprised] To tylko lekki kaszel, nic poważnego. Jak byś się czuła, gdybym— Emma: [overlapping] [annoyed] —Myślę, że powinieneś iść do domu. 

Zobacz, co jeszcze możesz zrobić z dialogami wielu postaci w Eleven v3.

Precyzyjna kontrola wykonania mowy AI

Tempo mowy w Eleven v3 możesz kontrolować za pomocą audio tagów lub interpunkcji. Tagi takie jak [pause], [rushed] czy [drawn out] pozwalają precyzyjnie kształtować kwestię. Możesz też dodać wielokropki, kropki i wykrzykniki, aby naturalnie wprowadzić emocje do wykonania TTS.

Przygotowaliśmy szczegółowy przewodnik o precyzyjnej kontroli wykonania w Eleven v3.

Emocjonalne TTS jest dostępne w API

Audio tagi działają tak samo przez Text to Speech API jak w interfejsie ElevenLabs. Wpisz tag bezpośrednio w tekście skryptu, a API zwróci oznaczone nim wykonanie w wygenerowanym audio — od procesów tworzenia audiobooków po nałożone głosy do reklam. 

Dowiedz się więcej o Eleven v3 lub skontaktuj się z działem sprzedaży i zacznij już dziś.

FAQ: audio tagi i emocjonalne TTS

Podobne artykuły

Twórz z najwyższej jakości audio AI