Przejdź do treści

Czym są tagi audio? Kompletny przewodnik po emocjonalnym TTS

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Tagi audio to wskazówki w nawiasach kwadratowych, takie jak [laughs], [gasps], [excited] i [worried], które Eleven v3 odczytuje jako wskazówki wykonawcze, a nie słowa do wypowiedzenia. Gdy piszesz skrypt dla modelu zamiany tekstu na mowę, tagi audio dają ci precyzyjną kontrolę nad emocjonalnym przekazem tekstu. 

Eleven v3 został publicznie udostępniony w marcu 2026 roku. Przed v3 uzyskanie konkretnego emocjonalnego wykonania z modelu Text to Speech wymagało ponownego generowania treści i liczenia na najlepsze. Tagi audio eliminują to zgadywanie i dają ci pełną kontrolę nad emocjonalnym wykonaniem zamiany tekstu na mowę.

Ten przewodnik wyjaśnia, czym są tagi audio, jak działają, jakie są ich kategorie i jak wypadają na tle SSML (Speech Synthesis Markup Language). Omówimy też typowe zastosowania — każde z linkiem do osobnego przewodnika.

Podsumowanie:

  • Tagi audio to wskazówki w nawiasach kwadratowych, takie jak [shouts] czy [excited], które sterują emocjami, tempem, sposobem mówienia i tonem TTS w Eleven v3.
  • Eleven v3 nie obsługuje SSML, ale zastępuje go tagami audio, dzięki czemu pisanie jest bardziej naturalne.
  • Tagi należą do kilku kategorii, m.in. emocji, sposobu mówienia i tempa, ludzkich reakcji, akcentów oraz efektów dźwiękowych.
  • Interpunkcja i wielkie litery pozwalają ci kształtować tempo wypowiedzi głosu AI.
  • Z tagów audio w ElevenLabs możesz korzystać w UI lub przez API.

Jak działają tagi audio?

Tagi audio umieszczasz bezpośrednio w transkrypcji, w nawiasach kwadratowych. Gdy chcesz zmienić sposób mówienia, na przykład z normalnego na [worried], po prostu dodaj tag audio.

Możesz też użyć kilku tagów w jednym zdaniu i łączyć je, aby uzyskać bardziej złożone wykonanie, np. [tired] It’s been a long day… [upset] How many more days can I take?

Architektura Eleven v3 pozwala modelowi lepiej rozumieć kontekst niż wcześniejsze modele. Dzięki temu rozpoznaje wskazówki emocjonalne, zmiany tonu, przejścia między mówcami i kontekst bez osobnych parametrów czy ustawień. Po prostu powiedz modelowi, czego wymaga dana chwila, a wykona kwestię zgodnie z twoim planem.

Eleven v3 obsługuje też spontanicznie brzmiące dialogi wielu osób — z przerwami, zmianami nastroju i naturalną wymianą zdań — wyłącznie na podstawie tagów i struktury skryptu. 

Tagi audio a SSML

Jeśli korzystasz z innych systemów TTS, prawdopodobnie znasz Speech Synthesis Markup Language. Platformy takie jak Amazon Polly i Microsoft Azure Speech używają tagów SSML, np. <break> czy <emphasis>, aby dodać kontekst do skryptu TTS. 

Eleven v3 nie obsługuje tagów przerw SSML ani pozostałych tagów SSML. Zamiast nich tę rolę przejmują tagi audio, interpunkcja i sama struktura tekstu, nadal dając precyzyjną kontrolę nad wykonaniem.

W tabeli poniżej możesz porównać popularne tagi SSML z ich odpowiednikami w Eleven v3.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Z perspektywy autora dodanie [whispers] do kwestii wymaga znacznie mniej wysiłku niż ustawienie tempa prozodii.

Kategorie tagów audio w v3: sterowanie wykonaniem za pomocą tagów audio

Tagi audio możesz umieścić w dowolnym miejscu skryptu, aby na bieżąco kształtować sposób mówienia. Możesz też łączyć tagi w skrypcie, a nawet w jednym zdaniu.

Tagi dzielą się na następujące główne kategorie.

Emocje

Te tagi pomagają określić emocjonalny ton głosu — ponury, intensywny lub pogodny. Możesz na przykład użyć jednego tagu albo połączyć [sad], [angry], [happily] i [sorrowful].

Background
Background

Sposób mówienia i tempo

Dotyczą bardziej tonu i wykonania. Za ich pomocą dostosujesz głośność i energię w scenach wymagających powściągliwości lub siły. Przykłady to [whispers], [shouts] i [softly].

Background
Background

Ludzkie reakcje

Naturalna mowa zawiera reakcje. Możesz dodać realizmu, wplatając w wypowiedź naturalne, nieskryptowane momenty. Tagi takie jak [laughs], [clears throat] i [sighs] pomagają modelowi TTS oddać ludzkie emocje.

Inne przykłady kategorii tagów audio:

  • Akcenty i głosy postaci: Tagi akcentów zmieniają głos na konkretny region lub postać bez zmiany modelu, np. [French accent], [British accent] czy [pirate voice]. Dzięki nim jeden głos staje się elastyczną obsadą, a nie jednym stałym wykonaniem.
  • Efekty dźwiękowe: Tagi efektów dźwiękowych dodają dźwięki inne niż mowa bezpośrednio do generacji, np. [gunshot], [explosion] i [clapping]. Sprawdzają się w immersyjnym audio, grach i narracji dramatycznej, gdy scena potrzebuje czegoś więcej niż głosu. Możesz też użyć generatora efektów dźwiękowych AI ElevenCreative.

Tagi dają ci dużą kontrolę, ale rytm i akcent możesz też kształtować interpunkcją. Dodaj wielokropek, aby uzyskać naturalną pauzę, albo przecinki, by odwzorować naturalny oddech. Aby dodać nacisk, zapisz słowo wielkimi literami: „Chcę tego WŁAŚNIE TERAZ”.

Background
Background

Co możesz zrobić z tagami audio?

Tagi audio pozwalają intuicyjnie wykorzystać emocjonalną złożoność skryptów. Pisz naturalnie i dodawaj tagi w trakcie.

Oto kilka zastosowań emocjonalnego TTS z tagami audio.

Świadomość sytuacyjna w audio AI

Tagi takie jak [whisper] czy [shouting] pozwalają Eleven v3 reagować na sytuację. Od złagodzenia ostrzeżenia po wydłużoną pauzę budującą napięcie — możesz wprowadzić do skryptu dynamiczną świadomość sytuacyjną.

Pełne omówienie znajdziesz w naszym przewodniku o świadomości sytuacyjnej w audio AI.

Reżyserowanie postaci w mowie

Tworząc skrypt z wieloma postaciami, chcesz wyraźnie pokazać, czym różni się każdy głos. Od zmiany osobowości za pomocą [sarcastically] po określenie sposobu mówienia przez [British accent] — nasz silnik TTS pozwala uchwycić pełen zakres emocji.

Dowiedz się więcej o reżyserowaniu postaci w mowie AI.

Wyrażanie kontekstu emocjonalnego w mowie

Tagi audio pozwalają kształtować emocjonalny przekaz kwestii w miarę jej rozwoju. Możesz budować emocje przez całą wypowiedź, osiągając kulminację w momencie, w którym twoja postać pokazuje pełnię możliwości. Tagi takie jak [awe], [booming] i [big laugh] pomagają wprowadzić pełną gamę emocji do wypowiedzi głosu AI.

Przeczytaj więcej o używaniu kontekstu emocjonalnego w mowie AI

Ożywianie dialogów wielu postaci

Tworząc dialogi wielu postaci, możesz rozpoczynać każdą kwestię tagiem audio, aby budować bogate rozmowy między bohaterami. 

Oto przykład: Tom: [coughing] [beginning to speak] przepraszam, jestem dziś trochę chory— Emma: [interrupting] —Chory? Wiesz, jak nie znoszę kaszlu, Tom! Tom: [surprised] To tylko lekki kaszel, nic poważnego. Co byś powiedziała, gdybym— Emma: [overlapping] [annoyed] —Myślę, że powinieneś iść do domu. 

Zobacz, co jeszcze możesz zrobić z dialogami wielu postaci w Eleven v3.

Precyzyjna kontrola sposobu mówienia w mowie AI

W Eleven v3 możesz sterować tempem mowy za pomocą tagów audio lub interpunkcji. Tagi takie jak [pause], [rushed] czy [drawn out] pozwalają precyzyjnie kształtować kwestię. Możesz też dodać wielokropki, kropki i wykrzykniki, aby naturalnie wprowadzić emocje do wykonania TTS.

Przygotowaliśmy szczegółowy przewodnik o precyzyjnej kontroli sposobu mówienia w Eleven v3.

Emocjonalne TTS jest dostępne przez API

Tagi audio działają przez Text to Speech API tak samo jak w UI ElevenLabs. Wpisz tag bezpośrednio w tekście skryptu, a API zwróci wygenerowane audio z odpowiednim wykonaniem — od procesów tworzenia audiobooków po głosy do reklam. 

Dowiedz się więcej o Eleven v3 lub skontaktuj się ze sprzedażą i zacznij już dziś.

FAQ: tagi audio i emocjonalne TTS

Podobne artykuły

Twórz z najwyższej jakości audio AI