Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

Jak dodawać pauzy w nałożonym głosie AI z Eleven v4

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

W modelu AI Text to Speech liczy się sposób przekazu. Jakość głosu i znajomość prozodii mają duże znaczenie, ale bez odpowiedniego tempa zdanie się rozpada. Dodatkowy moment po kwestii lub dłuższa cisza mogą być kluczowe dla wysokiej jakości efektu. 

Zwykłe narzędzia Text to Speech pozostawiają pauzy przypadkowi. Jedna generacja może dać efekt, którego szukasz, ale zniknie on przy kolejnym kliknięciu regeneracji. Eleven v4 oferuje lepsze workflow regeneracji, więc to już przeszłość. W skrypcie łatwo dopracujesz pojedyncze kwestie lub frazy. 

Aby od razu stworzyć jak najlepszy skrypt, Eleven v4 daje ci trzy sposoby na dodawanie pauz w nałożonym głosie AI bezpośrednio w tekście. Oto jak działa każdy z nich i kiedy warto go użyć.

Posłuchaj Eleven v4 w akcji

Odkryj Eleven v4
ExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTiredExcitedPlayfulPeacefulAmazedAnxiousFrustratedScaredTired

Podsumowanie

  • Tagi SSML nie działają w Eleven v4. System korzysta z Audio Tags, czyli wskazówek scenicznych, takich jak [long pause] lub [whispers], wpisywanych bezpośrednio w skrypt.
  • Zmiana interpunkcji pozwala sterować rytmem zdania: myślniki, wielokropki i krótkie zdania wpływają na brzmienie generowanego TTS.
  • Aby pauzy brzmiały dobrze, umieszczaj je tam, gdzie naturalnie zatrzymałby się człowiek.
  • W długich materiałach audio stosuj te same zasady pauz, aby zachować spójność efektu.

Co zmieniło się względem wcześniejszych modeli?

Wcześniejsze modele ElevenLabs, takie jak Multilingual v2, obsługiwały składnię SSML. Pauzę w środku zdania można było dodać konstrukcją <break time=”2.0s” />, która tworzyła 2-sekundową przerwę. Eleven v4 rozwija podejście wprowadzone w Eleven v3, zastępując tagi SSML znacznie bardziej intuicyjną alternatywą — Audio Tags.

Dla autorów ta zmiana znacznie ułatwia tworzenie pauz w nałożonym głosie AI. Nie musisz znać dokładnego tagu SSML — wystarczy pisać naturalnie, a [pause] i [long pause] zrobią resztę. Te tagi stają się wskazówkami dla modelu, który reaguje na nie i wykorzystuje kontekst sceny, aby stworzyć dopracowaną końcową interpretację. Długość pauzy pasuje do chwili, zamiast być z góry ustaloną, mechaniczną przerwą ciszy.

Choć nie jest to temat tego artykułu, możesz też używać Audio Tags, aby tworzyć emocjonalne Text to Speech dzięki zmianie emocji w obrębie akapitu. 

Comparison shows Eleven v3/v4 use contextual audio tags instead of fixed SSML pauses.

Trzy sposoby sterowania pauzami w Eleven v4

Eleven v4 oferuje trzy sposoby dodawania pauz w nałożonym głosie AI. 

Pokażemy, jak każdy z nich działa w praktyce w naszym edytorze tekstu, oraz opiszemy wrażenie, jakie daje na przykładzie audio.

Eleven v4 pause controls: [pause], [long pause], and punctuation, with context-based timing. Discover how to add pauses in AI voiceover with these tags

[pause]

Pauza to krótka przerwa. Jest mniej więcej jak oddech lub naturalny moment, który mówca robi przed dalszą częścią zdania. Najlepiej użyć Audio Tag [pause] po zdaniu wprowadzającym, między dwiema myślami, które chcesz oddzielić, po frazie wymagającej dodatkowego podkreślenia lub wszędzie tam, gdzie sama kropka brzmi zbyt pośpiesznie.

W poniższym przykładzie używamy tej samej kwestii z Audio Tag [pause] i bez niego. Nawet bez odsłuchiwania klipów zauważysz, że jeden trwa cztery sekundy, a drugi sześć. Dodatkowe momenty zapewniane przez [pause] sumują się w końcowych klipach.

Przykład z [pause]

[Nervous] I walked up to the door. [pause] Knocked three times. [pause] No answer.
0:00

Powyższe klipy wygenerowano głosem Flint w Eleven v4.

[long pause]

Długa pauza jest bardziej celowa i tworzy momenty ciszy w klipach audio. Możesz wykorzystać ją do budowania napięcia, między scenami, przed ujawnieniem czegoś lub wszędzie tam, gdzie chcesz podkreślić ciszę.

Oto przykład [long pause] w scenie.

Hands trembling, he opened the letter. [long pause] He set it down and left without saying a word.
0:00

Ten klip audio został nagrany głosem Spuds Oxley w Eleven v4.

Interpunkcja

Eleven v4 traktuje interpunkcję jako wskazówkę dotyczącą tempa. Wielokropek spowalnia sposób wypowiedzenia kwestii, dzięki czemu możesz tworzyć momenty zawahania. Zmiana struktury zdań przełamuje monotonię dłuższego fragmentu. Krótko. Dynamicznie. Wprost.

Choć możesz używać Audio Tags w całym skrypcie — i warto to robić, by poprawić sposób przekazu — sama interpunkcja też daje dużo możliwości.

W poniższym fragmencie zobaczysz, jak bardzo interpunkcja ożywia tekst, nawet bez Audio Tags.

The door creaked open slowly, as if afraid of what might be on the other side. He took the step, waited, listened. Nothing. Then, from the corner of the room, the floorboard creaked.
0:00

Ten fragment audio ożył dzięki głosowi Lauren B w Eleven v4.

Pauzy w długich materiałach audio

Generowanie długich materiałów audio działa najlepiej, gdy stosujesz spójne podejście w całym skrypcie. Na przykład, jeśli przez pierwsze 1500 znaków używasz tylko interpunkcji, a w ostatnich 1000 znakach zaczynasz dodawać Audio Tags [long pause], efekt może brzmieć dziwnie.

Przed napisaniem skryptu zdecyduj, jakie podejście chcesz przyjąć. Jeśli już go napisałeś, pamiętaj o konsekwentnym stosowaniu Audio Tags w całym tekście. Przycisk „v4 Enhance” obok „Generate speech” automatycznie doda Audio Tags do twojego tekstu.

Guidance on where to use pauses and long pauses, with a rule to stay consistent.

Zacznij korzystać z Eleven v4 w ElevenCreative

Eleven v4 ożywia twoje sceny.

Kontrolując tempo tekstu i dodając Audio Tags, możesz tworzyć bogate interpretacje głosowe z użyciem ponad 17 500 głosów z naszej Voice Library.

Przeczytaj pełny przewodnik po emocjonalnym Text to Speech aby dowiedzieć się więcej, lub zarejestruj się i zacznij swoją pierwszą generację już dziś.

FAQ: dodawanie pauz w nałożonym głosie AI

Podobne artykuły

Twórz z najwyższej jakości audio AI