Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

Emocjonalny Text to Speech: jak reżyserować głosy AI z Eleven v4

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Emocjonalny Text to Speech (TTS) zmienia skrypt w prawdziwy występ. Zamiast monotonnego odczytu, emocjonalny model TTS nadaje każdemu słowu uczucie, ożywiając scenę gniewem, radością, smutkiem, frustracją i nie tylko.

Wplatając Audio Tags w swój skrypt, kształtujesz wykonanie tekstu tak jak reżyser. Dodaj [furious], by podkręcić intensywność kwestii, [sarcastic], by dodać odrobinę suchego humoru, albo inny tag, by pokazać modelowi, jak ma ją odegrać. 

Z Eleven v4 masz emocjonalny TTS, który możesz reżyserować kwestia po kwestii. Zobacz, jak tworzyć skrypty, które ożywią twoje teksty.

Czym jest emocjonalny Text to Speech?

Emocjonalny Text to Speech to mowa generowana przez AI, która odgrywa kwestię, a nie tylko ją czyta. Wyraża emocje, rozumie rytm i tempo, akcentuje właściwe słowa oraz dodaje dźwięki niewerbalne, takie jak westchnienia i śmiech.

Eleven v4 to przełomowy model, który zmienia tekst w prawdziwy występ. Dzięki opisom w tekście to samo zdanie może zostać wyszeptane, wykrzyczane lub wypowiedziane przez łzy — zależnie od twojej wizji.

Niezależnie od tego, czy piszesz kampanię reklamową na kolejną premierę, czy ożywiasz rozdziały swojej powieści, Eleven v4 wesprze cię dzięki Text to Speech najwyższej jakości.

Jak Eleven v4 interpretuje wskazówki emocjonalne

Eleven v4 odczytuje wskazówki emocjonalne z Audio Tags w twoim skrypcie i zmienia je w naturalne wykonanie audio.

Oto kilka sposobów, by dodać emocjonalne wskazówki do tekstu w Eleven v4 i ulepszyć efekt końcowy:

  • Audio Tags: Dodaj Audio Tags do instrukcji, np. [whispers] lub [cries], by umieścić wskazówki bezpośrednio w skrypcie. Twórz sceny pełne emocji, reżyserując v4 jak każdego aktora na scenie.
  • Interpunkcja: Używaj interpunkcji wraz z Audio Tags, by kształtować tempo i sposób wypowiedzi. Wielokropki spowalniają kwestię, myślniki urywają wypowiedź w pół zdania, a wykrzykniki dodają intensywności — to kolejna warstwa reżyserii bez użycia tagu.
  • Ciągłość emocji: Zacznij zdanie od emocji, a Eleven v4 zachowa ten ton przez całą kwestię. Twórz sceny krok po kroku i buduj bogate, osadzone w kontekście skrypty z Audio Tags w v4.

Aby pokazać, jak skutecznie Audio Tags ożywiają tekst w v4, porównajmy przykład audio z tagami i bez nich.

W pierwszej próbce używamy zwykłego zdania. Dla odniesienia, w tych przykładach używamy głosu Siren.

Fragment opowieści bez Audio Tags w Eleven v4

The night was quiet, almost unnaturally so. Until I heard the old gate creak open behind me.
I turned slowly and called out, "Is anyone there?"
No answer.
Then, from somewhere in the darkness came a low, quiet laugh.
I took a step back. "You really shouldn't have come here," a voice whispered.
And then the lights went out.
0:00

W drugim przykładzie używamy tego samego zdania, ale dodajemy Audio Tags. Mamy wskazówki emocjonalne, efekty dźwiękowe i nawet dźwięki wykraczające poza tekst, jak złowrogi śmiech.

Fragment opowieści z Audio Tags w Eleven v4

[hesitant] The night was quiet, almost unnaturally so.
[nervous] Then I heard the old gate creak open behind me. [gate creaking] [scared] I turned slowly and called out, "Is anyone there?"
[tense, cautious] No answer.
[silence] [whispering, fearful] Then, from somewhere in the darkness, came a low, quiet laugh. [evil laugh] [alarmed] I took a step back. [footstep] [low, threatening] "You really shouldn't have come here." A voice whispered.
[whisper] [terrified] And then the lights went out. [light switch clicking]
0:00
Eleven v4 emotional text to speech uses audio tags, punctuation, and emotional continuity to direct emotion.

Pięć emocjonalnych wykonań Text to Speech z Eleven v4

Najlepszy sposób, by poznać pełnię możliwości Eleven v4, to wypróbować go samodzielnie. Po utworzeniu konta zaczniesz korzystać z Eleven v4 w kilka minut.

Aby pokazać ci możliwości tego emocjonalnego modelu Text to Speech, przedstawiamy jedną kwestię wygenerowaną pięć razy. Każda wersja ma inną wskazówkę sceniczną, co pokazuje dokładnie, co potrafi ten model.

Wszystkie pięć poniższych kart używa tekstu „Nie sądziłem, że naprawdę wrócisz.”, zmodyfikowanego za pomocą emocjonalnego Audio Tag. Dla odniesienia, w tych przykładach również używamy głosu Siren.

Dodawanie [furious]

Spółgłoski stają się twardsze, a głoski wybuchowe bardziej wyraziste. Kwestia brzmi gniewnie i jest oskarżeniem.

[furious]

[furious] I didn't think you'd actually come back
0:00

Dodawanie [excited]

Ton staje się wyższy, a tempo szybsze — ta sama fraza zmienia się w radosne powitanie.

[excited]

[excited] I didn't think you'd actually come back.
0:00

Dodawanie [sarcastic] 

Ton się spłaszcza, a samogłoski w słowach wydłużają. Sarkazm świetnie sprawdza się z Audio Tags, bo ton wypowiedzi bezpośrednio przeczy zapisanym słowom.

[sarcastic]

[sarcastic] I didn't think you'd actually come back.
0:00

Dodawanie [crying]

Ta wersja chwyta za serce. Wypowiedź zwalnia i urywa się w pół zdania. Zauważysz, że duże znaczenie ma tu praca oddechem.

[crying]

[crying] I didn't think you'd actually come back.
0:00

Dodawanie [worried]

Ciszej i z lekkim wahaniem — [worried] odbiera kwestii pewność.

[worried] I didn't think you'd actually come back.
0:00

Wskazówki do pisania skryptów dla AI

Aplikację ElevenLabs Text to Speech stworzyliśmy tak, by była jak najbardziej intuicyjna. Otwórz stronę i zacznij pisać albo dodaj opisowe Audio Tags, by umieścić w scenie konkretne dźwięki lub emocje

Oto kilka dodatkowych wskazówek, które pomogą ci uzyskać najlepsze efekty z emocjonalnym Text to Speech w Eleven v4:

  1. Dopracowuj wskazówki: Jeśli kwestia nie brzmi tak, jak chcesz, zmień tag zamiast przepisywać tekst. Wypróbuj [worried] zamiast [sad] albo [sarcastic] zamiast [annoyed] i generuj ponownie, aż wykonanie będzie zgodne z twoją wizją.
  2. Generuj całe sceny naraz: Zdania generowane osobno mogą dawać niuansowane wykonanie, jak pokazaliśmy wyżej, ale Eleven v4 działa najlepiej z akapitami lub dłuższymi fragmentami tekstu. Gdy model dostanie dość tekstu, by zrozumieć kontekst sceny, lepiej wykona cały fragment. W aplikacji TTS Eleven v4 możesz wpisać do 10 000 znaków na jedną generację.
  3. Używaj jednej emocji na frazę: Możesz dodać kilka Audio Tags w zdaniu, ale najlepiej użyć jednego dla każdego fragmentu zdania, by uniknąć niejasności. Przeciwstawne emocje w instrukcjach mogą pogorszyć dokładność wyniku. Możesz też dodać tag przed konkretną częścią zdania, a po niej nowy tag, jeśli chcesz zmienić emocję w trakcie wypowiedzi. 

Dzięki tym wskazówkom szybko zmienisz tekst w prawdziwy występ.

Three tips for AI-ready scripts: iterate, generate full scenes, and use one emotion per phrase.

Zacznij korzystać z Eleven v4 do emocjonalnego Text to Speech

Wszystko, co zobaczyłeś w tym artykule, zostało wygenerowane w aplikacji ElevenLabs Text to Speech za pomocą skryptu, głosu i kilku Audio Tags w Eleven v4.

Aby tworzyć własne sceny, wybierz głos, wklej napisaną przez siebie kwestię i wyreżyseruj swój pierwszy występ.

Dowiedz się więcej o Eleven v4 lub zarejestruj się, aby zacząć swoją pierwszą generację.

FAQ: emocjonalny Text to Speech AI

Podobne artykuły

Twórz z najwyższej jakości audio AI