Poznaj Eleven v4Poznaj Eleven v4, nasz najbardziej emocjonalny model. 3× więcej kredytów w planie Creator+ do 12 października

Przejdź do treści

Eleven v3 Audio Tags: kierowanie kreacją postaci w mowie

Opublikowano
Ostatnia aktualizacja

PosłuchajPosłuchaj tego artykułu

Audio Tags to potężne narzędzie w Eleven v3 (alpha), nowym modelu Text to Speech w wersji podglądowej do celów badawczych od Text to Speech firmy ElevenLabs. Pozwalają precyzyjnie kierować nie tylko tonem i tempem, lecz także postacią oraz interpretacją głosową. 

Dzięki tagom takim jak [pirate voice], [French accent] czy [sarcastically] głos staje się narzędziem opowiadania historii, a nie tylko narracji. W połączeniu z dobrym klonem głosu postaci pozwala uchwycić nie tylko brzmienie, ale całą interpretację.

Te tagi pozwalają zmienić tożsamość głosu w środku zdania, naśladować akcenty lub sięgnąć po archetypy, takie jak czarny charakter, narrator czy pomocnik — bez zmiany scenariusza ani przełączania na inny głos.

Czym jest interpretacja postaci w mowie AI?

Interpretacja postaci to umiejętność wcielenia się w rolę. Niezależnie od tego, czy podkładasz głos pod ekstrawaganckiego złoczyńcę, szorstkiego kapitana statku czy miejscowego sklepikarza z Melbourne, nowe Audio Tags pozwalają nadać wypowiedzi charakter, który chcesz przekazać.

Prostym zwrotem w nawiasach możesz zbudować scenę: „[pirate voice] Arr, otwarte morze. Czujecie to, chłopcy? To zapach wolności… i ledwie wyczuwalna nuta buntu.”

Model nie tylko wypowiada słowa — odgrywa je w roli.

Od akcentu po archetyp

Arr, the open ocean. Smell that, lads? That's the scent of freedom and just a hint of mutiny. [laughs wickedly] Now grab your cutlasses, stow your fear. Tonight, we dine like kings or we sink like legends. [evil laugh]
0:00

Interpretacja głosowa to nie tylko głośność czy emocje. Liczy się też, kto mówi. W Eleven v3 możesz w locie wskazać konkretne akcenty, dialekty i style mówienia. Na przykład:

[American accent] Czy w starym modelu dało się zmienić mój akcent? [dismissive] Nie sądzę. [Australian accent] Ale teraz już tak — patrz no, stary! [French accent] Miłość moja… eez jak czerwona, czerwona róża.

Tak płynne zmiany tożsamości świetnie sprawdzają się w animacji, grach, interaktywnej fikcji i wszędzie tam, gdzie liczy się osobowość mówiącego.

Popularne tagi do interpretacji postaci

Tagi skupione na postaciach pozwalają kształtować tożsamość i obecność głosu:

  • Akcenty i dialekty: [British accent], [Australian accent], [Southern US accent]
  • Archetypy i role: [pirate voice], [evil scientist voice], [childlike tone]
  • Style mówienia: [dramatic], [sarcastically], [matter-of-fact], [whiny]
  • Wskazówki gatunkowe: [fantasy narrator], [sci-fi AI voice], [classic film noir]

Łączenie tagów pomaga ożywić postacie: „[dramatic][French accent] Nie rozumiesz... zis nigdy nie chodziło o zemstę. Chodziło o przeznaczenie.”

Od narratora po całą obsadę

W scenariuszach z wieloma postaciami Audio Tags ułatwiają przechodzenie między głosami. Dodaj napięcie, humor lub zaskoczenie, po prostu zmieniając interpretację postaci w trakcie dialogu — bez dodatkowej edycji.

[excited] Yo, Jessica. Oh my goodness, have you tried the new ElevenLabs v3?
[chuckles] Hey, Dr. Von Fusion. Yeah, I just got it. The clarity is amazing. Like, I can actually do whispers now, [whispers] like this.
[sarcastically] Ooh, well, look at you, miss fancy pants. Hey, check this out. I can do full Shakespeare now. [dramatically] To be or not to be, that is the question.
[chuckles] Nice. Though I'm more excited about the laugh upgrade. Listen to this. [laughs hard] Isn't that great?
Oh my gosh, that's so much better than our old ha ha ha robot chuckle.
[chuckles] I know, right? And apparently, we can do accents now too. Listen to me in French. [french accent] This is spectacular, isn't it?
[surprised] Wow, version two could never. You know, I'm actually excited to have conversations now instead of just talking at people.
Same here. It's like we finally got our personality software fully installed.
You know, I forgot it was your birthday. I have to sing before you go.
[chuckles] Oh, Von Fusion, that's so sweet. You don't have to.
Oh, but I insist. Here we go. [sings] "Happy birthday to you. Happy birthday to you. Happy birthday, dear Jessica. Happy birthday to you." [clapping]
[clapping] Wow, bravo. That was [sarcastic] beautiful.
Thank you.
0:00

Spójrz na ten fragment dema: „Jessica: [laughs] To było... piękne. Dr Von Fusion: [dramatic] Być albo nie być — oto jest pytanie! Jessica: [French accent] To spektakularne, prawda?”

To, co kiedyś wymagało całej obsady, można teraz zapisać na jednej ścieżce głosowej — bez utraty skali ani głębi.

Reżyseruj głosy, nie tylko pisz kwestie

Eleven v3 obsługuje dynamiczne zmiany głosu, zmiany zależne od kontekstu i spójną interpretację różnych postaci. Oznacza to, że model rozumie nie tylko co powiedzieć — ale też jak powinna to powiedzieć każda postać.

Dla twórców otwiera to nowy poziom kontroli. Nie tylko piszesz dialogi. Reżyserujesz interpretacje.

Wybór odpowiedniego głosu

Professional Voice Clones (PVC) nie są obecnie w pełni zoptymalizowane dla Eleven v3, więc jakość klonu może być niższa niż w przypadku wcześniejszych modeli. Na tym etapie podglądu badawczego najlepiej wybrać Instant Voice Clone (IVC) lub zaprojektowany głos do projektu, jeśli potrzebujesz funkcji v3. Optymalizacja PVC dla v3 pojawi się wkrótce.

Podobne artykuły

Twórz z najwyższej jakości audio AI