Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

Przejdź do treści

Przedstawiamy Eleven v4, nasz najbardziej emocjonalny model

Opublikowano

PosłuchajPosłuchaj tego artykułu

Znaczenie tekstu może się bardzo zmienić zależnie od tego, jak zostanie wypowiedziany. „Musisz zachować spokój” zabrzmi inaczej, gdy mówi to lekarz łagodnie zwracający się do przestraszonego pacjenta, a inaczej, gdy postać z gry krzyczy do swojego oddziału przed skokiem do walki.

Dziś wprowadzamy Eleven v4, nasz najbardziej emocjonalny dotąd model zamiany tekstu na mowę, oraz jego wariant o niskich opóźnieniach, Eleven v4 Turbo.

elevenv4 video cover

Model Eleven v4 zajął 1. miejsce w rankingu Artificial Analysis1 i został wybrany przez ok. 75% słuchaczy w ślepych testach porównawczych z konkurencyjnymi modelami2. Zaprojektowaliśmy go tak, by rozumiał ton, tempo, emocje, charakter i kontekst. Tworzy mowę, która może brzmieć dramatycznie, czule, pilnie, komediowo lub konwersacyjnie, zachowując tożsamość mówiącego. Bardziej naturalna dynamika wielu rozmówców sprawia, że rozmowy brzmią jak prawdziwe interakcje, a nie złożone osobne kwestie. Mówcy reagują na kontekst rozmowy, tworząc bardziej naturalne dialogi i interakcje między postaciami.

Eleven v4 wins 65%–81% of blind head-to-head TTS preference tests.

Nowa architektura stworzona z myślą o wydajności

Eleven v4, zbudowany na całkowicie nowej architekturze, to nasz najbardziej emocjonalny model Text to Speech, zajmujący 1. miejsce w rankingu Artificial Analysis1. Eleven v4 Turbo przenosi tę samą technologię do zastosowań o niskich opóźnieniach, takich jak agenci. Przy medianie opóźnienia inferencji wynoszącej ok. 100 ms może odpowiadać szybciej niż trwa średnia przerwa między wypowiedziami dwóch osób.

Oba modele generują mowę, która brzmi emocjonalnie, a nie mechanicznie. Jakość audio jest też wyższa pod każdym względem, a wynik brzmi czyściej i bardziej naturalnie. 

Wcześniejsze generacje modeli zamiany tekstu na mowę potrafią odczytać tekst na głos, ale Eleven v4 nadaje mowie głębię emocjonalną, dzięki której brzmi znacznie naturalniej. Model interpretuje zamierzony ton, tempo wypowiedzi, charakter tekstu i jego kontekst, by tworzyć mowę, która porusza.

[excited, happy] Big news, everyone. Our summer menu drops this Friday. And yes, the mango sticky rice is finally back.
0:00
[sleepy drowsy voice] Mmm, five more minutes. [yawning] I promise I'll get up right after this dream finishes.
0:00

Użytkownicy mają też precyzyjną kontrolę nad wynikami i mogą opisać naturalnym językiem, jak dana kwestia ma zostać wypowiedziana. Mogą również dodawać szczegółowe instrukcje dotyczące wymowy konkretnych fraz, emocji, które mają wyrażać, a nawet efektów dźwiękowych, używając tagów w tekście, takich jak [laughs], [said angrily in French accent], [light rain] czy [phone buzzing]. Eleven v4 dokładniej niż wcześniejsze modele stosuje się do tych tagów audio i wskazówek, więc otrzymujesz dokładnie taki sposób wypowiedzi, jaki opiszesz. Ułatwia to reżyserowanie narracji, rozwijanie postaci i ich dialogów oraz inne zastosowania, w których sposób wypowiedzi ma znaczenie. 

Pełną składnię tagów i sposób używania ich przez API znajdziesz w dokumentacji dla deweloperów ElevenLabs. Znacznie ulepszyliśmy też obsługę fonemów Międzynarodowego Alfabetu Fonetycznego (IPA), dzięki czemu własne wymowy działają bardziej niezawodnie.

Eleven v4 poprawia też spójność i dynamikę rozmów z udziałem wielu mówców. Dzięki nowej metodzie uchwytywania tożsamości mówców Eleven v4 zachowuje unikalne cechy każdego głosu. Potrafi utrzymać spójność mowy w rozmowach agentów, audiobookach i reklamach. Ponieważ model rozumie kontekst całej sceny, tworzy naturalne dialogi, w których mówcy reagują na to, co właśnie usłyszeli, zamiast łączyć odizolowane kwestie.

Model Turbo do zastosowań o niskich opóźnieniach

Modele głosowe wysokiej jakości zwykle generowały mowę wolniej, więc użytkownicy musieli wybierać między szybkimi a ekspresyjnymi agentami głosowymi. Wielu wybierało sprawnych, lecz monotonnych agentów, którzy mogą brzmieć robotycznie dla zestresowanego klienta chcącego po prostu rozwiązać swój problem. 

Eleven v4 Turbo łączy szybkość i emocje, a mediana czasu do pierwszej wypowiedzi wynosi ok. 150 ms3. Dzięki temu możesz wdrażać zaawansowanych agentów w niezliczonych branżach: od ciepłych, uspokajających agentów, którzy poprawnie wymawiają terminy medyczne w ochronie zdrowia, po szybko mówiących agentów posługujących się slangiem, którzy bawią graczy.

Median time to first speech: Eleven v4 Turbo is fastest at 150ms, versus 262–814ms.

Model Eleven v4 Turbo został stworzony do pracy z platformą agentów konwersacyjnych ElevenLabs, ElevenAgents. Twórcy innych agentów łączą modele i oprogramowanie różnych dostawców, przez co użytkownicy nie mają możliwości dopracowania ani ulepszenia wyników modelu pod swoje konkretne zastosowania. Zespoły badawcze i inżynieryjne ElevenLabs zoptymalizowały Eleven v4 Turbo i ElevenAgents jako jeden system, zapewniając bardziej ekspresyjnych, niezawodnych agentów o niskich opóźnieniach.  

Jeden głos, mnóstwo języków 

Sposób, w jaki się komunikujemy, zależy od kontekstu, miejsca, a nawet pory dnia. Tworzenie ekspresyjnej mowy, która to odzwierciedla w różnych językach, pozostaje jednym z najtrudniejszych wyzwań w audio AI. 

Eleven v4 to postęp we wszystkich tych obszarach, a ulepszenia wykraczają poza samą wymowę fraz. Eleven v4 lepiej oddaje rytm, emocje i sposób wypowiedzi w różnych językach, pomagając twórcom generować mowę naturalną dla danego języka i kontekstu. Na przykład do starszej nieznajomej osoby w Japonii zwrócisz się zupełnie inaczej niż we Włoszech. 

Zarówno Eleven v4, jak i Eleven v4 Turbo obsługują ponad 90 języków. Głos nagrany w jednym języku może teraz płynnie mówić w każdym innym, przyjmując akcent rodzimego użytkownika języka i zachowując tożsamość oryginału. Odwzorowanie akcentu jest wyraźnie lepsze niż wcześniej, więc głos nie wraca już stopniowo do swojego źródłowego akcentu w trakcie generowania.

Kataloński

Sovint caminem per la vida amb la mirada fixada en l'horitzó, preocupats pel demà, sense adonar-nos que el miracle real està passant just sota els nostres peus.
0:00

Hiszpański

El viento susurra historias olvidadas entre las hojas secas del parque. La ciudad aún duerme bajo un manto de neblina dorada, ajena al bullicio que pronto inundará sus calles. Un viejo farol parpadea por última vez antes de ceder su lugar a los primeros rayos del sol. En este preciso instante, el tiempo parece detenerse.
0:00

W dubbingu i lokalizacji oznacza to, że wybrany przez ciebie głos marki — niezależnie od tego, czy należy do aktora, z którym współpracujesz, czy najlepiej pasuje do stylu twojej firmy — będzie świetnie brzmieć w każdym języku obsługiwanym przez Eleven v4.

Bardziej autentyczne i spójne klonowanie głosu

Klonowanie głosu w Eleven v4 i Eleven v4 Turbo jest bardziej autentyczne, zaawansowane i spójne, a podobieństwo mówcy do oryginalnego głosu źródłowego jest znacznie większe. Instant Voice Clones mogą teraz wiernie uchwycić głos na podstawie zaledwie 10 sekund audio. 

Prawdziwy głos

Hey, thanks so much for holding. Um, so I've got your account pulled up now and it does look like the charge did go through twice on the eleventh which, yeah, definitely shouldn't have happened. Let me get that refund started for you right now.
0:00

Eleven v4

Hey, thanks so much for holding. Um, so I've got your account pulled up now, and it does look like the charge did go through twice on the 11th, which, yeah, definitely shouldn't have happened. Um, let me get that refund started for you right now.
0:00

Eleven v4 niezawodniej zachowuje też tożsamość mówcy w generacjach, dialogach, narracji i regenerowanych kwestiach. Dzięki temu w długich projektach postacie, narratorzy i sklonowane głosy pozostają spójne przez całą produkcję. Eleven v4 dodaje także obsługę Professional Voice Clones (PVC) do zastosowań wymagających najwyższej jakości klonowania.

Łączenie żądań — łączenie generacji w dłuższe treści — jest również znacznie bardziej niezawodne w Eleven v4, co ułatwia pracę w ElevenLabs Studio i aplikacji Reader od ElevenLabs.

Usłysz różnicę  

Eleven v4 i Eleven v4 Turbo są efektem naszych najnowszych badań nad generowaniem ekspresyjnej mowy. Stworzyliśmy je z myślą o treściach, w których sposób wypowiedzi jest równie ważny jak same słowa — audiobookach, kreacjach postaci, nałożonych głosach, dubbingu czy lokalizacji agentów konwersacyjnych.

Oba modele są już dostępne w ElevenAgents, ElevenCreative i przez ElevenAPI. Utwórz darmowe konto i zacznij generować z Eleven v4 lub Eleven v4 Turbo już dziś.

  1. Artificial Analysis, ranking Provider Voice Arena, wrzesień 2026
  2. Na podstawie ślepych testów preferencji użytkowników, porównujących model z Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS i Google Gemini 3.8 Flash TTS, przeprowadzonych we wrześniu 2026 r. Dla każdej pary oceniający słyszeli tę samą kwestię z Eleven v4 i od jednego konkurenta, przedstawione bez wskazania modelu, a następnie oceniali, która była bardziej ekspresyjna i która brzmiała bardziej naturalnie; remisy liczyły się jako pół punktu.
  3. Mediana czasu od żądania do słyszalnej mowy. Pomiar przeprowadzono we wrześniu 2026 r. na identycznych skryptach i domyślnych ustawieniach, porównując z Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS i OpenAI GPT-4o mini TTS; opóźnienie sieciowe zmierzono i usunięto dla wszystkich systemów. Eleven v4 Turbo przez streaming WebSocket.

Podobne artykuły

Twórz z najwyższej jakości audio AI