Przedstawiamy Eleven v4, nasz najbardziej emocjonalny model
- Opublikowano
PosłuchajPosłuchaj tego artykułu
Znaczenie tekstu może się bardzo zmienić zależnie od tego, jak zostanie wypowiedziany. „Musisz zachować spokój” zabrzmi inaczej, gdy mówi to lekarz łagodnie zwracający się do przestraszonego pacjenta, a inaczej, gdy postać z gry krzyczy do swojego oddziału przed skokiem do walki.
Dziś wprowadzamy Eleven v4, nasz najbardziej emocjonalny dotąd model zamiany tekstu na mowę, oraz jego wariant o niskich opóźnieniach, Eleven v4 Turbo.

Model Eleven v4 zajął 1. miejsce w rankingu Artificial Analysis1 i został wybrany przez ok. 75% słuchaczy w ślepych testach porównawczych z konkurencyjnymi modelami2. Zaprojektowaliśmy go tak, by rozumiał ton, tempo, emocje, charakter i kontekst. Tworzy mowę, która może brzmieć dramatycznie, czule, pilnie, komediowo lub konwersacyjnie, zachowując tożsamość mówiącego. Bardziej naturalna dynamika wielu rozmówców sprawia, że rozmowy brzmią jak prawdziwe interakcje, a nie złożone osobne kwestie. Mówcy reagują na kontekst rozmowy, tworząc bardziej naturalne dialogi i interakcje między postaciami.

Nowa architektura stworzona z myślą o wydajności
Eleven v4, zbudowany na całkowicie nowej architekturze, to nasz najbardziej emocjonalny model Text to Speech, zajmujący 1. miejsce w rankingu Artificial Analysis1. Eleven v4 Turbo przenosi tę samą technologię do zastosowań o niskich opóźnieniach, takich jak agenci. Przy medianie opóźnienia inferencji wynoszącej ok. 100 ms może odpowiadać szybciej niż trwa średnia przerwa między wypowiedziami dwóch osób.
Oba modele generują mowę, która brzmi emocjonalnie, a nie mechanicznie. Jakość audio jest też wyższa pod każdym względem, a wynik brzmi czyściej i bardziej naturalnie.
Wcześniejsze generacje modeli zamiany tekstu na mowę potrafią odczytać tekst na głos, ale Eleven v4 nadaje mowie głębię emocjonalną, dzięki której brzmi znacznie naturalniej. Model interpretuje zamierzony ton, tempo wypowiedzi, charakter tekstu i jego kontekst, by tworzyć mowę, która porusza.
Użytkownicy mają też precyzyjną kontrolę nad wynikami i mogą opisać naturalnym językiem, jak dana kwestia ma zostać wypowiedziana. Mogą również dodawać szczegółowe instrukcje dotyczące wymowy konkretnych fraz, emocji, które mają wyrażać, a nawet efektów dźwiękowych, używając tagów w tekście, takich jak [laughs], [said angrily in French accent], [light rain] czy [phone buzzing]. Eleven v4 dokładniej niż wcześniejsze modele stosuje się do tych tagów audio i wskazówek, więc otrzymujesz dokładnie taki sposób wypowiedzi, jaki opiszesz. Ułatwia to reżyserowanie narracji, rozwijanie postaci i ich dialogów oraz inne zastosowania, w których sposób wypowiedzi ma znaczenie.
Pełną składnię tagów i sposób używania ich przez API znajdziesz w dokumentacji dla deweloperów ElevenLabs. Znacznie ulepszyliśmy też obsługę fonemów Międzynarodowego Alfabetu Fonetycznego (IPA), dzięki czemu własne wymowy działają bardziej niezawodnie.
Eleven v4 poprawia też spójność i dynamikę rozmów z udziałem wielu mówców. Dzięki nowej metodzie uchwytywania tożsamości mówców Eleven v4 zachowuje unikalne cechy każdego głosu. Potrafi utrzymać spójność mowy w rozmowach agentów, audiobookach i reklamach. Ponieważ model rozumie kontekst całej sceny, tworzy naturalne dialogi, w których mówcy reagują na to, co właśnie usłyszeli, zamiast łączyć odizolowane kwestie.
Model Turbo do zastosowań o niskich opóźnieniach
Modele głosowe wysokiej jakości zwykle generowały mowę wolniej, więc użytkownicy musieli wybierać między szybkimi a ekspresyjnymi agentami głosowymi. Wielu wybierało sprawnych, lecz monotonnych agentów, którzy mogą brzmieć robotycznie dla zestresowanego klienta chcącego po prostu rozwiązać swój problem.
Eleven v4 Turbo łączy szybkość i emocje, a mediana czasu do pierwszej wypowiedzi wynosi ok. 150 ms3. Dzięki temu możesz wdrażać zaawansowanych agentów w niezliczonych branżach: od ciepłych, uspokajających agentów, którzy poprawnie wymawiają terminy medyczne w ochronie zdrowia, po szybko mówiących agentów posługujących się slangiem, którzy bawią graczy.

Model Eleven v4 Turbo został stworzony do pracy z platformą agentów konwersacyjnych ElevenLabs, ElevenAgents. Twórcy innych agentów łączą modele i oprogramowanie różnych dostawców, przez co użytkownicy nie mają możliwości dopracowania ani ulepszenia wyników modelu pod swoje konkretne zastosowania. Zespoły badawcze i inżynieryjne ElevenLabs zoptymalizowały Eleven v4 Turbo i ElevenAgents jako jeden system, zapewniając bardziej ekspresyjnych, niezawodnych agentów o niskich opóźnieniach.
Jeden głos, mnóstwo języków
Sposób, w jaki się komunikujemy, zależy od kontekstu, miejsca, a nawet pory dnia. Tworzenie ekspresyjnej mowy, która to odzwierciedla w różnych językach, pozostaje jednym z najtrudniejszych wyzwań w audio AI.
Eleven v4 to postęp we wszystkich tych obszarach, a ulepszenia wykraczają poza samą wymowę fraz. Eleven v4 lepiej oddaje rytm, emocje i sposób wypowiedzi w różnych językach, pomagając twórcom generować mowę naturalną dla danego języka i kontekstu. Na przykład do starszej nieznajomej osoby w Japonii zwrócisz się zupełnie inaczej niż we Włoszech.
Zarówno Eleven v4, jak i Eleven v4 Turbo obsługują ponad 90 języków. Głos nagrany w jednym języku może teraz płynnie mówić w każdym innym, przyjmując akcent rodzimego użytkownika języka i zachowując tożsamość oryginału. Odwzorowanie akcentu jest wyraźnie lepsze niż wcześniej, więc głos nie wraca już stopniowo do swojego źródłowego akcentu w trakcie generowania.
Kataloński
Hiszpański
W dubbingu i lokalizacji oznacza to, że wybrany przez ciebie głos marki — niezależnie od tego, czy należy do aktora, z którym współpracujesz, czy najlepiej pasuje do stylu twojej firmy — będzie świetnie brzmieć w każdym języku obsługiwanym przez Eleven v4.
Bardziej autentyczne i spójne klonowanie głosu
Klonowanie głosu w Eleven v4 i Eleven v4 Turbo jest bardziej autentyczne, zaawansowane i spójne, a podobieństwo mówcy do oryginalnego głosu źródłowego jest znacznie większe. Instant Voice Clones mogą teraz wiernie uchwycić głos na podstawie zaledwie 10 sekund audio.
Prawdziwy głos
Eleven v4
Eleven v4 niezawodniej zachowuje też tożsamość mówcy w generacjach, dialogach, narracji i regenerowanych kwestiach. Dzięki temu w długich projektach postacie, narratorzy i sklonowane głosy pozostają spójne przez całą produkcję. Eleven v4 dodaje także obsługę Professional Voice Clones (PVC) do zastosowań wymagających najwyższej jakości klonowania.
Łączenie żądań — łączenie generacji w dłuższe treści — jest również znacznie bardziej niezawodne w Eleven v4, co ułatwia pracę w ElevenLabs Studio i aplikacji Reader od ElevenLabs.
Usłysz różnicę
Eleven v4 i Eleven v4 Turbo są efektem naszych najnowszych badań nad generowaniem ekspresyjnej mowy. Stworzyliśmy je z myślą o treściach, w których sposób wypowiedzi jest równie ważny jak same słowa — audiobookach, kreacjach postaci, nałożonych głosach, dubbingu czy lokalizacji agentów konwersacyjnych.
Oba modele są już dostępne w ElevenAgents, ElevenCreative i przez ElevenAPI. Utwórz darmowe konto i zacznij generować z Eleven v4 lub Eleven v4 Turbo już dziś.
- Artificial Analysis, ranking Provider Voice Arena, wrzesień 2026
- Na podstawie ślepych testów preferencji użytkowników, porównujących model z Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS i Google Gemini 3.8 Flash TTS, przeprowadzonych we wrześniu 2026 r. Dla każdej pary oceniający słyszeli tę samą kwestię z Eleven v4 i od jednego konkurenta, przedstawione bez wskazania modelu, a następnie oceniali, która była bardziej ekspresyjna i która brzmiała bardziej naturalnie; remisy liczyły się jako pół punktu.
- Mediana czasu od żądania do słyszalnej mowy. Pomiar przeprowadzono we wrześniu 2026 r. na identycznych skryptach i domyślnych ustawieniach, porównując z Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS i OpenAI GPT-4o mini TTS; opóźnienie sieciowe zmierzono i usunięto dla wszystkich systemów. Eleven v4 Turbo przez streaming WebSocket.




