Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

Hoppa till innehållet

Vi presenterar Eleven v4, vår mest uttrycksfulla modell

Publicerad

LyssnaLyssna på den här artikeln

En textrad kan förändras mycket beroende på hur den uttalas. ”Jag behöver att du håller dig lugn” bör låta olika beroende på vem som säger det – oavsett om det är en läkare som säger det varsamt till en rädd patient eller en spelkaraktär som ropar till sin grupp innan de kastar sig in i strid.

I dag lanserar vi Eleven v4, vår mest uttrycksfulla Text to Speech-modell hittills, och dess lågfördröjningsvariant Eleven v4 Turbo.

elevenv4 video cover

Rankad som nummer 1 av Artificial Analysis1, och föredragen av omkring 75 % av lyssnarna i blinda jämförande tester mot konkurrerande modeller2, är Eleven v4 utformad för att tolka tonfall, tempo, känslor, karaktär och sammanhang. Den genererar tal som kan låta dramatiskt, ömt, angeläget, komiskt eller samtalsmässigt, samtidigt som den bevarar talarens identitet. Mer naturlig dynamik mellan flera talare gör att samtal känns lyhörda, snarare än som separata repliker som satts ihop. Talarna reagerar på samtalets sammanhang, vilket ger mer naturliga dialoger och interaktioner mellan karaktärer.

Eleven v4 wins 65%–81% of blind head-to-head TTS preference tests.

En ny arkitektur byggd för prestanda

Eleven v4 bygger på en helt ny arkitektur och är vår mest uttrycksfulla Text to Speech-modell, rankad som nummer 1 av Artificial Analysis1. Eleven v4 Turbo tar samma teknik till användningsområden med låg fördröjning, som agenter. Med en medianfördröjning vid inferens på omkring 100 ms kan den svara snabbare än den genomsnittliga pausen mellan två personer som pratar.

Båda modellerna kan generera tal som känns uttrycksfullt snarare än mekaniskt. Ljudåtergivningen är också genomgående bättre, med renare och mer naturligt ljudande resultat. 

Tidigare generationer av text-till-tal-modeller kan läsa upp text, men Eleven v4 ger talet ett känslomässigt djup som känns betydligt mer naturligt. Modellen kan tolka avsedd ton, hur talet ska tempoläggas, skrivandets karaktär och sammanhanget i texten för att skapa känslomässigt träffsäkert tal.

[excited, happy] Big news, everyone. Our summer menu drops this Friday. And yes, the mango sticky rice is finally back.
0:00
[sleepy drowsy voice] Mmm, five more minutes. [yawning] I promise I'll get up right after this dream finishes.
0:00

Användare har också detaljerad kontroll över resultaten och kan beskriva hur en replik ska framföras med naturligt språk. De kan även lägga till specifika instruktioner om hur vissa fraser ska sägas, vilka känslor de ska förmedla och till och med ljudeffekter, med hjälp av infogade taggar som [laughs], [said angrily in French accent], [light rain] eller [phone buzzing]. Eleven v4 följer dessa ljudtaggar och instruktioner mer träffsäkert än tidigare modeller, så framförandet du beskriver är det du får. Det gör det enklare att regissera berättarröst, utveckla karaktärer och deras dialog eller annat där framförandet spelar roll. 

I utvecklardokumentationen för ElevenLabs finns hela taggsyntaxen och hur du använder dessa taggar via API:et. Stödet för fonem i det internationella fonetiska alfabetet (IPA) har också förbättrats avsevärt, så egna uttal fungerar mer tillförlitligt.

Eleven v4 ger också förbättringar i konsekvens och dynamiska samtal mellan flera talare. Med en ny metod för att fånga talares identiteter bevarar Eleven v4 varje rösts unika egenskaper. Den kan hålla talet konsekvent i agentsamtal, ljudböcker och annonser. Eftersom modellen förstår sammanhanget i en hel scen skapar den naturlig dialog där talarna reagerar på det som just sagts, i stället för att sätta ihop enskilda repliker.

En Turbo-modell för användningsområden med låg fördröjning

Röstmodeller av hög kvalitet har ofta varit långsammare på att generera tal, vilket har gjort att användare behövt välja mellan snabba eller uttrycksfulla röstagenter. Många har valt kompetenta men monotona agenter som kan uppfattas som robotaktiga av en stressad kund som bara vill lösa sitt problem. 

Eleven v4 Turbo kombinerar hastighet och känslor med en median tid till första tal på omkring 150 ms3, vilket gör det möjligt att använda kraftfulla agenter i otaliga branscher – från varma, lugnande agenter som kan uttala medicinska termer korrekt inom vården till snabbt pratande agenter som använder slang för att underhålla spelare i spel.

Median time to first speech: Eleven v4 Turbo is fastest at 150ms, versus 262–814ms.

Modellen Eleven v4 Turbo är byggd för att fungera med ElevenLabs plattform för konversationsagenter, ElevenAgents. Andra verktyg för att bygga agenter sätter ihop modeller och programvara från olika leverantörer, vilket gör att användare saknar möjlighet att förfina eller förbättra modellernas resultat för sina enskilda användningsområden. ElevenLabs forsknings- och ingenjörsteam har optimerat Eleven v4 Turbo och ElevenAgents tillsammans som ett system, för mer uttrycksfulla, tillförlitliga agenter med låg fördröjning.  

En röst, otaliga språk 

Sättet vi kommunicerar på varierar med sammanhang, plats och till och med tid på dygnet. Att skapa uttrycksfullt tal som speglar detta på olika språk är fortfarande en av de svåraste utmaningarna inom AI-ljud. 

Eleven v4 är ett steg framåt på alla dessa områden, och förbättringarna handlar om mer än bara hur modellen uttalar fraser. Eleven v4 fångar rytm, känslor och framförande bättre på olika språk, vilket hjälper kreatörer att skapa tal som känns naturligt för språket och sammanhanget. Hur du skulle prata med en äldre främling i Japan skiljer sig till exempel mycket från hur du skulle prata med samma person i Italien. 

Både Eleven v4 och Eleven v4 Turbo har stöd för fler än 90 språk. Nu kan en röst som spelats in på ett språk även tala vilket annat språk som helst flytande, med en infödd talares accent samtidigt som originalets identitet bevaras. Accenten följs märkbart bättre än tidigare, så rösten glider inte längre tillbaka mot sin ursprungsaccent under en generering.

Katalanska

Sovint caminem per la vida amb la mirada fixada en l'horitzó, preocupats pel demà, sense adonar-nos que el miracle real està passant just sota els nostres peus.
0:00

Spanska

El viento susurra historias olvidadas entre las hojas secas del parque. La ciudad aún duerme bajo un manto de neblina dorada, ajena al bullicio que pronto inundará sus calles. Un viejo farol parpadea por última vez antes de ceder su lugar a los primeros rayos del sol. En este preciso instante, el tiempo parece detenerse.
0:00

För dubbning och lokalisering innebär det att den varumärkesröst du har valt – oavsett om det är en känd skådespelare du samarbetar med eller ett tonfall som passar företagets stil bäst – kommer att låta bra på alla språk som stöds av Eleven v4.

Mer autentisk och konsekvent Voice Cloning

Voice Cloning är mer autentisk, kraftfull och konsekvent i Eleven v4 och Eleven v4 Turbo, med betydligt bättre likhet med den ursprungliga källrösten. Instant Voice Clones kan nu fånga röster med hög exakthet med bara 10 sekunders ljud. 

Riktig röst

Hey, thanks so much for holding. Um, so I've got your account pulled up now and it does look like the charge did go through twice on the eleventh which, yeah, definitely shouldn't have happened. Let me get that refund started for you right now.
0:00

Eleven v4

Hey, thanks so much for holding. Um, so I've got your account pulled up now, and it does look like the charge did go through twice on the 11th, which, yeah, definitely shouldn't have happened. Um, let me get that refund started for you right now.
0:00

Eleven v4 bevarar också talarens identitet mer tillförlitligt mellan genereringar, dialog, berättarröst och omgenererade repliker. Det innebär att karaktärer, berättare och klonade röster förblir konsekventa genom hela produktionen i längre projekt. Eleven v4 har också stöd för Professional Voice Clones (PVC), för användningsområden som kräver kloning med högsta möjliga exakthet.

Att kedja ihop förfrågningar – alltså att koppla samman genereringar för längre innehåll – är också betydligt mer tillförlitligt i Eleven v4, vilket förbättrar upplevelsen av att arbeta i ElevenLabs Studio och ElevenLabs Reader App.

Hör skillnaden själv  

Eleven v4 och Eleven v4 Turbo är resultatet av vår senaste forskning inom uttrycksfull talgenerering. De är byggda för innehåll där framförandet är lika viktigt som själva orden, oavsett om det handlar om ljudböcker, karaktärsframträdanden, voice-over, dubbning eller lokalisering av konversationsagenter.

Båda modellerna finns nu i ElevenAgents, ElevenCreative och via ElevenAPI. Skapa ett gratis konto och börja generera med Eleven v4 eller Eleven v4 Turbo redan i dag.

  1. Artificial Analysis, Provider Voice Arena Leaderboard, september 2026
  2. Baserat på blinda jämförande tester av användarpreferenser mot Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS och Google Gemini 3.8 Flash TTS, september 2026. För varje par fick bedömarna höra samma replik från Eleven v4 och en konkurrent, presenterade anonymt, och bedömde vilken som var mer uttrycksfull och vilken som lät naturligare. Oavgjorda resultat räknades som en halv.
  3. Mediantid från förfrågan till hörbart tal. Mätt i september 2026 med identiska manus och standardinställningar mot Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS och OpenAI GPT-4o mini TTS. Nätverksfördröjning mättes och togs bort för alla system. Eleven v4 Turbo via WebSocket-streaming.

Liknande artiklar

Skapa med AI-ljud av högsta kvalitet