Introducing Eleven v4Introducing Eleven v4, our fastest and most emotive voice model

Zum Inhalt springen

Wir stellen vor: Eleven v4, unser emotionalstes Modell

Veröffentlicht

AnhörenArtikel anhören

Eine Textzeile kann je nach Sprechweise völlig anders wirken. „Ich brauche Sie jetzt ganz ruhig“ sollte anders klingen, je nachdem, wer es sagt: ob ein Arzt es einem verängstigten Patienten behutsam mitteilt oder eine Figur in einem Spiel es ihrem Trupp vor dem Sprung in die Schlacht zuruft.

Heute stellen wir Eleven v4 vor, unser bisher ausdrucksstärkstes Text-to-Speech-Modell, sowie seine Variante mit niedriger Latenz, Eleven v4 Turbo.

elevenv4 video cover

Auf Platz 1 bei Artificial Analysis1 und in Blindtests im direkten Vergleich von rund 75 % der Zuhörer gegenüber konkurrierenden Modellen bevorzugt2, wurde Eleven v4 entwickelt, um Tonfall, Tempo, Emotionen, Charakter und Kontext zu verstehen. Es erzeugt Sprache, die dramatisch, einfühlsam, dringlich, komisch oder dialogisch klingen kann, ohne die Identität des Sprechers zu verlieren. Natürlichere Dynamiken zwischen mehreren Sprechern lassen Gespräche reaktionsfähig wirken, statt wie zusammengesetzte Einzelzeilen. Sprecher reagieren auf den Gesprächskontext und erzeugen so natürlichere Dialoge und Charakterinteraktionen.

Eleven v4 wins 65%–81% of blind head-to-head TTS preference tests.

Eine neue Architektur für Leistung

Eleven v4 basiert auf einer vollständig neuen Architektur und ist unser ausdrucksstärkstes Text to Speech-Modell auf Platz 1 bei Artificial Analysis1. Eleven v4 Turbo bringt dieselbe Technologie in Anwendungen mit niedriger Latenz wie Agents. Mit einer medianen Inferenzlatenz von etwa 100 ms kann es schneller antworten als die durchschnittliche Pause zwischen zwei sprechenden Personen.

Beide Modelle erzeugen Sprache, die ausdrucksstark statt mechanisch wirkt. Auch die Audiotreue ist durchgehend höher, mit klareren und natürlicher klingenden Ergebnissen. 

Frühere Generationen von Text-to-Speech-Modellen können Text vorlesen, doch Eleven v4 verleiht Sprache eine emotionale Tiefe, die deutlich natürlicher wirkt. Das Modell versteht den gewünschten Tonfall, das Sprechtempo, den Charakter des Textes und seinen Kontext, um emotional wirkungsvolle Sprache zu erzeugen.

[excited, happy] Big news, everyone. Our summer menu drops this Friday. And yes, the mango sticky rice is finally back.
0:00
[sleepy drowsy voice] Mmm, five more minutes. [yawning] I promise I'll get up right after this dream finishes.
0:00

Nutzer haben zudem detaillierte Kontrolle über die Ergebnisse und können in natürlicher Sprache beschreiben, wie eine Zeile gesprochen werden soll. Sie können auch konkrete Anweisungen dazu geben, wie bestimmte Formulierungen ausgesprochen werden sollen, welche Emotion sie vermitteln sollen und sogar Soundeffekte hinzufügen – mit Inline-Tags wie [laughs], [said angrily in French accent], [light rain] oder [phone buzzing]. Eleven v4 befolgt diese Audiotags und Regieanweisungen präziser als frühere Modelle. So erhalten Sie die Sprechweise, die Sie beschreiben. Das erleichtert die Regie bei Erzählungen, die Ausarbeitung von Figuren und Dialogen sowie alle anderen Bereiche, in denen die Darbietung zählt. 

Die ElevenLabs-Entwicklerdokumentation beschreibt die vollständige Tag-Syntax und wie Sie diese Tags über die API einsetzen. Auch die Unterstützung für Phoneme des Internationalen Phonetischen Alphabets (IPA) wurde deutlich verbessert, sodass benutzerdefinierte Aussprachen zuverlässiger funktionieren.

Eleven v4 verbessert außerdem die Konsistenz und dynamische Gespräche zwischen mehreren Sprechern. Mit einer neuen Methode zur Erfassung von Sprecheridentitäten bewahrt Eleven v4 die einzigartigen Eigenschaften jeder Stimme. Es hält Sprache in Agent-Gesprächen, Hörbüchern und Werbung konsistent. Da das Modell den Kontext einer ganzen Szene versteht, erzeugt es natürliche Dialoge, in denen Sprecher auf das zuvor Gesagte reagieren, statt isolierte Zeilen aneinanderzureihen.

Ein Turbo-Modell für Anwendungen mit niedriger Latenz

Hochwertige Stimmenmodelle erzeugen Sprache meist langsamer. Nutzer mussten sich daher zwischen schnellen und ausdrucksstarken Voice Agents entscheiden. Viele wählten leistungsfähige, aber monotone Agents, die auf verunsicherte Kunden mit einem konkreten Anliegen roboterhaft wirken können. 

Eleven v4 Turbo kombiniert Geschwindigkeit und Emotion mit einer medianen Zeit bis zur ersten Sprachausgabe von etwa 150 ms3. Dadurch lassen sich leistungsstarke Agents in unzähligen Branchen einsetzen: von warmherzigen, beruhigenden Agents im Gesundheitswesen, die medizinische Fachbegriffe korrekt aussprechen, bis zu schnell sprechenden Agents mit Slang, die Spieler im Gaming unterhalten.

Median time to first speech: Eleven v4 Turbo is fastest at 150ms, versus 262–814ms.

Das Modell Eleven v4 Turbo wurde für die Zusammenarbeit mit ElevenAgents, der Plattform für dialogorientierte Agents von ElevenLabs, entwickelt. Andere Agent-Builder kombinieren Modelle und Software verschiedener Anbieter. Dadurch fehlt Nutzern eine Möglichkeit, die Modellergebnisse für ihre individuellen Anwendungsfälle zu verfeinern oder zu verbessern. Die Forschungs- und Entwicklungsteams von ElevenLabs haben Eleven v4 Turbo und ElevenAgents gemeinsam als ein System optimiert. Das Ergebnis sind ausdrucksstärkere, zuverlässigere Agents mit niedriger Latenz.  

Eine Stimme, unzählige Sprachen 

Wie wir kommunizieren, hängt vom Kontext, dem Ort und sogar der Tageszeit ab. Ausdrucksstarke Sprache zu entwickeln, die dies sprachübergreifend widerspiegelt, bleibt eine der schwierigsten Aufgaben der Audio-KI. 

Eleven v4 ist in all diesen Bereichen besser, und die Verbesserungen gehen weit über die Aussprache einzelner Formulierungen hinaus. Eleven v4 erfasst Rhythmus, Emotion und Darbietung sprachübergreifend besser und hilft Kreativen, Sprache zu erzeugen, die sich für Sprache und Kontext natürlich anfühlt. Wie Sie beispielsweise mit einer älteren fremden Person in Japan sprechen würden, unterscheidet sich stark davon, wie Sie sie in Italien ansprechen würden. 

Sowohl Eleven v4 als auch Eleven v4 Turbo unterstützen mehr als 90 Sprachen. Eine in einer Sprache aufgenommene Stimme spricht nun auch jede andere Sprache fließend, übernimmt dabei den Akzent eines Muttersprachlers und behält zugleich die Identität des Originals. Die Akzenttreue ist spürbar stärker als zuvor. Die Stimme driftet im Verlauf einer Generierung nicht mehr zu ihrem ursprünglichen Akzent zurück.

Katalanisch

Sovint caminem per la vida amb la mirada fixada en l'horitzó, preocupats pel demà, sense adonar-nos que el miracle real està passant just sota els nostres peus.
0:00

Spanisch

El viento susurra historias olvidadas entre las hojas secas del parque. La ciudad aún duerme bajo un manto de neblina dorada, ajena al bullicio que pronto inundará sus calles. Un viejo farol parpadea por última vez antes de ceder su lugar a los primeros rayos del sol. En este preciso instante, el tiempo parece detenerse.
0:00

Für Synchronisation und Lokalisierung bedeutet das: Die von Ihnen gewählte Markenstimme – ob es sich um einen prominenten Schauspieler handelt, mit dem Sie arbeiten, oder um einen Tonfall, der am besten zum Stil Ihres Unternehmens passt – klingt in jeder von Eleven v4 unterstützten Sprache überzeugend.

Authentischeres, konsistenteres Klonen von Stimmen

Das Klonen von Stimmen ist mit Eleven v4 und Eleven v4 Turbo authentischer, leistungsstärker und konsistenter. Die Sprecherähnlichkeit mit der ursprünglichen Quellstimme ist deutlich besser. Instant Voice Clones können Stimmen jetzt mit nur 10 Sekunden Audio in hoher Qualität erfassen. 

Echte Stimme

Hey, thanks so much for holding. Um, so I've got your account pulled up now and it does look like the charge did go through twice on the eleventh which, yeah, definitely shouldn't have happened. Let me get that refund started for you right now.
0:00

Eleven v4

Hey, thanks so much for holding. Um, so I've got your account pulled up now, and it does look like the charge did go through twice on the 11th, which, yeah, definitely shouldn't have happened. Um, let me get that refund started for you right now.
0:00

Eleven v4 bewahrt die Sprecheridentität zudem zuverlässiger über Generierungen, Dialoge, Erzählungen und neu generierte Zeilen hinweg. Bei Langformat-Projekten bleiben Figuren, Erzähler und geklonte Stimmen dadurch während der gesamten Produktion konsistent. Eleven v4 unterstützt jetzt auch Professional Voice Clones (PVC) für Anwendungsfälle, die höchste Klonqualität erfordern.

Auch Request Stitching – das Verketten von Generierungen für längere Inhalte – ist in Eleven v4 deutlich zuverlässiger. Das verbessert die Arbeit mit ElevenLabs Studio und der ElevenLabs Reader App.

Hören Sie den Unterschied selbst  

Eleven v4 und Eleven v4 Turbo sind das Ergebnis unserer neuesten Forschung zur Erzeugung ausdrucksstarker Sprache. Sie sind für Inhalte entwickelt, bei denen die Darbietung genauso wichtig ist wie die Worte selbst – ob Hörbücher, Charakterdarstellungen, Voiceovers, Synchronisation oder die Lokalisierung dialogorientierter Agents.

Beide Modelle sind jetzt in ElevenAgents, ElevenCreative und über die ElevenAPI verfügbar. Kostenloses Konto erstellen und noch heute mit Eleven v4 oder Eleven v4 Turbo generieren.

  1. Artificial Analysis, Provider Voice Arena Leaderboard, Sept. 2026
  2. Basiert auf Blindtests zur Nutzerpräferenz im direkten Vergleich mit Cartesia Sonic 3.6, Inworld TTS-2, Google Gemini 3.8 Flash-Lite TTS und Google Gemini 3.8 Flash TTS, September 2026. Für jedes Paar hörten die Bewerter dieselbe Zeile von Eleven v4 und einem Wettbewerber, ohne zu wissen, welches Modell welche Ausgabe erzeugt hatte, und beurteilten, welche ausdrucksstärker und welche natürlicher klang; Gleichstände zählten zur Hälfte.
  3. Mediane Zeit von der Anfrage bis zur hörbaren Sprache. Gemessen im September 2026 mit identischen Skripten und Standardeinstellungen gegenüber Cartesia Sonic 3.6, xAI TTS, Google Gemini Flash-Lite TTS und OpenAI GPT-4o mini TTS; die Netzwerklatenz wurde für alle Systeme gemessen und herausgerechnet. Eleven v4 Turbo über WebSocket-Streaming.

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio