Unsere bisher ausdrucksstärksten Modelle
und v4 Turbo
Erstellen Sie steuerbare, ausdrucksstarke Sprache mit Emotionen, Audioereignissen und immersiven Klanglandschaften.
Eleven v4
Unser schnellstes und emotionalstes Sprachmodell
Eleven v4 basiert auf einer völlig neuen Architektur, die ein Skript wie ein Sprecher liest. Sie weiß, wer spricht, was gerade passiert ist und wie jede Zeile wirken soll.

John – Moderator, theatralisch
Sia – gesprächig, britisch
John – Moderator, theatralisch
John – Moderator, theatralischEin Spektrum an Emotionen und Klängen
Sprache in über 90 Sprachen mit einer außergewöhnlichen emotionalen Bandbreite, mehreren Sprecherinnen und Sprechern sowie integrierten Soundeffekten für die passende Szene.

Auf einer neuen Architektur aufgebaut
Anweisungen direkt ins Skript schreiben
Fügen Sie Anweisungen wie [laughs], [whispers] und [door slams] direkt ins Skript ein. Eleven v4 folgt Tag-Sequenzen zuverlässiger als v3 – einschließlich Soundeffekten.
Lange Audios nahtlos verbinden
Context Stitching hält Tempo und Sprechweise über Skripte jeder Länge hinweg konstant. Ein vollständiges Hörbuch klingt von der ersten bis zur letzten Seite wie in einem Take aufgenommen.
Ohne Stimmabweichungen neu generieren
Generieren Sie eine Zeile einmal oder fünfzigmal neu – es spricht immer dieselbe Person. Die Sprecherstabilität bleibt bei Dialogen, Erzählungen und allem dazwischen erhalten.
Einen Professional Voice Clone auswählen
Professional Voice Clones wurden in v3 nicht unterstützt. In Eleven v4 sind sie wieder verfügbar und liefern die volle emotionale Bandbreite des Modells in jeder Sprache, die sie sprechen.
Eleven v4 Turbo
Einführung in Eleven v4 Turbofür Echtzeit und Agents
Unser schnellstes Echtzeit-Sprachmodell mit der Ausdrucksvielfalt von Eleven v4, verfügbar über die API und ElevenAgents. Eleven v4 Turbo erreicht eine mediane Inferenzlatenz von etwa 150 ms und bleibt auch in langen Interaktionen konsistent.
Antwortzeiten, die Anrufer nicht bemerken
Mit einer medianen Zeit bis zur ersten Sprachausgabe von 150 ms verschwindet die Latenz, und Gespräche fließen reibungslos.
In einem echten Anruf erleben
Erfahren Sie von einem damit betriebenen Agenten mehr über Eleven v4 Turbo.
Für Live-Gespräche optimiert
Text streamen, Audio erhalten
Senden Sie Text, während Ihr LLM ihn erzeugt, und Audio kommt zurück, bevor der Satz fertig ist. Bidirektionales Streaming für Agent-Schleifen.
Ausdruck bei Gesprächsgeschwindigkeit
Turbo bietet die gesamte Ausdrucksvielfalt von Eleven v4. Bestätigungen, Eskalationen und Wartezeiten klingen unterschiedlich, statt identisch vorgelesen zu werden.
Eine Stimme über jeden Gesprächszug hinweg
Professional Voice Clones funktionieren mit beiden Modellen identisch. So bleibt eine Markenstimme vom ersten bis zum letzten Gesprächszug konsistent.
Sprachen wie Einheimische sprechen
Geben Sie japanischen, spanischen oder portugiesischen Text ein, und die Stimme spricht ihn fließend mit muttersprachlichem Akzent.





Wählen Sie aus über 17.500 Stimmen



Wählen Sie aus über 17.500 Stimmen



Erzählstimmen Ein Ort für Geschichtenerzähler. Warm, souverän und über jedes Projekt hinweg konsistent.
Konversationsstimmen Für alltägliche Gespräche brauchen Sie eine natürliche, lockere Stimme. Unsere Konversationsstimmen sind für Dialoge und Podcasts gemacht, die ungeplant wirken sollen.
Social-Media-Stimmen Stimmen, die in Kurzformaten lebendig werden. Fangen Sie die Energie und Persönlichkeit ein, die Nutzerinnen und Nutzer von Anfang bis Ende bei Ihrem TikTok oder Reel hält.
Charakterstimmen Ein Pool an Stimmen für Ihre fiktive Welt. Wählen Sie aus einer dynamischen Besetzung, die Ihr Spiel, Hörbuch oder Ihre Animation zum Leben erweckt.
Bildungsstimmen Vertrauenswürdige, geduldige Stimmen, die Lernende durch komplexe Themen führen. Ideal für Kurse, Tutorials, Trainingssimulationen und Anleitungen jeder Stufe.
Werbestimmen Ausgefeilte, selbstbewusste Stimmen für Ihren nächsten Produktverkauf. Ideal für digitale Werbung sowie TV- und Radiowerbung.
Unterhaltungsstimmen Von eindringlichen Filmtrailern bis zu komödiantischen Performance-Stimmen: Diese Stimmen haben Persönlichkeit. Für Inhalte, bei denen die Darbietung genauso zählt wie das Material.
Mehrsprachige Stimmen Stimmen für globale Inhalte. Natürliches Tempo, idiomatische Ausdrücke und Akzente, die Zielgruppen in jedem Markt erreichen.
Wir haben die Einführung von Agentforce Voice durch deterministische Steuerung skaliert. Von Kunden hören wir immer wieder, dass sie darauf vertrauen, weil jede Aktion eines Agenten fundiert und kontrolliert ist, statt improvisiert zu sein. Ein wichtiger Teil dieser Strategie ist das Gleichgewicht zwischen Determinismus und hochwertigen, emotional intelligenten Sprachmodellen. Genau hier setzt Eleven v4 Turbo neue Maßstäbe: mit schnelleren, natürlicheren Antworten, die den Standard unserer Kunden erfüllen – und ihnen ermöglichen, Agentforce Voice für noch mehr Anwendungsfälle einzusetzen.
In der Zusammenarbeit mit Hunderten Verlagen, um deren Journalismus als Audio bereitzustellen, sehen wir unmittelbar, wie wichtig Stimmqualität ist. Seit der Partnerschaft mit ElevenLabs verzeichnen viele unserer Verlage höheres Engagement und längere Hörzeiten. Eleven v4 bietet Verlagen mehr Möglichkeiten, damit diese Stimmen ansprechend, vertraut und unverwechselbar klingen.
ElevenLabs v4 verleiht Sprachgesprächen ein neues Niveau an Natürlichkeit. Stimmen sind nicht nur ausdrucksstärker, sondern auch besser steuerbar. So können wir reichhaltigere, immersivere Spracherlebnisse schaffen.
Als ich Eleven v4 zum ersten Mal genutzt habe, klang es so klar und lebensecht, als würde ich eine Session mit Sprecherinnen und Sprechern in der Kabine leiten.
Wir suchten ein Sprachmodell, das schnell genug für ein echtes Gespräch ist, ohne Qualität einzubüßen. Eleven v4 Turbo ist das erste, das beides bietet. Für automatisierte Vertriebsworkflows ist das der Punkt, an dem Entwickeln nicht mehr wie ein Experiment wirkt.
Bestimmen Sie den Klangbevor es ein Wort sagt
Jede Generierung beginnt mit einer Stimme. Klonen Sie eine vorhandene Stimme, erstellen Sie eine aus einer Beschreibung oder korrigieren Sie mit IPA-Unterstützung die Aussprache bestimmter Wörter.


KI-Stimme klonen
Klonen Sie eine Stimme aus zehn Sekunden Audio oder trainieren Sie einen Professional Voice Clone für eine nahezu perfekte Übereinstimmung.
Stimmendesign
Beschreiben Sie eine Stimme in einem Satz und generieren Sie sie – ohne Aufnahmesession oder Casting.
Aussprachewörterbuch
Legen Sie fest, wie Namen, Akronyme und technische Begriffe ausgesprochen werden. Definieren Sie die Phonetik einmal, und jede Generierung verwendet sie.
Kostenlos loslegenUpgraden Sie, wenn Sie mehr brauchen
Über die API verfügbarBringen Sie Eleven v4 in Ihre App
Entwickeln Sie mit Eleven v4 Turbo Echtzeit-Erlebnisse und Voice Agents – alles über die ElevenAPI.
Zugriff auf die API für Eleven v4 und Eleven v4 Turbo
Fügen Sie jedem Produkt ausdrucksstarke Sprache hinzu – mit unserer REST API, Streaming-Endpunkten oder den TypeScript- und Python-SDKs.
- Modelle mit einer einzigen model_id wechseln
- Text streamen und Audio in Echtzeit erhalten
- Kontinuität bei Langform-Generierungen erhalten


