Eleven v4
Unser neuestes und fortschrittlichstes Text to Speech-Modell.
Eleven v4 ist unser neuestes und fortschrittlichstes Text to Speech-Modell und das erste einer neuen Modellgeneration. Im Vergleich zu Eleven v3 verbessert es Ausgabequalität, Stimmgenauigkeit, Konsistenz, Emotion, Vortragsweise, Audio-Tags und Sprachabdeckung.
Generell ist Eleven v4 ein klares Upgrade gegenüber Eleven v3 und liefert in fast allen Fällen bessere Ergebnisse. Wir empfehlen dringend, auf v4 umzusteigen und es mit Ihren eigenen Stimmen und Inhalten zu testen, um den Unterschied selbst zu erleben. Einige Sonderfälle erfordern möglicherweise eine andere Lösung, doch für die meisten Nutzer ist v4 die bessere Wahl.
Informationen zu Tags, Zeichensetzung und Dialog-Prompting finden Sie unter Prompting Eleven v4.
KI-Stimme klonen
Die Genauigkeit beim Klonen von Stimmen macht mit Eleven v4 einen großen Schritt nach vorn. Geklonte Stimmen erfassen die Eigenschaften der Ausgangsstimme – Klangfarbe, Rhythmus und Vortragsweise – getreuer als jedes vorherige Modell.
Instant Voice Clones (IVCs) sind in Eleven v4 präziser als je zuvor. Sie erfassen die prägenden Merkmale einer Ausgangsstimme getreuer. So lässt sich aus einer kurzen Audioaufnahme schneller ein überzeugender Klon erstellen.
Professional Voice Clones (PVCs) werden in Eleven v4 vollständig unterstützt. Sie bauen auf denselben Fortschritten bei der Stimmgenauigkeit auf und bieten eine getreuere Wiedergabe der Ausgangsstimme für Workflows, die ein Höchstmaß an Konsistenz und Kontrolle erfordern.
Aufgrund dieses deutlichen Genauigkeitssprungs kann Eleven v4 wesentlich anders klingen als Eleven v3. Eleven v3 legte mit einem starken Fokus auf Vortragsweise und Genauigkeit die Grundlage für Eleven v4. Eleven v4 baut darauf mit deutlich verbesserter Stimmgenauigkeit auf. Dadurch erfasst Eleven v4 die Ausgangsstimme getreuer, auch wenn Sie möglicherweise bevorzugen, wie eine Stimme in Eleven v3 klang. Genauigkeit und persönliche Vorliebe sind nicht immer dasselbe. Wir empfehlen daher, beide Versionen mit Ihren eigenen Inhalten zu vergleichen, um die beste Lösung für Ihren Anwendungsfall zu wählen.
Da Eleven v4 die Eigenschaften der Ausgangsstimme – einschließlich Akzent, Vortragsweise, Lautstärke und anderer markanter Merkmale – getreuer wiedergibt, ist die Qualität der Ausgangsaufnahme wichtiger denn je. Klare, saubere Trainingsaudiodaten helfen Eleven v4, die Stimme präzise zu erfassen, ohne unerwünschte Geräusche oder Merkmale einzuführen. Hintergrundgeräusche, Verzerrungen oder andere Aufnahmeprobleme können das Ergebnis beeinträchtigen.
Wir experimentieren noch mit Eleven v4, um zu verstehen, wie es sich am besten einsetzen lässt. Bisher scheint es nuancierte Audiodaten deutlich besser zu erfassen, insbesondere bei umfangreichen Trainingsaudiodaten wie bei Professional Voice Clones. Unsere Empfehlungen zur Verwendung vielfältiger Trainingsdaten können sich ändern, während wir weiter testen, wie sich das Modell mit einem vielseitigeren Datensatz steuern lässt. Derzeit empfehlen wir, bei Ihren Trainingsaudiodaten bei einem einzigen Sprechstil zu bleiben. Eleven v4 sollte diesen besser erfassen als frühere Modelle.
Umgang mit nativen Akzenten
Dies ist eine der größten Änderungen von Eleven v4 gegenüber allen älteren Modellen, und sie sollte klar verstanden werden.
Wenn die Sprache, die Sie generieren, der Sprache Ihrer Referenzstimme entspricht, bleibt der ursprüngliche Akzent genau wie bisher erhalten.
Wenn sich die Sprache, die Sie generieren, von der Sprache der Referenzstimme unterscheidet, erzeugt Eleven v4 flüssige, natürlich klingende Sprache in der Zielsprache – statt den Akzent der Referenzstimme aus ihrer ursprünglichen Sprache zu übernehmen.
In der Praxis: Wenn Sie eine Stimme eines koreanischen Sprechers klonen und Englisch generieren, erzeugt Eleven v4 natürliches, flüssiges Englisch statt Englisch mit koreanischem Akzent. Dadurch ist jede Stimme in jeder unterstützten Sprache nutzbar. Das ist besonders nützlich für Synchronisationen, mehrsprachige Inhalte und Sprachagenten, die Nutzer mit einer einzelnen Stimme in verschiedenen Sprachen bedienen müssen.
Wenn Ihr Workflow davon abhängt, dass eine Stimme ihren nativen Akzent in andere Sprachen überträgt, testen Sie dieses Verhalten vor der Migration direkt mit Eleven v4 – es ist eine bewusste Änderung der sprachübergreifenden Generierung, kein Fehler.
Diese neue Funktion wird jedoch noch weiter optimiert. Wir prüfen Möglichkeiten, sie als Umschalter anzubieten, statt sie immer zu aktivieren. Das ist weiterhin ein Forschungsprojekt. Daher haben wir derzeit keinen Zeitplan und keine weiteren Informationen dazu.
Modellvarianten
Eleven v4 ist in zwei Varianten verfügbar, damit Sie für Ihren Anwendungsfall die passende Balance aus Qualität und Geschwindigkeit wählen können:
- Eleven v4 (
eleven_v4) – unser Modell mit der höchsten Qualität, ideal für Content-Erstellung, Hörbücher, Charakter-Voiceovers und jeden Anwendungsfall, bei dem Qualität oberste Priorität hat. - Eleven v4 Turbo (
eleven_v4_turbo) – extrem hohe Qualität bei beeindruckend niedriger Latenz, speziell für Echtzeitanwendungen wie Dialogagenten und interaktive Spracherlebnisse entwickelt.
Beide Varianten verwenden zwei Stimmeinstellungen: Stabilität und Ähnlichkeit.
Stabilität steuert, wie konsistent die Vortragsweise über mehrere Generierungen hinweg bleibt. Niedrigere Werte ermöglichen eine ausdrucksstärkere, variablere Vortragsweise; höhere Werte halten die Darbietung näher an einer festen Grundlage.
Ähnlichkeit steuert, wie genau die Ausgabe der Referenzstimme entspricht. Höhere Werte sorgen für eine stärkere Übereinstimmung mit der Referenz, was auf Kosten der Natürlichkeit gehen kann.
Die Regler für Stil und Geschwindigkeit sind in Eleven v4 nicht verfügbar, und SSML wird nicht unterstützt.
Audio-Tags (z. B. [whispering], [shouting], [laughing]) ermöglichen eine präzise Steuerung der Vortragsweise. Eleven v4 verarbeitet sie mit einer Nuancierung, die über frühere Modelle hinausgeht. Sie sind noch nicht perfekt, und wir verbessern kontinuierlich, wie zuverlässig das Modell Tag-Anweisungen befolgt. Dies ist ein aktiver Bereich fortlaufender Investitionen und wird stetig besser.
Beispiele
Diese Beispiele sind unbearbeitet. Es wurde keine umfassende Nachbearbeitung durchgeführt: kein EQ, keine Kompression, Normalisierung, De-Essing, Entfernung von Plosivlauten oder Ähnliches. Falls Sie wiederkehrende Probleme hören, etwa Clipping, Plosivlaute, unausgewogenen EQ oder Lautstärkesprünge, stammen diese sehr wahrscheinlich aus den Trainingsdaten dieser Stimme. Das Eleven v4-Modell hat sie lediglich erfasst, da es sehr präzise ist – auch beim Erfassen von Unzulänglichkeiten. Wir haben die Audiodaten unverändert gelassen, damit Sie hören können, was das Modell erzeugt hat.
Genauigkeit beim Klonen von Stimmen
Jedes Beispiel beginnt mit einer Vorschau aus der Stimmbibliothek. Anschließend haben wir Text mit einem Instant Voice Clone dieser Stimme sowohl mit Eleven v3 als auch mit Eleven v4 generiert.
Dies ist kein perfekter Vergleich. Eleven v4 funktioniert auch mit Professional Voice Clones, die die Übereinstimmung weiter verbessern können. Um den Vergleich fairer zu halten, haben wir jedoch für Eleven v3 und Eleven v4 Instant Voice Clones verwendet.
Diese Beispiele zeigen, wie viel von der ursprünglichen Stimme das Modell erfasst. Wichtig ist, dass dies auch EQ, Qualität, Lautstärke sowie alle weiteren kleinen Details und Unvollkommenheiten der Audiodaten umfasst, etwa Plosivlaute, scharfe Zischlaute und Lautstärkeschwankungen.
Hören Sie zuerst die Vorschau, dann Eleven v3 und anschließend Eleven v4.
Stimme NfUrCNRReUL9RXS9upG1.
Stimme HBDoL4wkcalemIO0nUAu.
Sprachschauspiel
Dies sind Generierungen mit Eleven v4. Die Audio-Tags im Text steuern die Vortragsweise.
Stimme EkK5I93UQWFDigLMpZcX.
Stimme t7VaN65ClS2VrEUwk1nR.
Hörbuch
Dies ist eine Eleven v4-Erzählung. Die Tags bestimmen Tempo und Ton der Szene.
Stimme KHRvDizAHFVPzoSehNY6.
Das Modell entwickelt sich weiter
Eleven v4 wird aktiv und kontinuierlich weiterentwickelt. Während wir das Modell nach der Veröffentlichung weiter trainieren und verbessern, kann sich sein Verhalten mit steigender Qualität im Laufe der Zeit verändern. Wir empfehlen, Ihren Anwendungsfall regelmäßig erneut zu testen, während sich das Modell weiterentwickelt. Über wichtige Updates informieren wir Sie bei ihrer Einführung.
FAQ
Welche Sprachen unterstützt Eleven v4?
Eleven v4 unterstützt Afrikaans, Amharisch, Arabisch, Armenisch, Assamesisch, Asturisch, Aserbaidschanisch, Belarussisch, Bengalisch, Bosnisch, Bulgarisch, Birmanisch, Kantonesisch, Katalanisch, Cebuano, Kroatisch, Tschechisch, Dänisch, Niederländisch, Englisch, Estnisch, Filipino, Finnisch, Französisch, Fulfulde (Pulaar), Galicisch, Georgisch, Deutsch, Griechisch, Gujarati, Hausa, Hebräisch, Hindi, Ungarisch, Isländisch, Indonesisch, Italienisch, Japanisch, Kannada, Kasachisch, Koreanisch, Kirgisisch, Lao, Lingala, Litauisch, Luganda, Luxemburgisch, Mazedonisch, Malaiisch, Malayalam, Maltesisch, Mandarin-Chinesisch, Māori, Marathi, Mongolisch, Nepalesisch, Norwegisch Bokmål, Okzitanisch, Odia, Paschtu, Persisch, Polnisch, Portugiesisch (Brasilien), Punjabi, Rumänisch, Russisch, Serbisch, Shona, Sindhi, Slowakisch, Slowenisch, Somali, Sorani-Kurdisch, Spanisch (Lateinamerika), Swahili, Schwedisch, Tadschikisch, Tamil, Telugu, Thai, Türkisch, Ukrainisch, Urdu, Usbekisch, Vietnamesisch, Walisisch und Wolof.
Einige Sprachen werden flüssiger verarbeitet als andere. Generell verarbeitet Eleven v4 jedoch die große Mehrheit davon sehr gut.
Behält eine geklonte Stimme ihren Akzent?
Wenn Referenzstimme und generierte Sprache dieselbe Sprache verwenden, bleibt der Akzent der Stimme erhalten. Wenn Sie beispielsweise jemanden klonen, der Englisch mit einem bestimmten englischen Akzent spricht, und englische Sprache generieren, bleibt dieser Akzent erhalten.
Kann ich eine Stimme mit ihrem ursprünglichen Akzent eine andere Sprache sprechen lassen?
Standardmäßig zielt Eleven v4 bei einer anderen generierten Sprache als der Sprache der Referenzstimme auf flüssige, natürlich klingende Sprache in der Zielsprache ab, statt den Referenzakzent zu übernehmen. Sie können versuchen, mit Audio-Tags einen Akzent oder Vortragsstil zu steuern, die Ergebnisse können jedoch variieren. Testen Sie daher Ihre konkrete Stimme und Ihren Anwendungsfall.
Klingt ein Eleven v4-Klon wie seine Eleven v3-Version?
Generell gibt Eleven v4 die Eigenschaften der Ausgangsstimme deutlich präziser wieder als Eleven v3, einschließlich Klangfarbe, Rhythmus, Vortragsweise und anderer Eigenheiten. Daher wird ein Eleven v4-Klon in der Regel stärker wie die Ausgangsstimme klingen und kann deutlich anders klingen als seine Eleven v3-Version.
Muss ich Eleven v4 trainieren?
Eleven v4 funktioniert sowohl mit Instant Voice Cloning als auch mit Professional Voice Cloning.
Mit Instant Voice Cloning erstellen Sie eine Stimme ohne separaten Trainingsschritt. Laden Sie eine kurze Aufnahme hoch, in der Regel ein bis zwei Minuten, und innerhalb von Sekunden steht Ihnen eine nutzbare Stimme zur Verfügung.
Professional Voice Cloning funktioniert genauso wie bei früheren Modellen. Dabei wird ein dediziertes Modell mit einem längeren Satz von Aufnahmen trainiert.
Wenn Sie bereits einen Professional Voice Clone haben und ihn mit Eleven v4 trainieren möchten, öffnen Sie My Voices, suchen Sie die Stimme in der Liste und bewegen Sie den Mauszeiger darüber. Sie sehen die für diese Stimme verfügbaren Modelle. Klicken Sie auf die Plus-Schaltfläche neben Eleven v4, um das Fine-Tuning zu starten.
Sollte ich Voice Design mit Eleven v4 verwenden?
Voice Design-Stimmen funktionieren mit Eleven v4, sind aber möglicherweise nicht so ausdrucksstark und klingen eventuell nicht so gut wie mit früheren Modellen.