Vorstellung von Eleven v3 (Alpha)
- Veröffentlicht
AnhörenArtikel anhören
Wir stellen Eleven v3 (alpha) vor – das ausdrucksstärkste Text to Speech-Modell.
Diese Forschungsvorschau bietet mit Folgendem beispiellose Kontrolle und Realismus bei der Sprachgenerierung:
- Über 70 Sprachen
- Dialoge mit mehreren Sprechern
- Audio-Tags wie [excited], [whispers] und [sighs]
Eleven v3 (alpha) erfordert mehr Prompt Engineering als frühere Modelle – aber die Ergebnisse sind beeindruckend.
Wenn Sie an Videos, Hörbüchern oder Medientools arbeiten, eröffnet das ein neues Niveau an Ausdruckskraft. Für Echtzeit- und Konversationsanwendungen empfehlen wir vorerst v2.5 Turbo oder Flash. Eine Echtzeitversion von v3 befindet sich in Entwicklung.
Eleven v3 ist ab heute auf unserer Website und über die API verfügbar.
Warum wir v3 entwickelt haben
Seit der Einführung von Multilingual v2 sehen wir, wie Voice AI in professionellen Filmen, der Spieleentwicklung, Bildung und Barrierefreiheit eingesetzt wird. Die konstante Einschränkung war jedoch nicht die Klangqualität, sondern die Ausdruckskraft. Stärkere Emotionen, Unterbrechungen in Gesprächen und glaubwürdige Dialoge waren schwer umzusetzen.
Eleven v3 schließt diese Lücke. Es wurde von Grund auf entwickelt, um Stimmen zu liefern, die seufzen, flüstern, lachen und reagieren – und Sprache erzeugen, die wirklich lebendig und reaktionsfähig wirkt.
Was ist neu in Eleven v3 (alpha)
| Feature | What it unlocks |
|---|---|
| Audio tags | Inline control of tone, emotion, and non-verbal reactions |
| Dialogue mode | Multi-speaker conversations with natural pacing and interruptions |
| 70+ languages | Full coverage of high-demand global languages |
| Deeper text understanding | Better stress, cadence, and expressivity from text input |
Audio-Tags verwenden
Audio-Tags werden direkt in Ihr Skript eingefügt und in eckigen Klammern kleingeschrieben. Mehr zu Audio-Tags erfahren Sie in unserem Prompting-Leitfaden für v3 in der Dokumentation.
Professional Voice Clones (PVCs) sind derzeit nicht vollständig für Eleven v3 optimiert. Daher kann die Qualität der Klone im Vergleich zu früheren Modellen geringer ausfallen. Wenn Sie v3-Funktionen nutzen möchten, empfehlen wir in dieser Forschungsphase einen Instant Voice Clone (IVC) oder eine für Ihr Projekt ausgewählte Stimme. Die Optimierung von PVCs für v3 folgt in Kürze.
Sie könnten beispielsweise Folgendes prompten: „[whispers] Etwas kommt … [sighs] Ich kann es spüren.“ Für mehr Ausdruckskontrolle können Sie auch mehrere Tags kombinieren:
Dialoge mit mehreren Sprechern erstellen
Eleven v3 wird von unserem bestehenden Text to Speech-Endpunkt unterstützt. Zusätzlich führen wir einen neuen Text to Dialogue API-Endpunkt ein. Übergeben Sie ein strukturiertes Array aus JSON-Objekten – jedes steht für einen Sprecherwechsel – und das Modell erzeugt eine zusammenhängende Audiodatei mit Überlappungen:
Der Endpunkt verwaltet Sprecherwechsel, emotionale Veränderungen und Unterbrechungen automatisch.
Erfahren Sie hier mehr.
Preise und Verfügbarkeit
| Plan | Launch promo | At the end of June |
|---|---|---|
| UI (self-serve) | 80% off (~5× cheaper) | Same as Multilingual V2 |
| UI (enterprise) | 80% off business plan pricing | Business plan pricing |
So aktivieren Sie v3:
- Öffnen Sie den Modellauswahlschalter und wählen Sie Eleven v3 (alpha)
API-Zugang und Unterstützung in Studio folgen in Kürze. Für Early Access kontaktieren Sie den Vertrieb.
Wann Sie v3 nicht verwenden sollten
Eleven v3 (alpha) erfordert mehr Prompt Engineering als unsere bisherigen Modelle. Wenn es funktioniert, sind die Ergebnisse beeindruckend. Aufgrund der geringeren Zuverlässigkeit und höheren Latenz eignet es sich jedoch nicht für Echtzeit- und Konversationsanwendungen. Dafür empfehlen wir Eleven v2.5 Turbo/Flash.
Weitere Informationen finden Sie in der vollständigen v3-Dokumentation und den FAQ.
- Melden Sie sich bei der ElevenLabs UI
- Wählen Sie v3 (alpha) im Modell-Dropdown aus
- Fügen Sie Ihr Skript ein – nutzen Sie Tags oder Dialoge
- Audio generieren
Wir sind gespannt, wie Sie v3 für neue Anwendungsfälle nutzen – von immersivem Storytelling bis zu filmischen Produktionspipelines.






.jpg&w=3840&q=80)
.png&w=3840&q=80)


