Zum Inhalt springen

Vorstellung von Eleven v3 (Alpha)

Veröffentlicht

AnhörenArtikel anhören

Eleven v3 is no longer in alpha, and is now generally available.


Wir stellen Eleven v3 (alpha) vor – das ausdrucksstärkste Text to Speech-Modell.

Diese Forschungsvorschau bietet mit Folgendem beispiellose Kontrolle und Realismus bei der Sprachgenerierung:

  • Über 70 Sprachen
  • Dialoge mit mehreren Sprechern
  • Audio-Tags wie [excited], [whispers] und [sighs]

Eleven v3 (alpha) erfordert mehr Prompt Engineering als frühere Modelle – aber die Ergebnisse sind beeindruckend.

Wenn Sie an Videos, Hörbüchern oder Medientools arbeiten, eröffnet das ein neues Niveau an Ausdruckskraft. Für Echtzeit- und Konversationsanwendungen empfehlen wir vorerst v2.5 Turbo oder Flash. Eine Echtzeitversion von v3 befindet sich in Entwicklung.

Eleven v3 ist ab heute auf unserer Website und über die API verfügbar.

Warum wir v3 entwickelt haben

Seit der Einführung von Multilingual v2 sehen wir, wie Voice AI in professionellen Filmen, der Spieleentwicklung, Bildung und Barrierefreiheit eingesetzt wird. Die konstante Einschränkung war jedoch nicht die Klangqualität, sondern die Ausdruckskraft. Stärkere Emotionen, Unterbrechungen in Gesprächen und glaubwürdige Dialoge waren schwer umzusetzen.

Eleven v3 schließt diese Lücke. Es wurde von Grund auf entwickelt, um Stimmen zu liefern, die seufzen, flüstern, lachen und reagieren – und Sprache erzeugen, die wirklich lebendig und reaktionsfähig wirkt.

Was ist neu in Eleven v3 (alpha)

Feature What it unlocks
Audio tags Inline control of tone, emotion, and non-verbal reactions
Dialogue mode Multi-speaker conversations with natural pacing and interruptions
70+ languages Full coverage of high-demand global languages
Deeper text understanding Better stress, cadence, and expressivity from text input

Hören Sie v3 selbst

Background
Background

Audio-Tags verwenden

Audio-Tags werden direkt in Ihr Skript eingefügt und in eckigen Klammern kleingeschrieben. Mehr zu Audio-Tags erfahren Sie in unserem Prompting-Leitfaden für v3 in der Dokumentation.

Professional Voice Clones (PVCs) sind derzeit nicht vollständig für Eleven v3 optimiert. Daher kann die Qualität der Klone im Vergleich zu früheren Modellen geringer ausfallen. Wenn Sie v3-Funktionen nutzen möchten, empfehlen wir in dieser Forschungsphase einen Instant Voice Clone (IVC) oder eine für Ihr Projekt ausgewählte Stimme. Die Optimierung von PVCs für v3 folgt in Kürze.

Sie könnten beispielsweise Folgendes prompten: „[whispers] Etwas kommt … [sighs] Ich kann es spüren.“ Für mehr Ausdruckskontrolle können Sie auch mehrere Tags kombinieren:

“[happily][shouts] We did it! [laughs].”

Dialoge mit mehreren Sprechern erstellen

Eleven v3 wird von unserem bestehenden Text to Speech-Endpunkt unterstützt. Zusätzlich führen wir einen neuen Text to Dialogue API-Endpunkt ein. Übergeben Sie ein strukturiertes Array aus JSON-Objekten – jedes steht für einen Sprecherwechsel – und das Modell erzeugt eine zusammenhängende Audiodatei mit Überlappungen:

[
  {"speaker_id": "scarlett", "text": "(cheerfully) Perfect! And if that pop-up is bothering you, there’s a setting to turn it off under Notifications → Preferences."},
  {"speaker_id": "lex", "text": "You are a hero. An actual digital wizard. I was two seconds from sending a very passive-aggressive support email."},
  {"speaker_id": "scarlett", "text": "(laughs) Glad we could stop that in time. Anything else I can help with today?"}
]

Der Endpunkt verwaltet Sprecherwechsel, emotionale Veränderungen und Unterbrechungen automatisch.

Erfahren Sie hier mehr.

v3 ist unser ausdrucksstärkstes Modell

Background
Background

Preise und Verfügbarkeit

Plan Launch promo At the end of June
UI (self-serve) 80% off (~5× cheaper) Same as Multilingual V2
UI (enterprise) 80% off business plan pricing Business plan pricing

So aktivieren Sie v3:

  • Öffnen Sie den Modellauswahlschalter und wählen Sie Eleven v3 (alpha)

API-Zugang und Unterstützung in Studio folgen in Kürze. Für Early Access kontaktieren Sie den Vertrieb.

Wann Sie v3 nicht verwenden sollten

Eleven v3 (alpha) erfordert mehr Prompt Engineering als unsere bisherigen Modelle. Wenn es funktioniert, sind die Ergebnisse beeindruckend. Aufgrund der geringeren Zuverlässigkeit und höheren Latenz eignet es sich jedoch nicht für Echtzeit- und Konversationsanwendungen. Dafür empfehlen wir Eleven v2.5 Turbo/Flash.

Weitere Informationen finden Sie in der vollständigen v3-Dokumentation und den FAQ.

Jetzt testen

Background
Background
  1. Melden Sie sich bei der ElevenLabs UI
  2. Wählen Sie v3 (alpha) im Modell-Dropdown aus
  3. Fügen Sie Ihr Skript ein – nutzen Sie Tags oder Dialoge
  4. Audio generieren

Wir sind gespannt, wie Sie v3 für neue Anwendungsfälle nutzen – von immersivem Storytelling bis zu filmischen Produktionspipelines.

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio