Eleven v3 Audio Tags: Charakterdarstellung in Sprache steuern
- Verfasst von
- Ryan Morrison
- Veröffentlicht
- Zuletzt aktualisiert
AnhörenArtikel anhören
Audio Tags sind ein leistungsstarkes Tool in Eleven v3 (Alpha), dem neuen Forschungs-Preview-Modell für Text to Speech von ElevenLabs. Mit diesen Elementen steuern Sie nicht nur Tonfall und Tempo präzise, sondern auch Charakter und stimmliche Performance.
Mit Tags wie [pirate voice], [French accent] oder [sarcastically] wird die Stimme zum Werkzeug des Storytellings, nicht nur der Erzählung. In Kombination mit einem starken Character Voice Clone erfassen Sie nicht nur einen Klang, sondern eine vollständige Performance.
Mit diesen Tags können Sie die stimmliche Identität mitten im Satz wechseln, Akzente nachahmen oder Archetypen wie Bösewichte, Erzähler oder Sidekicks einsetzen — ohne das zugrunde liegende Skript zu ändern oder zu einer anderen Stimme zu wechseln.
Was ist Character Performance bei KI-Sprache?

Character Performance ist die Fähigkeit, in eine Rolle zu schlüpfen. Ob Sie einem flamboyanten Bösewicht, einem rauen Seekapitän oder einem lokalen Ladenbesitzer aus Melbourne eine Stimme geben: Mit den neuen Audio Tags steuern Sie die Sprechweise passend zu der Figur, die Sie vermitteln möchten.
Mit einer einfachen Formulierung in eckigen Klammern setzen Sie die Szene: „[pirate voice] Arr, die offene See. Riecht ihr das, Jungs? Das ist der Duft der Freiheit … und ein Hauch Meuterei.“
Das Modell spricht die Wörter nicht nur aus — es trägt sie als Figur vor.
Vom Akzent zum Archetyp
Bei stimmlicher Performance geht es nicht nur um Lautstärke oder Emotion. Es geht auch darum, wer spricht. Mit Eleven v3 können Sie spezifische Akzente, Dialekte und Sprechstile spontan vorgeben. Zum Beispiel:
[American accent] Konntest du meinen Akzent im alten Modell ändern? [dismissive] Dachte ich mir. [Australian accent] Jetzt geht das aber — sieh dir das an, Kumpel! [French accent] Meine Liebe … ist wie eine rote, rote Rose.
Diese flexible Wechselmöglichkeit der Identität eignet sich ideal für Animationen, Spiele, interaktive Fiktion und alle Situationen, in denen die Persönlichkeit der sprechenden Person zählt.
Gängige Tags für Character Performance
Charakterbezogene Tags helfen Ihnen, stimmliche Identität und Präsenz zu gestalten:
- Akzente & Dialekte: [British accent], [Australian accent], [Southern US accent]
- Archetypen & Rollen: [pirate voice], [evil scientist voice], [childlike tone]
- Sprechstile: [dramatic], [sarcastically], [matter-of-fact], [whiny]
- Genre-Hinweise: [fantasy narrator], [sci-fi AI voice], [classic film noir]
Das Kombinieren von Tags erweckt Figuren zum Leben: „[dramatic][French accent] Du verstehst nicht ... es ging nie um Rache. Es ging um Schicksal.“
Vom Erzähler zum Ensemble
In Skripten mit mehreren Figuren machen Audio Tags den Wechsel zwischen Stimmen einfach. Erzeugen Sie Spannung, Humor oder Überraschung, indem Sie die Character Performance mitten im Dialog wechseln — ohne zusätzliche Bearbeitung.
Sehen Sie sich diesen Auszug aus einer Demo an: „Jessica: [laughs] Das war ... wunderschön. Dr. Von Fusion: [dramatic] Sein oder nicht sein — das ist hier die Frage! Jessica: [French accent] Das ist spektakulär, nicht wahr?“
Was früher ein ganzes Ensemble erforderte, lässt sich heute in einer einzigen Sprachspur skripten — ohne Abstriche bei Vielfalt oder Tiefe.
Stimmen inszenieren, nicht nur Texte schreiben
Eleven v3 unterstützt dynamische Stimmveränderungen, kontextbezogene Wechsel und eine konsistente Sprechweise über verschiedene Figuren hinweg. Das bedeutet: Das Modell versteht nicht nur, was es sagen soll — sondern auch, wie jede Figur es sagen soll.
Für Kreative eröffnet das eine neue Dimension der Kontrolle. Sie schreiben nicht nur Dialoge. Sie führen Regie bei Performances.
Die richtige Stimme auswählen
Professional Voice Clones (PVCs) sind derzeit nicht vollständig für Eleven v3 optimiert. Dadurch kann die Clone-Qualität im Vergleich zu früheren Modellen geringer ausfallen. Wenn Sie v3-Funktionen nutzen möchten, sollten Sie in dieser Forschungs-Preview-Phase einen Instant Voice Clone (IVC) oder eine Designstimme für Ihr Projekt wählen. Die PVC-Optimierung für v3 folgt in naher Zukunft.


