Die Eleven v4 Audio-Tags-Liste: Testen Sie sie und schreiben Sie dann Ihre eigenen
- Verfasst von
- Jack Limebear
- Veröffentlicht
AnhörenArtikel anhören
Eleven v4 ist ein wegweisendes Text to Speech-Modell, das Text in eine Performance verwandelt. Mit Audio Tags steuern Sie diese Performance und ihre emotionale Wirkung präzise. Fügen Sie einen natürlichsprachlichen Hinweis in eckigen Klammern wie [whispers] oder [excited] ein und hören Sie, wie v4 die Sprechweise entsprechend anpasst.
Diese ElevenLabs Audio-Tags-Liste umfasst jede Emotion aus dem gesamten Emotionsspektrum von Eleven v4 sowie Tags für Sprechweise, Tempo, Reaktionen, Akzente und Soundeffekte. Sobald Sie die Grundlagen kennen, zeigen wir Ihnen auch, wie Sie eigene Tags in einfacher Sprache schreiben.
Entdecken Sie die Emotionen von Eleven v4
Spektrum anhörenZusammenfassung
- Audio Tags sind natürlichsprachliche Signale in eckigen Klammern, die Eleven v4 als Regieanweisungen liest und damit die Sprechweise der folgenden Wörter verändert.
- Eleven v4 ist das bestplatzierte Modell in der Artificial Analysis Speech Arena [September 2026]. Mit Audio Tags können Sie diese Performance Zeile für Zeile steuern.
- Mit dem Emotionsrad von Eleven v4 hören Sie verschiedene Emotionen und erhalten schnell einen Überblick über die Fähigkeiten des Modells.
- Tags sind nicht auf eine feste Liste beschränkt. Sie können eigene erstellen, indem Sie Eigenschaften wie [whispering, fearful] kombinieren oder die Situation bzw. Figur hinter einer Zeile beschreiben.
- Audio Tags funktionieren über die ElevenAPI mit Eleven v4, Eleven v4 Turbo und Eleven v3.
Was sind ElevenLabs Audio Tags?
Audio Tags sind natürlichsprachliche Hinweise, die Sie in eckigen Klammern in Ihren Text einfügen können. Eleven v4 liest sie als Performancemarkierungen und nutzt sie als Anweisungen, die verändern, wie bestimmte Wörter oder Sätze gesprochen werden. Sie schreiben sie direkt in Ihr Skript in der ElevenLabs Text to Speech-App und erleben, wie unsere Modelle sie zum Leben erwecken.
Eleven v4 ist das bestplatzierte TTS-Modell in der Artificial Analysis Speech Arena, in der Hörer über das natürlichste Text to Speech abstimmen.1 Mit Audio Tags gehen Sie noch weiter und steuern genau, wie jede Zeile gesprochen wird.
So verwenden Sie Audio Tags in einem Skript:
- Setzen Sie ein Tag vor die Wörter, die es beeinflusst: Wenn Sie „[shouts] Ich kann nicht glauben, dass du das zu mir gesagt hast“ schreiben, wird die ganze Zeile geschrien.
- Emotionen wirken weiter: Wenn Sie ein Tag hinzufügen, bleibt seine Emotion über die Zeile hinweg bestehen. Sie brauchen also erst dann ein weiteres Tag, wenn sich die Sprechweise ändern soll. Zum Beispiel: „[proud] Ich koche seit über einem Jahrzehnt. Ich weiß, wie man ein Ei kocht. [startled] Was riecht hier verbrannt?"
- Kombinieren Sie Tags für mehrschichtige Anweisungen: Trennen Sie Audio Tags innerhalb eines Klammerpaars durch Kommas, etwa [whispering, playful], um Ihrer TTS-Performance Nuancen zu geben.
- Kombinieren Sie Tags mit Satzzeichen: Audio Tags bestimmen Stimmung und Sprechweise. Mit Satzzeichen im Skript steuern Sie das Tempo auf natürliche Weise. Nutzen Sie Auslassungspunkte, Gedankenstriche oder Großbuchstaben, um die Prosodie zu gestalten einer Zeile.
Für eine ausführlichere Erklärung, wie Tags funktionieren und SSML ersetzen, haben wir einen vollständigen Leitfaden zu Audio Tags erstellt.

Liste der Emotions-Audio-Tags
Das Emotionsrad von Eleven v4 umfasst Dutzende Emotionen, die jeweils von v4 dargestellt werden. So hören Sie den Unterschied, bevor Sie auch nur ein Tag schreiben.
Klicken Sie unten auf eine Emotion, um sie auf dem Rad zu hören, oder experimentieren Sie direkt mit Satz und Emotion, um zu hören, wie Eleven v4 emotionale Audio Tags zum Leben erweckt.
Emotionsfamilie | Emotions-Audio-Tags |
Hohe Energie | [excited], [playful], [amazed], [powerful], [proud], [optimistic], [startled] |
Aufgewühlt | |
Angespannt | [anxious], [stressed], [scared], [threatened], [vulnerable], [confused], [busy] |
Niedrige Energie | |
Ruhig und nachdenklich |
Hier zeigen wir nur einige Emotionen, aber Sie können mit natürlicher Sprache jede gewünschte Emotion umsetzen. Im folgenden Beispiel verwenden wir verschiedene Audio Tags, die oben nicht aufgeführt sind, um zu zeigen, was mit Prompts in natürlicher Sprache möglich ist.
Dieses Beispiel wurde mit Jonathan Livingston zum Leben erweckt.
Liste der Audio Tags für Sprechweise und Lautstärke
Tags für Sprechweise und Lautstärke steuern, wie laut oder intensiv eine Zeile klingt – unabhängig von der gewählten Emotion. Wenn v4 einer spezifischeren Vorstellung folgen soll, kombinieren Sie Tags für Sprechweise und Emotion für eine präzisere Steuerung.
Hier einige Beispiele:
- [whispers] Nicht bewegen, es ist direkt hinter dir.
- [shouts] Alle sofort raus aus dem Gebäude!
- [softly] Du hast alles getan, was du konntest.
- [quietly] Ich glaube, sie sind weg.
- [low, threatening] Du hättest wirklich nicht hierherkommen sollen.
Sehen wir uns Lautstärke und Sprechweise in Aktion an.
Das obige Beispiel wurde mit Rod zum Leben erweckt.
Liste der Tempo-Audio-Tags
Tempo-Audio-Tags verändern die Geschwindigkeit einer Zeile. Setzen Sie sie ein, um Spannung zu erzeugen oder den perfekten komischen Moment vorzubereiten. Wenn das Timing genauso wichtig ist wie die Worte, sollten Sie Tempo-Tags verwenden.
Als zusätzlicher Tipp: Satzzeichen verbessern die Text to Speech-Performance auf natürliche Weise. Kombinieren Sie beides für vollständige Kontrolle über den Satz:
- [slowly] Und der Gewinner ist ...
- [rushed] Entschuldigung, ich bin spät dran, der Zug ist ausgefallen, ich bin den ganzen Weg gerannt.
- [pause] Dann klingelte das Telefon.
- [drawn out] Niemaaals.
Adam war die Stimme, die dieses Beispiel zum Leben erweckte.
Liste menschlicher Reaktions-Audio-Tags
Reaktions-Tags fügen Ihren Sätzen Geräusche wie Lachen, Keuchen, Weinen, Husten und Seufzen hinzu. Sie erwecken Ihren Text zum Leben und lassen ein TTS-Audiobeispiel natürlich klingen – wie jemand, der frei spricht statt aus einem Skript vorzulesen.
Hier sind einige Reaktions-Audio-Tags:
- [laughs] Darauf bist du wirklich reingefallen?
- [sighs] Na gut. Ich spüle ab.
- [gasps] Ist das ein echter Diamant?
- [clears throat] Wenn ich bitte um Ihre Aufmerksamkeit bitten dürfte.
- [crying] Ich dachte nicht, dass du zurückkommen würdest.
Eleven v4 fügt auch kleine menschliche Nuancen hinzu, wenn die Emotion es verlangt. Hören Sie sich das Emotionsrad an und Sie hören Zeilen wie „D-du bist zurück?“ und „Ugh, das ist echt?“, bei denen v4 selbst ein Stottern oder Stöhnen ergänzt hat.
Wenn Sie diese Stimme in Ihren eigenen Produktionen verwenden möchten, suchen Sie nach Jack John.
Liste der Akzent- und Charakter-Audio-Tags
Mit Eleven v4 erstellen Sie reichhaltige Szenen mit verschiedenen Akzenten oder Charakterstimmen einfacher denn je. Mit wenigen Audio Tags verwandeln Sie eine Stimme in eine neue Persona und behalten dabei ihre grundlegenden Eigenschaften bei. Eine Stimme kann in einer einzigen Generierung eine ganze Besetzung spielen.
- [British accent] Lust auf eine Tasse Tee?
- [French accent] Willkommen in meinem kleinen Café.
- [Australian accent] Kein Problem, Kumpel, wir kriegen das hin.
- [pirate voice] Segel hoch und den Rum her.
Lauren hat dieses Beispiel zum Leben erweckt.
Liste der Soundeffekt-Audio-Tags
Soundeffekt-Audio-Tags fügen nichtsprachliche Ereignisse direkt in Ihre Generierungen ein. Wenn Sie etwa eine erzählerische Szene oder einen Soundtrack für ein Videospiel erstellen, können Sie damit dramatisieren, ohne eine separate SFX-Spur zu benötigen. Für etwas Bestimmtes können Sie jedoch jederzeit den KI-Soundeffekt-Generator verwenden.
- [thunder rumbling] Es kommt näher.
- [footsteps] Jemand kommt die Treppe hoch.
- [door creaking] Hallo? Ist jemand zu Hause?
- [clapping] Danke, danke, Sie sind zu freundlich.
Die Stimme im obigen Clip ist Siren.
Schreiben Sie eigene Audio Tags in natürlicher Sprache
Jedes der oben gezeigten Audio Tags ist ein guter Ausgangspunkt. Die Stärke von ElevenLabs TTS liegt jedoch darin, dass Sie jedes neue Audio Tag in natürlicher Sprache schreiben können, um dem Modell zusätzlichen Kontext zu geben.
Alternativ können Sie eine umfassendere Anweisung schreiben, wenn kein einzelnes Wort das beschreibt, was Sie suchen.
- Kombinieren Sie Emotionen und Eigenschaften: [tense, cautious] oder [whispering, fearful]
- Beschreiben Sie die Art der Sprechweise: [like a sports commentator, speeding up]
- Beschreiben Sie die Situation: [out of breath after running up the stairs]
- Beschreiben Sie die Figur: [a tired detective who has heard it all before]
- Beschreiben Sie den Wechsel: [starting calm, then losing patience]
Erwecken Sie Ihre Szene zum Leben mit Spuds Oxley.
Tipps zur Auswahl von Audio Tags
Natürlichsprachliche Eingaben bieten viel Flexibilität beim Erstellen von Text to Speech-Audiobeispielen. Das perfekte Ergebnis kann jedoch einige Versuche erfordern.
Für eine möglichst reibungslose TTS-Erfahrung mit Eleven v4 finden Sie hier einige Tipps für die Arbeit mit Audio Tags:
- Erst hören, dann schreiben: Spielen Sie einige Emotionen auf dem Emotionsrad ab, um zu hören, wie v4 jede einzelne interpretiert – oder um sich inspirieren zu lassen. Wählen Sie dann die passendste für Ihre Zeile.
- Ändern Sie das Tag, bevor Sie die Zeile umschreiben: Wenn die Sprechweise nicht passt, probieren Sie eine verwandte Emotion wie [let down] statt [despair] und generieren Sie erneut.
- Verwenden Sie ein Tag pro Satzteil: Gegensätzliche Tags für dieselben Wörter können die Performance verwischen. Fügen Sie dort ein neues Tag ein, wo sich die Emotion ändern soll.
- Geben Sie dem Modell eine vollständige Szene: Eleven v4 arbeitet mit Kontext besser. Mit bis zu 10.000 Zeichen pro Generierung in der Text to Speech-App haben Sie genug Raum für mehrschichtige Anweisungen und eine überzeugende Szene.
- Beginnen Sie mit einem Preset und werden Sie dann konkreter. Wenn [nervous] nahe dran, aber noch nicht richtig ist, schreiben Sie auf, was fehlt: [nervous, trying to sound confident].
Am besten öffnen Sie jedoch die ElevenLabs TTS-App und experimentieren. So lernen Sie schnell dazu und erstellen hochwertige TTS-Audios.

Starten Sie mit immersivem Audio auf Eleven v4
Es gibt keine definitive ElevenLabs Audio-Tags-Liste, denn Sie können durch natürlichsprachliche Eingaben jede beliebige Kombination erstellen. Jedes Tag in dieser Liste funktioniert mit Eleven v4 – ebenso wie Tags, die Ihnen beim Schreiben Ihrer Szene einfallen.
Wählen Sie eine der über 17.500 Stimmen aus der Stimmbibliothek, fügen Sie Ihr Skript ein und setzen Sie Ihr erstes Audio Tag.
Erfahren Sie mehr über Eleven v4 oder registrieren Sie sich für beeindruckende Audio-Performances.
FAQ zu ElevenLabs Audio Tags
- Artificial Analysis, Provider Voice Arena Preference Elo, 30. September 2026


