Was sind Audio Tags? Der vollständige Leitfaden für emotionales TTS
- Verfasst von
- Jack Limebear
- Veröffentlicht
- Zuletzt aktualisiert
AnhörenArtikel anhören
Audio Tags sind natürlichsprachliche Hinweise in eckigen Klammern wie [laughs], [gasps], [excited] und [worried], die Eleven v3 als Regieanweisungen statt als auszusprechende Wörter versteht. Wenn Sie ein Skript für ein Text to Speech-Modell schreiben, geben Ihnen diese Audio Tags präzise Kontrolle über die emotionale Darbietung Ihres Textes.
Eleven v3 wurde im März 2026 öffentlich verfügbar. Vor v3 bedeutete es, aus einem Text to Speech-Modell eine bestimmte emotionale Darbietung zu erhalten, Inhalte neu zu generieren und auf das Beste zu hoffen. Audio Tags beseitigen dieses Rätselraten und geben Ihnen volle Kontrolle über eine emotionale Text to Speech-Darbietung.
Dieser Leitfaden erklärt, was Audio Tags sind, wie sie funktionieren, welche Tag-Kategorien verfügbar sind und wie sie sich von SSML (Speech Synthesis Markup Language) unterscheiden. Außerdem behandeln wir häufige Anwendungsfälle, jeweils mit einem eigenen Leitfaden.
Zusammenfassung
- Audio Tags sind Hinweise in eckigen Klammern wie [shouts] oder [excited], die Emotion, Tempo, Darbietung und Tonfall in TTS mit Eleven v3 steuern.
- Eleven v3 unterstützt kein SSML, ersetzt es aber durch Audio Tags für ein natürlicheres Schreiberlebnis.
- Tags decken mehrere Kategorien ab, darunter Emotionen, Darbietung und Tempo, menschliche Reaktionen, Akzente und Soundeffekte.
- Interpunktion und Großschreibung in Ihrem Text ermöglichen es Ihnen, das Tempo einer KI-Stimmendarbietung zu gestalten.
- Sie können in ElevenLabs über die Benutzeroberfläche oder die API auf Audio Tags zugreifen.
Wie funktionieren Audio Tags?
Audio Tags stehen direkt in Ihrem Transkript und sind in eckige Klammern gesetzt. Wenn sich die Darbietung ändern soll, etwa von normal zu [worried], fügen Sie einfach ein Audio Tag hinzu.
Sie können auch mehrere Tags in einem Satz verwenden und sie für eine vielschichtigere Darbietung kombinieren, etwa [tired] Es war ein langer Tag… [upset] Wie viele weitere Tage halte ich noch aus?
Die Architektur hinter Eleven v3 ermöglicht es dem Modell, Kontext tiefer zu erfassen als frühere Modelle. So kann es emotionalen Hinweisen, Tonwechseln, Sprecherwechseln und Kontextsignalen folgen, ohne dass ein separater Parameter oder eine Einstellung nötig ist. Sagen Sie dem Modell einfach, was die Situation erfordert, und es liefert die Zeile genau wie geplant.
Eleven v3 verarbeitet auch spontan wirkende Dialoge mit mehreren Sprechern, einschließlich Unterbrechungen, Stimmungswechseln und dem natürlichen Hin und Her echter Gespräche – allein anhand von Tags und Skriptstruktur.
Audio Tags vs. SSML
Wenn Sie mit anderen TTS-Systemen gearbeitet haben, kennen Sie wahrscheinlich die Speech Synthesis Markup Language. Plattformen wie Amazon Polly und Microsoft Azure Speech verwenden SSML-Tags wie <break> oder <emphasis>, um einem TTS-Skript zusätzlichen Kontext zu geben.
Eleven v3 unterstützt weder SSML-Pausen-Tags noch die übrigen SSML-Tags. Stattdessen übernehmen Audio Tags, Interpunktion und die Struktur eines Textes diese Rolle und bieten dabei präzise Kontrolle über die Darbietung.
Mit der folgenden Tabelle können Sie gängige SSML-Tags den Entsprechungen in Eleven v3 zuordnen.
Aus Sicht von Autorinnen und Autoren ist es deutlich einfacher, [whispers] zu einer Zeile hinzuzufügen, als eine Prosodie-Rate zu konfigurieren.
Die Kategorien von Audio Tags in v3: Darbietungen mit Audio Tags steuern
Sie können Audio Tags überall in Ihrem Skript platzieren, um die Darbietung in Echtzeit zu gestalten. Sie können auch Tags innerhalb eines Skripts oder sogar eines Satzes kombinieren.
Tags lassen sich in die folgenden Kernkategorien einteilen.
Emotionen
Diese Tags helfen Ihnen, den emotionalen Tonfall der Stimme festzulegen – ob düster, intensiv oder optimistisch. Sie können beispielsweise [sad], [angry], [happily] und [sorrowful] einzeln oder kombiniert verwenden.
Darbietung und Tempo
Hier geht es vor allem um Tonfall und Darbietung. Mit diesen Tags passen Sie Lautstärke und Energie für Szenen an, die Zurückhaltung oder Nachdruck erfordern. Beispiele sind [whispers], [shouts] und [softly].
Menschliche Reaktionen
Natürliches Sprechen umfasst Reaktionen. Sie können damit Realismus erzeugen, indem Sie natürliche, ungeplante Momente in die Sprache einbetten. Tags wie [laughs], [clears throat] und [sighs] helfen dabei, ein TTS-Modell zu schaffen, das menschliche Emotionen vermitteln kann.
Weitere Beispiele für Audio-Tag-Kategorien:
- Akzente und Charakterstimmen: Akzent-Tags versetzen die Stimme in eine bestimmte Region oder Persona, ohne das Modell zu wechseln, etwa [French accent], [British accent] oder [pirate voice]. So verwandeln Sie eine einzelne Stimme in ein flexibles Ensemble statt in eine festgelegte Darbietung.
- Soundeffekte: Tags für Soundeffekte fügen nichtsprachliche Audios direkt in die Generierung ein, etwa [gunshot], [explosion] und [clapping]. Sie eignen sich gut für immersives Audio, Spiele und dramatisierte Erzählungen, in denen die Szene mehr als eine Stimme braucht. Alternativ können Sie den ElevenCreative KI-Soundeffekt-Generator verwenden.
Tags geben Ihnen ein hohes Maß an Kontrolle, doch auch mit Interpunktion können Sie Rhythmus und Betonung gestalten. Fügen Sie etwa Auslassungspunkte für eine natürliche Pause ein oder nutzen Sie Kommas für natürliche Atempausen. Schreiben Sie ein Wort in Großbuchstaben, um es zu betonen: „Ich will es JETZT.“
Was können Sie mit Audio Tags tun?
Audio Tags erschließen die emotionale Komplexität von Skripten auf intuitive Weise. Schreiben Sie natürlich und fügen Sie Tags nach Bedarf hinzu.
Hier erhalten Sie einen kurzen Überblick über einige Anwendungsfälle für emotionales TTS mit Audio Tags.
Situationsbewusstsein in KI-Audio
Tags wie [whisper] oder [shouting] ermöglichen Eleven v3, auf den Moment zu reagieren. Vom Abschwächen einer Warnung bis zum Halten einer verlängerten Pause für Spannung können Sie dynamisches Situationsbewusstsein in Ihr Skript integrieren.
Eine ausführliche Erklärung finden Sie in unserem Leitfaden zu Situationsbewusstsein in KI-Audio.
Charakterdarstellung in Sprache steuern
Wenn Sie ein Skript mit mehreren Figuren entwickeln, möchten Sie klar zeigen, wie sich jede Stimme unterscheidet. Von der Gestaltung ihrer Persönlichkeit mit [sarcastically] bis zur Definition ihrer Sprechweise mit [British accent] können Sie mit unserer TTS-Engine das gesamte Spektrum von Emotionen erfassen.
Erfahren Sie mehr über die Steuerung der Charakterdarstellung in KI-Sprache.
Emotionalen Kontext in Sprache ausdrücken
Mit Audio Tags können Sie die emotionale Darbietung einer Zeile im Verlauf gestalten. Sie können Emotionen während einer Rede aufbauen und genau dann einen Höhepunkt erreichen, wenn Sie Ihre Figur auf ihrem emotionalen Höhepunkt sehen. Tags wie [awe], [booming] und [big laugh] helfen Ihnen, Ihrer KI-Stimmendarbietung ein vollständiges emotionales Spektrum zu geben.
Lesen Sie mehr über den Einsatz von emotionalem Kontext in KI-Sprache.
Dialoge mit mehreren Figuren zum Leben erwecken
Bei Dialogen mit mehreren Figuren können Sie jede Zeile mit einem Audio Tag beginnen, um reichhaltige Gespräche zwischen den Figuren zu gestalten.
Nehmen Sie folgendes Beispiel: Tom: [coughing] [beginning to speak] Entschuldigung, ich bin heute etwas krank— Emma: [interrupting] —Krank? Du weißt doch, wie sehr ich Husten hasse, Tom! Tom: [surprised] Es ist nur ein kleiner Husten, nichts Ernstes. Wie würdest du dich fühlen, wenn— Emma: [overlapping] [annoyed] —Ich glaube, du musst nach Hause gehen.
Erfahren Sie, was Sie noch mit Dialogen mit mehreren Figuren in Eleven v3 tun können.
Präzise Steuerung der Darbietung für KI-Sprache
Mit Eleven v3 können Sie das Sprechtempo über Audio Tags oder Interpunktion steuern. Tags wie [pause], [rushed] oder [drawn out] ermöglichen es Ihnen, die Zeile präzise zu gestalten. Alternativ fügen Sie Auslassungspunkte, Punkte und Ausrufezeichen hinzu, um Emotionen natürlich in Ihre TTS-Darbietung einzubauen.
Wir haben einen ausführlichen Leitfaden über präzise Steuerung der Darbietung in Eleven v3 geschrieben.
Emotionales TTS ist über die API verfügbar
Audio Tags funktionieren über die Text to Speech API genauso wie in der ElevenLabs-Benutzeroberfläche. Schreiben Sie das Tag direkt in den Skripttext. Die API liefert die getaggte Darbietung im generierten Audio zurück – von Hörbuch-Pipelines bis zu Werbe-Voiceovers.
Erfahren Sie mehr über Eleven v3 oder kontaktieren Sie den Vertrieb, um noch heute loszulegen.




