Zum Inhalt springen

Was sind Audio-Tags? Der vollständige Leitfaden für emotionales TTS

Verfasst von
Jack Limebear
Veröffentlicht
Zuletzt aktualisiert

AnhörenArtikel anhören

Audio-Tags sind Hinweise in eckigen Klammern in natürlicher Sprache, etwa [laughs], [gasps], [excited] und [worried], die Eleven v3 als Regieanweisungen statt als zu sprechende Wörter interpretiert. Wenn Sie ein Skript für ein Text-to-Speech-Modell schreiben, geben Ihnen diese Audio-Tags detaillierte Kontrolle über die emotionale Darbietung Ihres Textes. 

Eleven v3 wurde im März 2026 öffentlich verfügbar. Vor v3 bedeutete es, für ein Text-to-Speech-Modell eine bestimmte emotionale Darbietung zu erhalten, Inhalte neu zu generieren und auf das Beste zu hoffen. Text to Speech Audio-Tags beseitigen dieses Rätselraten und geben Ihnen volle Kontrolle über eine emotionale Text-to-Speech-Darbietung.

Dieser Leitfaden erklärt, was Audio-Tags sind, wie sie funktionieren, welche Tag-Kategorien verfügbar sind und wie sie sich von SSML (Speech Synthesis Markup Language) unterscheiden. Außerdem behandeln wir häufige Anwendungsfälle, jeweils mit einem Link zum passenden Leitfaden.

Zusammenfassung:

  • Audio-Tags sind Hinweise in eckigen Klammern wie [shouts] oder [excited], die Emotion, Tempo, Darbietung und Ton innerhalb von TTS in Eleven v3 steuern.
  • Eleven v3 unterstützt kein SSML, ersetzt es jedoch durch Audio-Tags für ein natürlicheres Schreiben.
  • Tags umfassen verschiedene Kategorien wie Emotionen, Darbietung und Tempo, menschliche Reaktionen, Akzente und Soundeffekte.
  • Mit Zeichensetzung und Großschreibung in Ihrem Text können Sie das Tempo einer KI-Stimmendarbietung gestalten.
  • Sie können über die UI oder API auf Audio-Tags in ElevenLabs zugreifen.

Wie funktionieren Audio-Tags?

Audio-Tags stehen direkt in Ihrem Transkript und sind in eckige Klammern gesetzt. Wann immer Sie die Darbietung ändern möchten, etwa von normal zu [worried], müssen Sie einfach ein Audio-Tag hinzufügen.

Sie können auch mehr als ein Tag in einem Satz verwenden und Tags für eine vielschichtigere Darbietung kombinieren, etwa [tired] Es war ein langer Tag… [upset] Wie viele Tage halte ich noch durch?

Die Architektur hinter Eleven v3 ermöglicht dem Modell, Kontext tiefer zu erfassen als frühere Modelle. So kann es emotionalen Hinweisen, Tonwechseln, Sprecherwechseln und Kontextsignalen folgen, ohne dass ein separater Parameter oder eine Einstellung nötig ist. Sagen Sie dem Modell einfach, was der Moment erfordert, und es liefert die Zeile genau wie geplant.

Eleven v3 verarbeitet auch spontan wirkende Dialoge mit mehreren Sprechern, einschließlich Unterbrechungen, Stimmungswechseln und dem natürlichen Hin und Her echter Gespräche – allein anhand von Tags und Skriptstruktur. 

Audio-Tags vs. SSML

Wenn Sie mit anderen TTS-Systemen gearbeitet haben, kennen Sie wahrscheinlich die Speech Synthesis Markup Language. Plattformen wie Amazon Polly und Microsoft Azure Speech nutzen SSML-Tags wie <break> oder <emphasis>, um einem TTS-Skript zusätzlichen Kontext zu geben. 

Eleven v3 unterstützt weder SSML-Break-Tags noch die übrigen SSML-Tags. Stattdessen übernehmen Audio-Tags, Zeichensetzung und die Struktur eines Textes diese Rolle und bieten gleichzeitig detaillierte Kontrolle über die Darbietung.

Mit der folgenden Tabelle können Sie gängige SSML-Tags ihren Entsprechungen in Eleven v3 zuordnen.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Aus Sicht von Autoren ist es deutlich einfacher, [whispers] zu einer Zeile hinzuzufügen, als eine Prosodie-Rate zu konfigurieren.

Die Kategorien von Audio-Tags in v3: Darbietungen mit Audio-Tags steuern

Sie können Audio-Tags überall in Ihrem Skript platzieren, um die Darbietung in Echtzeit zu gestalten. Sie können auch Tag-Kombinationen in einem Skript oder sogar einem Satz verwenden.

Tags lassen sich in die folgenden Kernkategorien einteilen.

Emotionen

Mit diesen Tags können Sie den emotionalen Ton der Stimme festlegen – ob düster, intensiv oder fröhlich. Sie könnten zum Beispiel [sad], [angry], [happily] und [sorrowful] einzeln oder kombiniert verwenden.

Background
Background

Darbietung und Tempo

Hier geht es stärker um Ton und Darbietung. Mit diesen Tags passen Sie Lautstärke und Energie für Szenen an, die Zurückhaltung oder Nachdruck erfordern. Beispiele sind [whispers], [shouts] und [softly].

Background
Background

Menschliche Reaktionen

Natürliches Sprechen umfasst echte Reaktionen. So können Sie Realismus erzeugen, indem Sie natürliche, nicht geskriptete Momente in Sprache einbetten. Tags wie [laughs], [clears throat] und [sighs] helfen dabei, ein TTS-Modell zu erstellen, das menschliche Emotionen vermitteln kann.

Weitere Beispiele für Audio-Tag-Kategorien sind:

  • Akzente und Charakterstimmen: Akzent-Tags versetzen die Stimme in eine bestimmte Region oder Persona, ohne das Modell zu wechseln, etwa [French accent], [British accent] oder [pirate voice]. So wird aus einer einzelnen Stimme ein flexibles Ensemble statt einer festen Darbietung.
  • Soundeffekte: Soundeffekt-Tags fügen nichtsprachliche Audios direkt in die Generierung ein, etwa [gunshot], [explosion] und [clapping]. Sie eignen sich gut für immersives Audio, Spiele und dramatisierte Erzählungen, wenn eine Szene mehr als eine Stimme braucht. Alternativ nutzen Sie den ElevenCreative KI-Soundeffekt-Generator.

Tags bieten Ihnen ein hohes Maß an Kontrolle, doch Sie können auch Zeichensetzung nutzen, um Rhythmus und Betonung zu gestalten. Fügen Sie beispielsweise Auslassungspunkte für eine natürliche Pause hinzu oder verwenden Sie Kommas für natürliche Atempausen. Schreiben Sie ein Wort komplett groß, um es zu betonen: „Ich will es JETZT.“

Background
Background

Was können Sie mit Audio-Tags tun?

Audio-Tags erschließen die emotionale Komplexität von Skripten auf intuitive Weise. Schreiben Sie natürlich und fügen Sie Tags nach Bedarf hinzu.

Hier ist ein kurzer Überblick über einige Anwendungsfälle für emotionales TTS mit Audio-Tags.

Situationsbewusstsein in KI-Audio

Tags wie [whisper] oder [shouting] ermöglichen Eleven v3, auf den Moment zu reagieren. Vom Abschwächen einer Warnung bis zum Setzen einer verlängerten Pause für Spannung können Sie dynamisches Situationsbewusstsein in Ihr Skript integrieren.

Eine vollständige Übersicht finden Sie in unserem Leitfaden zu Situationsbewusstsein in KI-Audio.

Charakterdarstellung in Sprache steuern

Wenn Sie ein Skript mit mehreren Charakteren entwickeln, möchten Sie klar zeigen, wie sich jede Stimme unterscheidet. Von der Gestaltung der Persönlichkeit mit [sarcastically] bis zur Definition der Sprechweise mit [British accent] können Sie mit unserer TTS-Engine ein vollständiges Spektrum an Emotionen abbilden.

Erfahren Sie mehr über die Steuerung der Charakterdarstellung in KI-Sprache.

Emotionalen Kontext in Sprache ausdrücken

Mit Audio-Tags können Sie die emotionale Darbietung einer Zeile im Verlauf gestalten. Sie können Emotionen über eine Rede hinweg aufbauen und genau dann einen Höhepunkt erreichen, wenn Sie Ihren Charakter auf dem Höhepunkt seiner Möglichkeiten sehen. Tags wie [awe], [booming] und [big laugh] helfen Ihnen, eine vollständige emotionale Bandbreite in Ihre KI-Stimmendarbietung einzubauen.

Lesen Sie mehr über den Einsatz von emotionalem Kontext in KI-Sprache

Dialoge mit mehreren Charakteren zum Leben erwecken

Bei Dialogen mit mehreren Charakteren können Sie jede Zeile mit einem Audio-Tag beginnen, um lebendige Charaktergespräche zu gestalten. 

Beispiel: Tom: [coughing] [beginning to speak] Entschuldigung, ich bin heute etwas erkältet— Emma: [interrupting] —Erkältet? Du weißt, wie sehr ich Husten hasse, Tom! Tom: [surprised] Es ist nur ein kleiner Husten, nichts Ernstes. Wie würdest du dich fühlen, wenn— Emma: [overlapping] [annoyed] —Ich glaube, du solltest nach Hause gehen. 

Erfahren Sie, was Sie sonst noch mit Dialogen mit mehreren Charakteren in Eleven v3 tun können.

Präzise Steuerung der Darbietung für KI-Sprache

Mit Eleven v3 können Sie das Sprechtempo über Audio-Tags oder Zeichensetzung steuern. Tags wie [pause], [rushed] oder [drawn out] ermöglichen es Ihnen, eine Zeile präzise zu gestalten. Alternativ fügen Sie Auslassungspunkte, Punkte und Ausrufezeichen hinzu, um Emotionen natürlich in Ihre TTS-Darbietung einzubauen.

Wir haben einen ausführlichen Leitfaden über präzise Steuerung der Darbietung in Eleven v3 geschrieben.

Emotionales TTS ist über die API verfügbar

Audio-Tags funktionieren über die Text to Speech API genauso wie in der ElevenLabs-UI. Schreiben Sie das Tag direkt in den Skripttext. Die API gibt die markierte Darbietung im generierten Audio zurück – von Hörbuch-Pipelines bis zu Werbe-Voiceovers. 

Erfahren Sie mehr über Eleven v3 oder kontaktieren Sie den Vertrieb, um heute zu starten.

FAQ zu Audio-Tags und emotionalem TTS

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio