Wir stellen Eleven v4 vorLernen Sie Eleven v4 kennen, unser bisher ausdrucksstärkstes Modell. Mit 3× Credits im Creator+-Tarif bis zum 12. Oktober

Zum Inhalt springen

Was sind Audio Tags? Der vollständige Leitfaden für emotionales TTS

Verfasst von
Jack Limebear
Veröffentlicht
Zuletzt aktualisiert

AnhörenArtikel anhören

Audio Tags sind natürlichsprachliche Hinweise in eckigen Klammern wie [laughs], [gasps], [excited] und [worried], die Eleven v3 als Regieanweisungen statt als auszusprechende Wörter versteht. Wenn Sie ein Skript für ein Text to Speech-Modell schreiben, geben Ihnen diese Audio Tags präzise Kontrolle über die emotionale Darbietung Ihres Textes. 

Eleven v3 wurde im März 2026 öffentlich verfügbar. Vor v3 bedeutete es, aus einem Text to Speech-Modell eine bestimmte emotionale Darbietung zu erhalten, Inhalte neu zu generieren und auf das Beste zu hoffen. Audio Tags beseitigen dieses Rätselraten und geben Ihnen volle Kontrolle über eine emotionale Text to Speech-Darbietung.

Dieser Leitfaden erklärt, was Audio Tags sind, wie sie funktionieren, welche Tag-Kategorien verfügbar sind und wie sie sich von SSML (Speech Synthesis Markup Language) unterscheiden. Außerdem behandeln wir häufige Anwendungsfälle, jeweils mit einem eigenen Leitfaden.

Zusammenfassung

  • Audio Tags sind Hinweise in eckigen Klammern wie [shouts] oder [excited], die Emotion, Tempo, Darbietung und Tonfall in TTS mit Eleven v3 steuern.
  • Eleven v3 unterstützt kein SSML, ersetzt es aber durch Audio Tags für ein natürlicheres Schreiberlebnis.
  • Tags decken mehrere Kategorien ab, darunter Emotionen, Darbietung und Tempo, menschliche Reaktionen, Akzente und Soundeffekte.
  • Interpunktion und Großschreibung in Ihrem Text ermöglichen es Ihnen, das Tempo einer KI-Stimmendarbietung zu gestalten.
  • Sie können in ElevenLabs über die Benutzeroberfläche oder die API auf Audio Tags zugreifen.

Wie funktionieren Audio Tags?

Audio Tags stehen direkt in Ihrem Transkript und sind in eckige Klammern gesetzt. Wenn sich die Darbietung ändern soll, etwa von normal zu [worried], fügen Sie einfach ein Audio Tag hinzu.

Sie können auch mehrere Tags in einem Satz verwenden und sie für eine vielschichtigere Darbietung kombinieren, etwa [tired] Es war ein langer Tag… [upset] Wie viele weitere Tage halte ich noch aus?

Die Architektur hinter Eleven v3 ermöglicht es dem Modell, Kontext tiefer zu erfassen als frühere Modelle. So kann es emotionalen Hinweisen, Tonwechseln, Sprecherwechseln und Kontextsignalen folgen, ohne dass ein separater Parameter oder eine Einstellung nötig ist. Sagen Sie dem Modell einfach, was die Situation erfordert, und es liefert die Zeile genau wie geplant.

Eleven v3 verarbeitet auch spontan wirkende Dialoge mit mehreren Sprechern, einschließlich Unterbrechungen, Stimmungswechseln und dem natürlichen Hin und Her echter Gespräche – allein anhand von Tags und Skriptstruktur. 

Audio Tags vs. SSML

Wenn Sie mit anderen TTS-Systemen gearbeitet haben, kennen Sie wahrscheinlich die Speech Synthesis Markup Language. Plattformen wie Amazon Polly und Microsoft Azure Speech verwenden SSML-Tags wie <break> oder <emphasis>, um einem TTS-Skript zusätzlichen Kontext zu geben. 

Eleven v3 unterstützt weder SSML-Pausen-Tags noch die übrigen SSML-Tags. Stattdessen übernehmen Audio Tags, Interpunktion und die Struktur eines Textes diese Rolle und bieten dabei präzise Kontrolle über die Darbietung.

Mit der folgenden Tabelle können Sie gängige SSML-Tags den Entsprechungen in Eleven v3 zuordnen.

What it does
<break time=”1s”>
Inserts a pause
<prosody rate=”slow”>
Slows down speech
<prosody rate=”fast”>
Speeds speech up
<emphasis>
Stresses a particular word
<prosody pitch=”high”>
Shifts pitch higher
<prosody pitch=”low”>
Shifts pitch lower
Eleven v3 equivalent
<break time=”1s”>
[pause], an ellipsis in your text, or a line break
<prosody rate=”slow”>
[drawn out] or [slowly]
<prosody rate=”fast”>
[rushed]
<emphasis>
[shouts] or capitalizing a word
<prosody pitch=”high”>
Emotional tags like [excited]
<prosody pitch=”low”>
Emotional TTS tags like [softly] or [sorrowful]

Aus Sicht von Autorinnen und Autoren ist es deutlich einfacher, [whispers] zu einer Zeile hinzuzufügen, als eine Prosodie-Rate zu konfigurieren.

Die Kategorien von Audio Tags in v3: Darbietungen mit Audio Tags steuern

Sie können Audio Tags überall in Ihrem Skript platzieren, um die Darbietung in Echtzeit zu gestalten. Sie können auch Tags innerhalb eines Skripts oder sogar eines Satzes kombinieren.

Tags lassen sich in die folgenden Kernkategorien einteilen.

Emotionen

Diese Tags helfen Ihnen, den emotionalen Tonfall der Stimme festzulegen – ob düster, intensiv oder optimistisch. Sie können beispielsweise [sad], [angry], [happily] und [sorrowful] einzeln oder kombiniert verwenden.

[sorrowful] I couldn't sleep that night. The air was too still, and the moonlight kept sliding through the blinds like it was trying to tell me something.
[quietly] And suddenly,
that's when I saw it.
0:00
Okay, you are not going to believe this. You know how I've been totally stuck on that short story, like staring at the screen for hours, just nothing? [sighs] I was seriously about to just trash the whole thing, start over, give up probably.
But then [chuckles] last night, I was just doodling, not even thinking about it, right? And this one little phrase popped into my head, just completely out of the blue. And it wasn't even for the story initially, but then I typed it out just to see, and it was like the floodgates opened. Suddenly, I knew exactly where the character needed to go, what the ending had to be. It all just clicked. [sighs] I stayed up till like 3:00 a.m. just typing like a maniac. Didn't even stop for coffee. [chuckles] And it's, it's good, like really good. It feels so complete now, you know? Like it finally has a soul. [sighs] I am so incredibly pumped to finish editing it now. It went from feeling like a chore to feeling like
magic. Seriously, I'm still buzzing.
0:00

Darbietung und Tempo

Hier geht es vor allem um Tonfall und Darbietung. Mit diesen Tags passen Sie Lautstärke und Energie für Szenen an, die Zurückhaltung oder Nachdruck erfordern. Beispiele sind [whispers], [shouts] und [softly].

Could you switch my accent in the old model? [dismissive] Didn't think so, [cheeky] but you can now, so check this out. In just a sec, I'm going to speak with a different accent. And just between you and me, [whispers] I don't really know how, but okay. First, let's change it up [australian accent] so that I can fit in with the locals in Melbourne when I visit next month. [laughing] Whoa. Yeah, man, this is sick. Okay, let's try a different one, see if you can guess. [french accent] My love is like a red, red rose.
0:00
So, I was thinking we could-
[jumping in] Test our new timing features.
[surprised] Exactly! How did you-
[overlapping] Know what you were thinking? Lucky guess. Sorry, go ahead.
[cautiously] Okay. So if we both try to talk at the same time-
We'll probably crash the system?
[panicking] Wait, are we crashing? I can't tell if this is a feature or a-
[interrupting] Bug. Did I just cut you off again?
[sighing] Yes. But honestly, this is kind of fun.
0:00

Menschliche Reaktionen

Natürliches Sprechen umfasst Reaktionen. Sie können damit Realismus erzeugen, indem Sie natürliche, ungeplante Momente in die Sprache einbetten. Tags wie [laughs], [clears throat] und [sighs] helfen dabei, ein TTS-Modell zu schaffen, das menschliche Emotionen vermitteln kann.

Weitere Beispiele für Audio-Tag-Kategorien:

  • Akzente und Charakterstimmen: Akzent-Tags versetzen die Stimme in eine bestimmte Region oder Persona, ohne das Modell zu wechseln, etwa [French accent], [British accent] oder [pirate voice]. So verwandeln Sie eine einzelne Stimme in ein flexibles Ensemble statt in eine festgelegte Darbietung.
  • Soundeffekte: Tags für Soundeffekte fügen nichtsprachliche Audios direkt in die Generierung ein, etwa [gunshot], [explosion] und [clapping]. Sie eignen sich gut für immersives Audio, Spiele und dramatisierte Erzählungen, in denen die Szene mehr als eine Stimme braucht. Alternativ können Sie den ElevenCreative KI-Soundeffekt-Generator verwenden.

Tags geben Ihnen ein hohes Maß an Kontrolle, doch auch mit Interpunktion können Sie Rhythmus und Betonung gestalten. Fügen Sie etwa Auslassungspunkte für eine natürliche Pause ein oder nutzen Sie Kommas für natürliche Atempausen. Schreiben Sie ein Wort in Großbuchstaben, um es zu betonen: „Ich will es JETZT.“

We're off under the lights here for this semifinal clash, the stadium buzzing with anticipation. Eleven Labs united in their iconic black and white shirts, pushing forward with intent straight from the opening whistle. [excited] The ball is zipped out wide, early attack here. Driving down the wing, pace to burn, [shouting] he skids past one, skips past two. Oh, this is beautiful. One-on-one with the fullback, cuts inside. Oh, that's a lovely bit of footwork. PURE MAGIC on the pitch. ElevenLabs on top form tonight.
0:00
Oh my God. [laughing] You guys, like no joke, I just tried this TTS thing and it was, like, weirdly emotional. Like, it literally said hi, and I was, like, on the verge of tears. [laughing] I don't even cry, okay? I'm a Capricorn.
0:00

Was können Sie mit Audio Tags tun?

Audio Tags erschließen die emotionale Komplexität von Skripten auf intuitive Weise. Schreiben Sie natürlich und fügen Sie Tags nach Bedarf hinzu.

Hier erhalten Sie einen kurzen Überblick über einige Anwendungsfälle für emotionales TTS mit Audio Tags.

Situationsbewusstsein in KI-Audio

Tags wie [whisper] oder [shouting] ermöglichen Eleven v3, auf den Moment zu reagieren. Vom Abschwächen einer Warnung bis zum Halten einer verlängerten Pause für Spannung können Sie dynamisches Situationsbewusstsein in Ihr Skript integrieren.

Eine ausführliche Erklärung finden Sie in unserem Leitfaden zu Situationsbewusstsein in KI-Audio.

Charakterdarstellung in Sprache steuern

Wenn Sie ein Skript mit mehreren Figuren entwickeln, möchten Sie klar zeigen, wie sich jede Stimme unterscheidet. Von der Gestaltung ihrer Persönlichkeit mit [sarcastically] bis zur Definition ihrer Sprechweise mit [British accent] können Sie mit unserer TTS-Engine das gesamte Spektrum von Emotionen erfassen.

Erfahren Sie mehr über die Steuerung der Charakterdarstellung in KI-Sprache.

Emotionalen Kontext in Sprache ausdrücken

Mit Audio Tags können Sie die emotionale Darbietung einer Zeile im Verlauf gestalten. Sie können Emotionen während einer Rede aufbauen und genau dann einen Höhepunkt erreichen, wenn Sie Ihre Figur auf ihrem emotionalen Höhepunkt sehen. Tags wie [awe], [booming] und [big laugh] helfen Ihnen, Ihrer KI-Stimmendarbietung ein vollständiges emotionales Spektrum zu geben.

Lesen Sie mehr über den Einsatz von emotionalem Kontext in KI-Sprache. 

Dialoge mit mehreren Figuren zum Leben erwecken

Bei Dialogen mit mehreren Figuren können Sie jede Zeile mit einem Audio Tag beginnen, um reichhaltige Gespräche zwischen den Figuren zu gestalten. 

Nehmen Sie folgendes Beispiel: Tom: [coughing] [beginning to speak] Entschuldigung, ich bin heute etwas krank— Emma: [interrupting] —Krank? Du weißt doch, wie sehr ich Husten hasse, Tom! Tom: [surprised] Es ist nur ein kleiner Husten, nichts Ernstes. Wie würdest du dich fühlen, wenn— Emma: [overlapping] [annoyed] —Ich glaube, du musst nach Hause gehen. 

Erfahren Sie, was Sie noch mit Dialogen mit mehreren Figuren in Eleven v3 tun können.

Präzise Steuerung der Darbietung für KI-Sprache

Mit Eleven v3 können Sie das Sprechtempo über Audio Tags oder Interpunktion steuern. Tags wie [pause], [rushed] oder [drawn out] ermöglichen es Ihnen, die Zeile präzise zu gestalten. Alternativ fügen Sie Auslassungspunkte, Punkte und Ausrufezeichen hinzu, um Emotionen natürlich in Ihre TTS-Darbietung einzubauen.

Wir haben einen ausführlichen Leitfaden über präzise Steuerung der Darbietung in Eleven v3 geschrieben.

Emotionales TTS ist über die API verfügbar

Audio Tags funktionieren über die Text to Speech API genauso wie in der ElevenLabs-Benutzeroberfläche. Schreiben Sie das Tag direkt in den Skripttext. Die API liefert die getaggte Darbietung im generierten Audio zurück – von Hörbuch-Pipelines bis zu Werbe-Voiceovers. 

Erfahren Sie mehr über Eleven v3 oder kontaktieren Sie den Vertrieb, um noch heute loszulegen.

FAQ zu Audio Tags und emotionalem TTS

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio