Wir stellen Eleven v4 vorLernen Sie Eleven v4 kennen, unser bisher ausdrucksstärkstes Modell. Mit 3× Credits im Creator+-Tarif bis zum 12. Oktober

Zum Inhalt springen

Emotional Text to Speech: So steuern Sie KI-Sprachperformances mit Eleven v4

Verfasst von
Jack Limebear
Veröffentlicht
Zuletzt aktualisiert

AnhörenArtikel anhören

Emotional Text to Speech (TTS) macht aus einem Skript eine Performance. Statt eines monotonen Vortrags vermittelt ein emotionales TTS-Modell jedes Wort mit Gefühl und erweckt eine Szene mit Wut, Freude, Trauer, Frustration und mehr zum Leben.

Indem Sie Audio Tags in Ihr Skript einarbeiten, gestalten Sie die Text-to-Speech-Performance wie ein Regisseur. Fügen Sie [furious] hinzu, um die Intensität einer Zeile zu steigern, [sarcastic] für einen Hauch trockenen Humors oder ein anderes Tag, um dem Modell zu zeigen, wie eine Zeile gesprochen werden soll. 

Mit Eleven v4 steht Ihnen emotionales TTS zur Verfügung, das Sie Zeile für Zeile steuern können. So erstellen Sie Skripte, die Ihre Texte zum Leben erwecken.

Was ist emotionales Text to Speech?

Emotionales Text to Speech ist KI-generierte Sprache, die eine Zeile spielt, statt sie nur vorzulesen. Sie drückt Emotionen aus, versteht Timing und Tempo, betont die richtigen Wörter und ergänzt nonverbale Geräusche wie Seufzer und Lachen.

Eleven v4 ist ein wegweisendes Modell , das Text in eine echte Performance verwandelt. Mit Inline-Beschreibungen kann derselbe Satz geflüstert, geschrien oder unter Tränen gesprochen werden – je nachdem, was Sie sich vorstellen.

Ganz gleich, ob Sie eine Werbekampagne für Ihren nächsten Launch schreiben oder Kapitel Ihres Romans zum Leben erwecken: Eleven v4 unterstützt Sie mit Text to Speech in höchster Qualität.

Wie Eleven v4 emotionale Anweisungen interpretiert

Eleven v4 nutzt emotionale Hinweise aus den Audio Tags in Ihrem Skript und verwandelt sie in eine natürliche Audio-Performance.

So können Sie mit Eleven v4 einem Text emotionale Anweisungen hinzufügen und Ihr Endergebnis verbessern:

  • Audio Tags: Schreiben Sie Audio Tags wie [whispers] oder [cries] in Ihre Anweisungen, um Inline-Regieanweisungen in Ihr Skript einzufügen. So erstellen Sie Szenen mit emotionaler Tiefe, indem Sie v4 wie einen Bühnendarsteller anleiten.
  • Zeichensetzung: Nutzen Sie Satzzeichen, um neben Ihren Audio Tags Tempo und Vortrag zu gestalten. Auslassungspunkte verlangsamen eine Zeile, Gedankenstriche unterbrechen Sprecher mitten im Satz, und Ausrufezeichen erhöhen die Intensität. So erhalten Sie eine weitere Ebene der Steuerung ohne zusätzliches Tag.
  • Emotionale Kontinuität: Beginnen Sie einen Satz mit einer Emotion, und Eleven v4 trägt diesen Ton über die gesamte Zeile. Entwickeln Sie Ihre Szenen schrittweise und erstellen Sie mit Audio Tags auf v4 umfassende, kontextbezogene Skripte.

Um zu zeigen, wie wirkungsvoll Audio Tags Text mit v4 zum Leben erwecken, vergleichen wir als Beispiel Audio mit und ohne Tags.

In diesem ersten Beispiel verwenden wir nur einen Standardsatz. Als Referenz nutzen wir für diese Beispiele Siren.

Story-Absatz ohne Audio Tags in Eleven v4

The night was quiet, almost unnaturally so. Until I heard the old gate creak open behind me.
I turned slowly and called out, "Is anyone there?"
No answer.
Then, from somewhere in the darkness came a low, quiet laugh.
I took a step back. "You really shouldn't have come here," a voice whispered.
And then the lights went out.
0:00

In diesem zweiten Beispiel enthält derselbe Satz zusätzliche Audio Tags. Wir haben emotionale Hinweise, Soundeffekte und sogar Geräusche jenseits des Texts, etwa ein bösartiges Lachen.

Story-Absatz mit Audio Tags in Eleven v4

[hesitant] The night was quiet, almost unnaturally so.
[nervous] Then I heard the old gate creak open behind me. [gate creaking] [scared] I turned slowly and called out, "Is anyone there?"
[tense, cautious] No answer.
[silence] [whispering, fearful] Then, from somewhere in the darkness, came a low, quiet laugh. [evil laugh] [alarmed] I took a step back. [footstep] [low, threatening] "You really shouldn't have come here." A voice whispered.
[whisper] [terrified] And then the lights went out. [light switch clicking]
0:00
Eleven v4 emotional text to speech uses audio tags, punctuation, and emotional continuity to direct emotion.

Fünf emotionale Text-to-Speech-Performances mit Eleven v4

Der beste Weg, das gesamte Spektrum von Eleven v4 zu erleben, ist, es selbst auszuprobieren. Mit einem Konto können Sie Eleven v4 innerhalb weniger Minuten nutzen.

Um Ihnen kurz zu zeigen, was mit diesem emotionalen Text-to-Speech-Modell möglich ist, hören Sie hier dieselbe Zeile fünfmal. Jede Zeile hat eine andere Regieanweisung und zeigt genau, was Sie mit dem Modell umsetzen können.

Alle fünf folgenden Karten verwenden „I didn’t think you’d actually come back.“ als Text, ergänzt durch ein emotional reiches Audio Tag. Als Referenz verwenden diese Beispiele ebenfalls Siren.

[furious] hinzufügen

Konsonanten werden härter und Plosive ausgeprägter. Die Zeile klingt wütend und wirkt wie ein Vorwurf.

[furious]

[furious] I didn't think you'd actually come back
0:00

[excited] hinzufügen

Die Tonhöhe steigt und das Tempo wird schneller. Derselbe Satz wird zu einer freudigen Begrüßung.

[excited]

[excited] I didn't think you'd actually come back.
0:00

[sarcastic] hinzufügen 

Die Tonhöhe wird flacher und die Vokale werden gedehnt. Sarkasmus eignet sich besonders gut für Audio Tags, da der gesprochene Ton den geschriebenen Worten direkt widerspricht.

[sarcastic]

[sarcastic] I didn't think you'd actually come back.
0:00

[crying] hinzufügen

Das geht unter die Haut. Der Vortrag wird langsamer und bricht mitten im Satz ab. Sie werden merken, wie viel die Atmung hier bewirkt.

[crying]

[crying] I didn't think you'd actually come back.
0:00

[worried] hinzufügen

Leiser und leicht zögerlich nimmt [worried] der Zeile ihre Gewissheit.

[worried] I didn't think you'd actually come back.
0:00

Tipps für Skripte, die KI vortragen kann

Wir haben die ElevenLabs Text-to-Speech-App so intuitiv wie möglich gestaltet. Öffnen Sie die Seite und beginnen Sie zu schreiben, oder fügen Sie beschreibende Audio Tags hinzu, um bestimmte Geräusche oder Emotionen in Ihre Szene einzubetten.

Hier sind weitere Tipps für optimale Ergebnisse mit emotionalem Text to Speech von Eleven v4:

  1. Anweisungen iterativ verbessern: Wenn eine Zeile nicht überzeugt, tauschen Sie das Tag aus, statt den Text umzuschreiben. Probieren Sie [worried] statt [sad] oder [sarcastic] statt [annoyed] und generieren Sie erneut, bis der Vortrag Ihren Vorstellungen entspricht.
  2. Ganze Szenen auf einmal generieren: Einzelne Sätze können zwar zu einer nuancierten Performance führen, wie oben gezeigt, doch Eleven v4 funktioniert am besten mit Absätzen oder längeren Textpassagen. Genug Text gibt dem Modell den Kontext einer Szene und verbessert die Performance über den gesamten Abschnitt. Mit Eleven v4 können Sie pro Generierung bis zu 10.000 Zeichen in der TTS-App schreiben.
  3. Eine Emotion pro Satzteil verwenden: Sie können mehrere Audio Tags in einem Satz einsetzen, am besten verwenden Sie jedoch eines pro Satzteil, um Verwirrung zu vermeiden. Gegensätzliche Emotionen als Anweisungen können zu weniger präzisen Ergebnissen führen. Alternativ können Sie ein Tag direkt vor den gewünschten Teilsatz setzen und danach ein neues Tag einfügen, wenn sich die Emotion mitten im Satz ändern soll. 

Mit diesen Tipps verwandeln Sie Ihren Text im Handumdrehen in eine Performance.

Three tips for AI-ready scripts: iterate, generate full scenes, and use one emotion per phrase.

Mit Eleven v4 für emotionales Text to Speech starten

Alles, was Sie in diesem Artikel gesehen haben, wurde in der ElevenLabs Text-to-Speech-App mit einem Skript, einer Stimme und einigen Audio Tags auf Eleven v4 generiert.

Um eigene Szenen zu erstellen, wählen Sie einfach eine Stimme aus, fügen Sie eine selbst geschriebene Zeile ein und führen Sie bei Ihrer ersten Performance Regie.

Erfahren Sie mehr über Eleven v4 oder registrieren Sie sich, um zu starten mit Ihrer ersten Generierung.

FAQ zu emotionalem Text-to-Speech mit KI

Ähnliche Artikel

Erstellen Sie mit hochwertiger KI-Audio