Expressiver Modus
Erstellen Sie Sprachagenten, die Tonfall, Timing und emotionalen Ausdruck anhand des Gesprächskontexts anpassen.
Überblick
Der expressive Modus ermöglicht Agenten eine Sprache, die Absicht, Emotionen und Betonung widerspiegelt. Sie passt sich in Echtzeit daran an, wie Nutzer klingen und was sie sagen. Er basiert auf zwei Verbesserungen auf Systemebene im Konversations-Stack:
- Eleven v3 Conversational — das emotional intelligenteste, kontextbewusste Text to Speech-Modell in ElevenAgents.
- Ein neues System für Sprecherwechsel — präziser getimte Antworten mit weniger Unterbrechungen.
Der expressive Modus ist standardmäßig aktiviert, wenn Sie Eleven v3 Conversational als TTS-Modell Ihres Agenten auswählen.
Eleven v3 Conversational
Eleven v3 Conversational ist eine Version von Eleven v3 mit extrem niedriger Latenz, optimiert für Live-Dialoge. Es behält den Gesprächskontext über mehrere Gesprächszüge hinweg bei und passt die Ausdrucksweise an Tonfall und Absicht jedes Austauschs an.
- Kontextbewusste Ausdrucksweise: Agenten passen ihren Tonfall an den Gesprächskontext an — sie reagieren ruhiger, wenn ein Nutzer besorgt klingt, oder direkter, wenn Klarheit wichtig ist.
- Explizite emotionale Steuerung: Steuern Sie die Ausdrucksweise über Regeln im System-Prompt, von präzisen Auslösern bis zu breiteren Szenarien, um Markenstimme und Compliance-Anforderungen einzuhalten.
- Unterstützung für mehr als 70 Sprachen: Erweitert von etwa 32 Sprachen in Flash-Modellen, mit verbesserter Ausdrucksstärke in Sprachen, in denen Nuancen bislang schwächer waren, darunter Japanisch.
- Ausdrucks-Tags: Das LLM kann Tags wie
[laughs],[whispers]oder[sighs]ausgeben, um bestimmte Momente der Ausdrucksweise zu steuern.
Eleven v3 Conversational kostet in Agents genauso viel wie andere ElevenLabs-TTS-Modelle, ab 0,08 $ pro Minute.
System für Sprecherwechsel
Das neue System für Sprecherwechsel nutzt Echtzeitsignale von Scribe v2 Realtime — darunter emotionale Hinweise und Sprachmuster —, um zu bestimmen, wann ein Agent sprechen, pausieren oder warten soll. So reagieren Agenten natürlicher, besonders in emotional aufgeladenen Situationen.
Zum Beispiel kann „ja“ eine vollständige Bestätigung oder der Beginn einer weiteren Äußerung sein. Indem das System zusätzlich zum Transkript analysiert, wie etwas gesagt wurde, etwa anhand von Sprachhinweisen wie Prosodie, timt es die Antwort des Agenten natürlicher.
Das Verhalten bei Sprecherwechseln lässt sich zusätzlich mit der Einstellung für Gesprächsbereitschaft abstimmen.
Konfiguration
Expressiven Modus aktivieren
TTS-Modell auswählen
Setzen Sie das TTS-Modell Ihres Agenten auf V3 Conversational. Mit diesem Modell ist der expressive Modus standardmäßig aktiviert.
Über das Dashboard aktualisieren
Über die CLI aktualisieren
Über die API aktualisieren
Öffnen Sie Ihren Agenten im Dashboard, wechseln Sie zum Tab Agentenstimme und wählen Sie V3 Conversational als Text to Speech-Modell aus. Speichern Sie Ihre Änderungen.

Beispiele für System-Prompts
Steuern Sie die emotionale Ausdrucksweise Ihres Agenten mit Anweisungen in natürlicher Sprache im System-Prompt. Das Modell interpretiert diese kontextbezogen, daher sind für nicht jede Situation explizite Tags erforderlich.
Allgemeine Richtlinien
Spezifische Auslöser
Ausdrucks-Tags verwenden
Zusätzlich zur kontextbewussten Ausdrucksweise kann das LLM explizite Tags ausgeben, um bestimmte Momente zu steuern. Häufige Tags sind:
[laughs]— Fügt der Sprache Lachen hinzu[whispers]— Verringert die Lautstärke für Flüstern[sighs]— Fügt einen seufzenden Charakter hinzu[slow]— Verlangsamt die Sprechweise[excited]— Verleiht der Ausdrucksweise Begeisterung
Jedes Tag wirkt sich auf etwa die nächsten 4–5 gesprochenen Wörter aus, bevor die normale Ausdrucksweise fortgesetzt wird.
Best Practices
Ausdrucksweise an den Kontext anpassen
Leiten Sie Ihren Agenten an, seine emotionale Ausdrucksweise an die Situation anzupassen. Ein frustrierter Kunde sollte eine ruhige, empathische Antwort hören. Ein Nutzer, der gute Nachrichten teilt, sollte echte Wärme hören. Ein unpassender Tonfall untergräbt Vertrauen.
Für Konsistenz Regeln im System-Prompt verwenden
Definieren Sie klare Richtlinien für den Tonfall in Ihrem System-Prompt, statt sich allein auf das Urteil des Modells zu verlassen. Das sorgt für eine konsistente Ausdrucksweise, die Ihrer Markenstimme und Compliance-Anforderungen entspricht.
Sprachübergreifend testen
Die expressive Ausdrucksweise kann sich zwischen Sprachen unterscheiden. Testen Sie Ihren Agenten in jeder Zielsprache, um sicherzustellen, dass die emotionale Nuance wie beabsichtigt ankommt, insbesondere in Sprachen mit anderen Gesprächsnormen.
Mit Einstellungen für Gesprächsbereitschaft kombinieren
Kombinieren Sie den expressiven Modus mit passenden Einstellungen für Gesprächsbereitschaft. Der geduldige Modus gibt Nutzern in emotional sensiblen Gesprächen mehr Raum, während der eifrige Modus für schnelle Interaktionen geeignet ist.
Überwachen und iterieren
Nutzen Sie Gesprächsanalysen, um nachzuverfolgen, wie Nutzer auf die expressive Ausdrucksweise reagieren. Verfeinern Sie Ihre Tonfallrichtlinien anhand von Gesprächsergebnissen und Nutzerfeedback.
Einschränkungen
- Eleven v3 Conversational bewahrt die Eigenschaften professioneller Stimmklone (PVCs) nicht — die Ausgabe klingt möglicherweise nicht wie die ursprüngliche PVC-Stimme.
- Die Effekte von Ausdrucks-Tags halten etwa 4–5 Wörter an, bevor die normale Ausdrucksweise zurückkehrt.
- Die Ausdrucksstärke kann je nach Stimme und Sprache variieren.
FAQ
Kostet der expressive Modus mehr?
Nein. Eleven v3 Conversational kostet in Agents genauso viel wie andere ElevenLabs-TTS-Modelle, ab 0,08 $ pro Minute.
Wie aktiviere ich den expressiven Modus?
Wählen Sie V3 Conversational als TTS-Modell Ihres Agenten. Mit diesem Modell ist der expressive Modus standardmäßig aktiviert.
Wie funktioniert das System für Sprecherwechsel?
Das System nutzt Echtzeitsignale von Scribe v2 Realtime, darunter emotionale Hinweise und Sprachmuster, um vorherzusagen, wann der Agent antworten soll. Es analysiert sowohl das Transkript als auch die Art, wie Wörter gesprochen wurden, etwa die Prosodie, um Antworten natürlich zu timen.
Kann ich den expressiven Modus mit meinem professionellen Stimmklon verwenden?
Eleven v3 Conversational bewahrt PVC-Eigenschaften derzeit nicht gut. Wenn es entscheidend ist, die Stimmidentität Ihres PVC zu erhalten, sollten Sie stattdessen Flash v2 verwenden.
Wie viele Sprachen unterstützt Eleven v3 Conversational?
Eleven v3 Conversational unterstützt mehr als 70 Sprachen, erweitert von etwa 32 in Flash-Modellen. Dazu gehört eine verbesserte Ausdrucksstärke in Sprachen wie Japanisch, in denen Nuancen bislang schwächer waren.
Wie schneidet dies im Vergleich zu anderen TTS-Modellen in ElevenAgents ab?
Eleven v3 Conversational bietet einen größeren emotionalen Umfang als Flash und Multilingual v2 und kann die Ausdrucksweise anhand des Gesprächskontexts anpassen. Es unterstützt mehr als 70 Sprachen, verglichen mit etwa 32 bei Flash. Der Preis entspricht dem anderer Modelle.