Expressiver Modus

Erstellen Sie Sprachagenten, die Tonfall, Timing und emotionalen Ausdruck anhand des Gesprächskontexts anpassen.

Überblick

Der expressive Modus ermöglicht Agenten eine Sprache, die Absicht, Emotionen und Betonung widerspiegelt. Sie passt sich in Echtzeit daran an, wie Nutzer klingen und was sie sagen. Er basiert auf zwei Verbesserungen auf Systemebene im Konversations-Stack:

  1. Eleven v3 Conversational — das emotional intelligenteste, kontextbewusste Text to Speech-Modell in ElevenAgents.
  2. Ein neues System für Sprecherwechsel — präziser getimte Antworten mit weniger Unterbrechungen.

Der expressive Modus ist standardmäßig aktiviert, wenn Sie Eleven v3 Conversational als TTS-Modell Ihres Agenten auswählen.

Eleven v3 Conversational

Eleven v3 Conversational ist eine Version von Eleven v3 mit extrem niedriger Latenz, optimiert für Live-Dialoge. Es behält den Gesprächskontext über mehrere Gesprächszüge hinweg bei und passt die Ausdrucksweise an Tonfall und Absicht jedes Austauschs an.

  • Kontextbewusste Ausdrucksweise: Agenten passen ihren Tonfall an den Gesprächskontext an — sie reagieren ruhiger, wenn ein Nutzer besorgt klingt, oder direkter, wenn Klarheit wichtig ist.
  • Explizite emotionale Steuerung: Steuern Sie die Ausdrucksweise über Regeln im System-Prompt, von präzisen Auslösern bis zu breiteren Szenarien, um Markenstimme und Compliance-Anforderungen einzuhalten.
  • Unterstützung für mehr als 70 Sprachen: Erweitert von etwa 32 Sprachen in Flash-Modellen, mit verbesserter Ausdrucksstärke in Sprachen, in denen Nuancen bislang schwächer waren, darunter Japanisch.
  • Ausdrucks-Tags: Das LLM kann Tags wie [laughs], [whispers] oder [sighs] ausgeben, um bestimmte Momente der Ausdrucksweise zu steuern.

Eleven v3 Conversational kostet in Agents genauso viel wie andere ElevenLabs-TTS-Modelle, ab 0,08 $ pro Minute.

System für Sprecherwechsel

Das neue System für Sprecherwechsel nutzt Echtzeitsignale von Scribe v2 Realtime — darunter emotionale Hinweise und Sprachmuster —, um zu bestimmen, wann ein Agent sprechen, pausieren oder warten soll. So reagieren Agenten natürlicher, besonders in emotional aufgeladenen Situationen.

Zum Beispiel kann „ja“ eine vollständige Bestätigung oder der Beginn einer weiteren Äußerung sein. Indem das System zusätzlich zum Transkript analysiert, wie etwas gesagt wurde, etwa anhand von Sprachhinweisen wie Prosodie, timt es die Antwort des Agenten natürlicher.

Das Verhalten bei Sprecherwechseln lässt sich zusätzlich mit der Einstellung für Gesprächsbereitschaft abstimmen.

Konfiguration

Expressiven Modus aktivieren

1

TTS-Modell auswählen

Setzen Sie das TTS-Modell Ihres Agenten auf V3 Conversational. Mit diesem Modell ist der expressive Modus standardmäßig aktiviert.

Öffnen Sie Ihren Agenten im Dashboard, wechseln Sie zum Tab Agentenstimme und wählen Sie V3 Conversational als Text to Speech-Modell aus. Speichern Sie Ihre Änderungen.

Expressiven Modus aktivieren

2

Emotionale Ausdrucksweise im System-Prompt steuern

Fügen Sie dem System-Prompt Ihres Agenten Anweisungen hinzu, um die Anpassung seines Tonfalls zu steuern. Sie können allgemeine Richtlinien oder spezifische Auslöser verwenden.

Beispiele für System-Prompts

Steuern Sie die emotionale Ausdrucksweise Ihres Agenten mit Anweisungen in natürlicher Sprache im System-Prompt. Das Modell interpretiert diese kontextbezogen, daher sind für nicht jede Situation explizite Tags erforderlich.

Allgemeine Richtlinien

You are a customer support agent. When a user sounds frustrated or upset, respond
in a calm, reassuring tone. When delivering good news, allow your tone to reflect
genuine warmth. Maintain a professional but approachable delivery throughout.

Spezifische Auslöser

You are a conversational AI agent with expressive speech capabilities.
Tone guidelines:
- When a user expresses frustration, use a calm and empathetic tone
- When explaining technical steps, use a clear and measured pace
- When a user shares good news, respond with warmth and enthusiasm
- When handling complaints, remain composed and solution-oriented

Ausdrucks-Tags verwenden

Zusätzlich zur kontextbewussten Ausdrucksweise kann das LLM explizite Tags ausgeben, um bestimmte Momente zu steuern. Häufige Tags sind:

  • [laughs] — Fügt der Sprache Lachen hinzu
  • [whispers] — Verringert die Lautstärke für Flüstern
  • [sighs] — Fügt einen seufzenden Charakter hinzu
  • [slow] — Verlangsamt die Sprechweise
  • [excited] — Verleiht der Ausdrucksweise Begeisterung

Jedes Tag wirkt sich auf etwa die nächsten 4–5 gesprochenen Wörter aus, bevor die normale Ausdrucksweise fortgesetzt wird.

You can also use expressive tags in your responses for precise control:
- [laughs] for moments of humor
- [whispers] for confidential or intimate moments
- [sighs] for resignation or relief
- [slow] when emphasizing important information
Example: "That's great to hear! [laughs] I'm glad we could sort that out for you."

Best Practices

Leiten Sie Ihren Agenten an, seine emotionale Ausdrucksweise an die Situation anzupassen. Ein frustrierter Kunde sollte eine ruhige, empathische Antwort hören. Ein Nutzer, der gute Nachrichten teilt, sollte echte Wärme hören. Ein unpassender Tonfall untergräbt Vertrauen.

Definieren Sie klare Richtlinien für den Tonfall in Ihrem System-Prompt, statt sich allein auf das Urteil des Modells zu verlassen. Das sorgt für eine konsistente Ausdrucksweise, die Ihrer Markenstimme und Compliance-Anforderungen entspricht.

Die expressive Ausdrucksweise kann sich zwischen Sprachen unterscheiden. Testen Sie Ihren Agenten in jeder Zielsprache, um sicherzustellen, dass die emotionale Nuance wie beabsichtigt ankommt, insbesondere in Sprachen mit anderen Gesprächsnormen.

Kombinieren Sie den expressiven Modus mit passenden Einstellungen für Gesprächsbereitschaft. Der geduldige Modus gibt Nutzern in emotional sensiblen Gesprächen mehr Raum, während der eifrige Modus für schnelle Interaktionen geeignet ist.

Nutzen Sie Gesprächsanalysen, um nachzuverfolgen, wie Nutzer auf die expressive Ausdrucksweise reagieren. Verfeinern Sie Ihre Tonfallrichtlinien anhand von Gesprächsergebnissen und Nutzerfeedback.

Einschränkungen

  • Eleven v3 Conversational bewahrt die Eigenschaften professioneller Stimmklone (PVCs) nicht — die Ausgabe klingt möglicherweise nicht wie die ursprüngliche PVC-Stimme.
  • Die Effekte von Ausdrucks-Tags halten etwa 4–5 Wörter an, bevor die normale Ausdrucksweise zurückkehrt.
  • Die Ausdrucksstärke kann je nach Stimme und Sprache variieren.

FAQ

Nein. Eleven v3 Conversational kostet in Agents genauso viel wie andere ElevenLabs-TTS-Modelle, ab 0,08 $ pro Minute.

Wählen Sie V3 Conversational als TTS-Modell Ihres Agenten. Mit diesem Modell ist der expressive Modus standardmäßig aktiviert.

Das System nutzt Echtzeitsignale von Scribe v2 Realtime, darunter emotionale Hinweise und Sprachmuster, um vorherzusagen, wann der Agent antworten soll. Es analysiert sowohl das Transkript als auch die Art, wie Wörter gesprochen wurden, etwa die Prosodie, um Antworten natürlich zu timen.

Eleven v3 Conversational bewahrt PVC-Eigenschaften derzeit nicht gut. Wenn es entscheidend ist, die Stimmidentität Ihres PVC zu erhalten, sollten Sie stattdessen Flash v2 verwenden.

Eleven v3 Conversational unterstützt mehr als 70 Sprachen, erweitert von etwa 32 in Flash-Modellen. Dazu gehört eine verbesserte Ausdrucksstärke in Sprachen wie Japanisch, in denen Nuancen bislang schwächer waren.

Eleven v3 Conversational bietet einen größeren emotionalen Umfang als Flash und Multilingual v2 und kann die Ausdrucksweise anhand des Gesprächskontexts anpassen. Es unterstützt mehr als 70 Sprachen, verglichen mit etwa 32 bei Flash. Der Preis entspricht dem anderer Modelle.

Verwandte Funktionen