Conversational KI-Design: So gestalten Sie menschlichere Nutzererlebnisse
- Verfasst von
- Jack Limebear
- Veröffentlicht
- Zuletzt aktualisiert
AnhörenArtikel anhören
Conversational AI Design bedeutete früher, einen Entscheidungsbaum zu erstellen. Frühe Chatbots und IVR-Menüs arbeiteten mit starren, vorab definierten Verzweigungen: Drücken Sie 1 für Rechnungen, sagen Sie „Ja“ oder „Nein“ und hoffen Sie, dass die Frage des Kunden einem der vorhergesehenen Wege entsprach. Dieses Modell funktionierte nur, solange das Gespräch innerhalb dessen blieb, was Sie bereits erstellt hatten.
KI-Agenten haben diese Einschränkung aufgehoben. Sie können Gespräche jetzt in Echtzeit analysieren, auf eine Wissensdatenbank zugreifen, Tools aufrufen und sich an bereits Gesagtes erinnern. Damit sind sie nicht mehr auf ein festes Skript beschränkt.
Diese Veränderung hat den Bedarf an Conversational AI Design jedoch nicht beseitigt. Sie hat die Anforderungen erhöht. Ohne ein starres Skript als Rückhalt müssen Persona, Workflow und Entscheidungspunkte eines Agenten so gut definiert sein, dass sie in einem offenen Echtzeitgespräch bestehen – statt nur in einem vorgegebenen Ablauf.
Dieser Leitfaden erklärt, was Conversational AI Design für Chat- und Voice Agents tatsächlich bedeutet, warum es für die Kennzahlen relevant ist, an denen Sie bereits gemessen werden, und was Sie optimieren müssen, damit Interaktionen natürlicher wirken. Setzen Sie es richtig um, können Sie KI-Agenten einsetzen, die Kunden erreichen und einen schnelleren, besseren Service bieten.
Zusammenfassung
- Conversational AI Design beschreibt, wie die Kommunikation eines KI-Agenten strukturiert und optimiert wird, damit sich ein Gespräch natürlich anfühlt.
- Voice AI verzeiht weniger als Text: Probleme bei Stimme, Latenz und Timing, die in einer Chat-Oberfläche unbemerkt bleiben, können ein Sprachgespräch roboterhaft wirken lassen.
- ElevenAgents ermöglicht menschenähnliche KI-Voice- und Chat-Agenten mit Funktionen zur Steuerung von Stimme, Persona und Gesprächsfluss sowie zur Latenzoptimierung über alle Kanäle hinweg.
Was ist Conversational AI Design?
Conversational AI Design ist die UX-Praxis, das Verhalten eines KI-Agenten zu konfigurieren. Dazu gehören seine Persona ebenso wie Guardrails, Workflows und Wissensdatenbanken, auf die er zugreift. Zusammen sorgen sie dafür, dass das Gespräch so ausgereift wirkt wie jeder andere Teil des Produkterlebnisses.
Diese Konfiguration sieht jedoch nicht überall gleich aus. Agenten können mit einer einzigen Konfiguration über mehrere Kanäle wie Chat, Sprache oder SMS laufen. Jeder Kanal hat eigene Einschränkungen, bei Sprache sind sie jedoch am stärksten. Ist Sprache einer der Kanäle eines Agenten, muss er eine Stimme auswählen und ausgeben, Tempo und Sprecherwechsel in Echtzeit steuern und antworten, bevor eine Pause wie ein Verbindungsabbruch wirkt. Anders als im Chat ist nichts davon optional, denn dort unterbricht eine etwas langsame oder unvollständige Antwort die Interaktion selten.
Das sollten Sie bei der Umsetzung von Conversational AI Design für einen Chat-Agenten berücksichtigen – und das kommt bei Sprache noch hinzu.
Kunden bewerten diese Faktoren nicht bewusst einzeln. Sie merken nur, wenn etwas nicht stimmt. Dieses Gefühl reicht aus, um das Vertrauen in den Agenten insgesamt zu schwächen und die Ziele zu gefährden, für die Sie ihn ursprünglich eingesetzt haben.
Warum Conversational AI Design für eine gute Nutzererfahrung wichtig ist
Jeder oben genannte Faktor – von Sprecherwechseln über Latenz bis zur Persona – beeinflusst, wie Kunden Ihre Marke in einem entscheidenden Moment wahrnehmen. Dieser Moment kann sie zu Befürwortern oder Kritikern machen. Diese Wahrnehmung zeigt sich direkt in den Kennzahlen, an denen Teams gemessen werden.
- Höhere Zufriedenheits- und Lösungsquoten: Kunden bewerten eine Interaktion besser, wenn der Agent schnell antwortet und nicht ungeschickt unterbricht.
- Weniger Abbrüche: Kunden brechen Gespräche nicht nur wegen langer Wartezeiten ab. Eine Umsetzung, die Erwartungen nicht erfüllt – etwa eine unangenehme Pause im Anruf oder eine steife, nicht zur Marke passende Chat-Antwort –, kann denselben Impuls auslösen, das Gespräch zu beenden.
- Schnellere Lösungszeit: Klare Einstellungen für den Gesprächsfluss und gut abgebildete Workflows bedeuten weniger Sackgassen, wiederholte Fragen und „Ich verbinde Sie weiter“-Momente.
- Weniger Eskalationen an menschliche Agenten: Wenn ein Agent den Gesprächsfluss natürlich steuert und einem definierten Workflow folgt, löst er mehr Anliegen beim ersten Versuch, statt Kunden so zu verwirren, dass sie nach einer Person fragen.
Ein Beispiel ist eDreams ODIGEO, eine der weltweit größten Online-Reiseplattformen. Das Unternehmen setzte KI-Agenten mit ElevenAgents in fünf Kernsprachen ein und erzielte eine Verbesserung der Lösungsgeschwindigkeit im zweistelligen Prozentbereich sowie eine Senkung der Anrufweiterleitungen im zweistelligen Prozentbereich. Dazu trugen unter anderem Sprachsynthese mit niedriger Latenz und eine präzisere Intent-Erkennung zu Beginn jedes Anrufs bei. Solche Ergebnisse hängen von vielen Faktoren ab, die über das Gesprächsdesign hinausgehen. Sie zeigen jedoch, was gutes Conversational AI Design ermöglichen kann.
So funktioniert Conversational AI Design in ElevenAgents
In ElevenAgents können Sie Persona, Stimme, Sprecherwechsel, Übergaben und Latenz optimieren – genau die Faktoren, die entscheiden, ob sich ein Agent menschlich anfühlt. So konfigurieren und optimieren Sie jeden davon, damit Ihr Agent seinen Teil eines echten Gesprächs zuverlässig übernimmt.
Persona und Stimmauswahl
Die Persona prägt den ersten Eindruck des Kunden. Passt sie nicht, untergräbt das Vertrauen, bevor das Gespräch überhaupt beginnt. Eine Persona, die für eine freundliche Handelsmarke zu steif wirkt, lässt Kunden am Agenten zweifeln, bevor er etwas Nützliches gesagt hat. Gestalten Sie sie im System Prompt. Dort definieren Sie Rolle, Persönlichkeit und Guardrails des Agenten, bevor Sie alles Weitere konfigurieren.
Bei Voice Agents muss diese Persona auch durch die Stimme vermittelt werden. Eine Stimme, die für ein Finanzgespräch zu locker ist, sendet dasselbe Signal wie eine unpassende Persona im Text. Deshalb gehört die Stimmauswahl zur selben Aufgabe. Hier sollten Sie beginnen:
- Stimmauswahl: Wählen Sie eine Stimme, die zu Ihrer Marke, Zielgruppe und dem Thema passt. Akzent, Geschlecht und Tonalität schaffen Vertrauen bei einem bestimmten Anrufer und geben dem Gespräch den Ton vor.
- Mehrsprachige Unterstützung: Wählen Sie für jede unterstützte Sprache eine Stimme, statt standardmäßig eine Stimme für alle Märkte zu verwenden. Eine einzelne Stimme, die über mehrere Sprachen hinweg eingesetzt wird, klingt in mindestens einer davon meist fremd. Das untergräbt das Vertrauen, das Sie aufbauen möchten.
ElevenAgents bietet Ihnen Zugriff auf über 11.000 Stimmen in der Stimmbibliothek, durchsuchbar nach Akzent, Charakter und Anwendungsfall. Daher müssen Sie selten bei null anfangen. Falls keine davon passt, haben Sie zwei weitere Optionen: Klonen Sie eine bestehende Stimme anhand einer kurzen Audioaufnahme oder entwerfen Sie eine Stimme von Grund auf mit einem Text-Prompt, der gewünschtes Alter, Akzent, Tonalität und Tempo beschreibt.
Einstellungen für den Gesprächsfluss
Bei Sprache läuft das Gespräch nach der engsten Taktung. Anders als im Chat, wo eine Pause nur Leerraum ist, wirkt ein Bruch im Rhythmus eines Anrufs sofort wie Stille oder ein Verbindungsabbruch. Diesen Rhythmus richtig zu gestalten, ist der wichtigste Hebel, damit ein Voice Agent wie ein natürlicher Gesprächsteilnehmer wirkt. Es beginnt mit dem Modell für Sprecherwechsel selbst.
Das Modell für Sprecherwechsel von ElevenLabs ist ein forschungsbasiertes System, das erkennt, ob ein Sprecher tatsächlich fertig ist oder nur pausiert. So kann es bestimmen, wann ein Agent antworten sollte, statt anhand einer festen Verzögerung zu raten.
Darüber hinaus können Sie folgende Einstellungen anpassen, um den Gesprächsfluss richtig zu gestalten:
- Turn Timeout: Wie lange der Agent vor der Antwort wartet, damit er nicht einsteigt, während der Kunde noch nachdenkt, oder ihn warten lässt, nachdem er fertig gesprochen hat.
- Soft Timeout: Eine kurze Füllphrase, mit der der Agent eine Verarbeitungspause überbrückt, etwa „Einen Moment“ oder „Ich sehe nach“. So denken Kunden nicht, dass die Verbindung abgebrochen ist. Vermeiden Sie Füllphrasen mit einer konkreten Zeitangabe wie „eine Sekunde“, da die tatsächlichen Antwortzeiten variieren.
- Unterbrechungen: Ob der Agent aufhört zu sprechen, wenn der Kunde ihn unterbricht. Aktivieren Sie dies für einen natürlichen Austausch. Deaktivieren Sie es, wenn die vollständige Wiedergabe wichtig ist – etwa bei rechtlichen Hinweisen, Sicherheitsanweisungen und allem, was vollständig gehört werden muss.
- Reaktionsbereitschaft: Wie schnell der Agent antwortet, sobald der Kunde aufhört zu sprechen. „Eager“ eignet sich für den Kundenservice, wo schnelle Antworten am wichtigsten sind. „Patient“ eignet sich am besten zum Erfassen von Kundeninformationen wie Telefonnummern oder E-Mail-Adressen, damit der Agent den Kunden nicht mitten in einer Ziffer unterbricht. „Normal“ ist eine gute Standardeinstellung für allgemeine Gespräche.
Kleine Anpassungen bewirken hier viel. Selbst eine geringfügige Änderung des Timeouts kann den Unterschied zwischen einem aufmerksamen Agenten und einem Agenten ausmachen, der Menschen ständig unterbricht.
Workflow-, Übergabe- und Skriptdesign
Workflows setzen einen großen Teil des Conversational AI Designs in ElevenAgents um. Sie definieren, was wann geschieht: Entscheidungspunkte, Eskalationswege, Übergaben – alles, was der Agent sonst improvisieren müsste.
Workflows arbeiten mit zwei weiteren Systemen zusammen, um Ihren Agenten zu verfeinern. Der System Prompt definiert das Kernverhalten des Agenten, etwa Rolle, Tonalität sowie Dinge, die er sagen darf und nicht sagen darf – an wichtigen Stellen wie Begrüßungen oder Übergaben. Prozeduren sind eine stärker vorgegebene Option für eine einzelne, klar definierte Aufgabe, etwa die Identitätsprüfung eines Kunden oder die Abwicklung einer Rückgabe. Statt sich nach den Aussagen des Kunden zu verzweigen, folgen sie von Anfang bis Ende einer festen Abfolge – Schritt für Schritt, unabhängig vom Gesprächsverlauf.
Am einfachsten beginnen Sie mit dem Aufbau Ihres Agenten mithilfe von vorgefertigten Agent-Vorlagen. Sie enthalten eine Grundlage für Workflows und System Prompts, sodass Sie feinabstimmen, statt bei null zu beginnen. Mit diesen Änderungen können Sie sie an Ihre Anforderungen anpassen:
- Entscheidungszuordnung: Legen Sie genau fest, was der Agent an jedem Entscheidungspunkt tut, damit das gesamte Gespräch von der Begrüßung bis zur Lösung definiert ist. Subagent-Nodes ermöglichen es Ihnen, System Prompt, Modell oder sogar Stimme an bestimmten Punkten im Ablauf anzupassen. So kann ein sensibler Prüfschritt unter strengeren Guardrails laufen als unverbindlicher Small Talk zu Beginn des Anrufs.
- Eskalationsauslöser: Definieren Sie klare Auslöser für die Übergabe an einen Menschen. Sie sollten im Workflow verankert sein, statt den Agenten im jeweiligen Moment entscheiden zu lassen. Eskalieren Sie beispielsweise, wenn ein Anliegen nach zwei Versuchen ungelöst bleibt, ein Kunde nach einem Vorgesetzten fragt oder die Transaktion sensibel beziehungsweise so wertvoll ist, dass eine Person erforderlich ist.
- Übergabekontext: Definieren Sie im System Prompt, was der Agent vor der Übergabe erfassen soll, etwa eine Bestell-ID oder Kontonummer, sowie die Bedingungen, die eine Übergabe auslösen. Ordnen Sie diese gespeicherten Daten dann der Konfiguration des Transfer-Tools zu, damit sie automatisch übergeben werden und der Kunde sie einem menschlichen Mitarbeiter nicht wiederholen muss.
- Skriptierte Formulierungen: Definieren Sie im System Prompt exakte Formulierungen für kritische Momente. Begrüßungen, Fehlermeldungen, rechtliche Hinweise und Eskalationsübergaben sollten nie dem Agenten zur spontanen Improvisation überlassen werden. Eine genaue Formulierung wie „Ich kann derzeit nicht auf diese Informationen zugreifen“ ist zuverlässiger, als den Agenten bei einem Fehler raten zu lassen, wie er sich ausdrücken soll.
Der Workflow wird in ElevenAgents als visueller Graph erstellt. Jeder Entscheidungspunkt und Eskalationsauslöser ist als Node abgebildet, den Sie direkt sehen und bearbeiten können.

Nach dem Go-live legen Analysen echte Gesprächsdaten über denselben Graphen. So sehen Sie genau, wo Kunden nicht weiterkommen oder abspringen, und können es ohne Rätselraten beheben.
Latenz und Leistung
Die Latenz ist einer der wichtigsten Faktoren dafür, ob sich eine Interaktion menschlich anfühlt. Eine langsame Antwort erinnert Kunden besonders schnell daran, dass sie mit einer Maschine sprechen – selbst wenn sonst alles im Gespräch gut läuft.
Jeder Teil der Pipeline fügt eigene Latenz hinzu, unabhängig davon, ob der Agent über Chat oder Sprache läuft. Einige Faktoren gelten in beiden Fällen, andere nur, wenn Sprache Teil der Gleichung ist.
- LLM: Jede Modellwahl ist ein Kompromiss zwischen Kosten, Qualität der Schlussfolgerungen und Geschwindigkeit. Die richtige Balance hängt vom Gespräch ab. Einfache, häufige Interaktionen wie FAQs oder Terminbestätigungen können auf einem schnelleren, schlankeren Modell laufen, ohne die Nutzererfahrung zu beeinträchtigen. Bei komplexeren Aufgaben wie Finanzberatung oder mehrstufiger Fehlerbehebung lohnt sich in der Regel ein leistungsfähigeres Modell für Schlussfolgerungen, auch wenn es etwas langsamer antwortet.
- Wissensdatenbank und RAG: Jede Abfrage einer Wissensdatenbank fügt einen Round Trip hinzu, bevor der Agent antworten kann. Eine schlanke, fokussierte Wissensdatenbank reagiert daher schneller als eine, die der Agent umfassend durchsuchen muss.
- Integrationen und Tool-Aufrufe: Jeder Aufruf eines externen Tools – etwa die Suche nach einer Bestellung in Salesforce oder die Prüfung von Kalenderverfügbarkeiten – fügt einen eigenen Round Trip hinzu. Schreiben Sie klare Tool-Beschreibungen, damit der Agent nicht zögert, welches Tool er aufrufen soll, und rufen Sie nur Tools auf, die das Gespräch tatsächlich benötigt.
- Geografie und Datenhosting: Passen Sie Ihre ElevenAgents-Region an den Standort Ihrer gehosteten Daten an und bei telefoniebasierten Deployments auch an die Region Ihres Telefonieanbieters – Twilio, SIP oder eines anderen Anbieters. Liegen die Region Ihres Agenten und die Region Ihres Call Gateways auf gegenüberliegenden Seiten der Welt, erhöht diese Distanz die Latenz, bevor das Gespräch überhaupt beginnt.
- Speech to Text (nur Sprache): Scribe transkribiert die Aussagen des Kunden, bevor der Agent etwas analysieren kann. Nutzen Sie für Live-Gespräche die Echtzeitversion Scribe v2 Realtime statt der Batch-Version, die auf Genauigkeit statt Geschwindigkeit ausgelegt ist.
- Sprecherwechsel (nur Sprache): Bestimmt, wann der Agent überhaupt beschließt zu antworten; dies wurde oben ausführlich behandelt. Denken Sie daran, dass dies ein eigener Latenzfaktor ist: Zögert ein Modell beim Erkennen des Turn-Endes, entsteht Verzögerung, bevor der Rest der Pipeline überhaupt beginnt.
- Text to Speech und Stimmauswahl (nur Sprache): Standard- und synthetische Stimmen sowie Instant Voice Clones reagieren schneller als Professional Voice Clones. Nutzen Sie Professional Voice Clones nur, wenn die zusätzliche Klangtreue den Kompromiss bei der Latenz wert ist.
Für einen genaueren Blick auf die Latenz lesen Sie Best Practices zur Latenzoptimierung und erfahren Sie, wie Latenz gemessen und ausgewiesen wird – über die gesamte Pipeline hinweg.
Entwerfen Sie Ihren ersten Agenten mit ElevenAgents
Die hier beschriebenen Hebel zeigen, was Conversational AI Design für einen KI-Agenten in der Praxis bedeutet. All das ist nativ in ElevenAgents verfügbar und über eine No-Code-Konsole konfigurierbar. So erstellen Sie einen Agenten, der echte Gespräche führt, statt Fragen nur korrekt zu beantworten.
Für Teams, die dabei praktische Unterstützung möchten, arbeiten die ElevenLabs Forward Deployed Engineers direkt mit Ihrem Team zusammen, um einen produktionsreifen Agenten zu planen, zu erstellen und einzuführen. Anschließend optimieren sie die Leistung nach dem Go-live weiter.
Ob Sie selbst entwickeln oder Unterstützung hinzuziehen: Am schnellsten erkennen Sie den Unterschied, wenn Sie es ausprobieren. Starten Sie noch heute, indem Sie einen Agenten erstellen oder mit unserem Vertriebsteam sprechen.



