Multimodale Eingabe

Konfigurieren Sie Dateianhänge und Tastatureingaben für Ihren Agenten.

Überblick

Die Einstellungen für multimodale Eingaben steuern zusätzliche Möglichkeiten, wie Nutzer dem Agenten neben Sprache Informationen senden können. Sie finden sie im Tab Erweitert des Agenten unter Multimodale Eingabe.

Dateieingabe

Mit der Dateieingabe können Nutzer dem Agenten im Chat Bilder und PDFs senden. Der Agent kann diese Dateien lesen, wenn das ausgewählte Modell Bild- und/oder Dokumenteingaben unterstützt.

Anhänge werden ignoriert, wenn das Modell den Dateityp nicht unterstützt, auch wenn die Dateieingabe aktiviert ist.

Konfiguration

FeldTypStandardBeschreibung
enabledbooleantrueBei true können Nutzer Bilder oder PDFs anhängen, wenn das Modell diesen Eingabetyp unterstützt.
max_files_in_memoryinteger10Anzahl der zuletzt hochgeladenen Dateien, die gleichzeitig im Speicher gehalten werden. Bereich: 1 bis 10. Bei Erreichen des Limits werden ältere Dateien durch eine kurze Zusammenfassung ersetzt.
max_files_per_conversationinteger10Gesamtzahl der Dateien, die ein Nutzer in einer Unterhaltung hochladen kann. Uploads werden pro Datei abgerechnet. Verwenden Sie -1 für kein Limit. Muss -1 oder größer oder gleich max_files_in_memory sein.

Nutzer können Dateien im Widget, in unterstützten Chat-Kanälen wie Slack oder über die API zum Hochladen einer Unterhaltungsdatei anhängen.

1

Multimodale Eingabe öffnen

Öffnen Sie Ihren Agenten im Dashboard, bestätigen Sie, dass das ausgewählte Modell Bild- und/oder PDF-Eingaben unterstützt, und wechseln Sie dann zum Tab Erweitert.

2

Dateianhänge aktivieren

Aktivieren Sie unter Multimodale Eingabe die Option Dateianhänge zulassen.

3

Dateilimits festlegen

Legen Sie optional Im Speicher gehaltene Dateien und Max. Dateien pro Unterhaltung fest.

4

Änderungen speichern

Speichern Sie den Agenten. Nutzer können dann Bilder und PDFs im Chat anhängen.

DTMF-Eingabe

Mit der DTMF-Eingabe können Anrufer während eines Anrufs Ziffern über ihr Telefontastenfeld eingeben. Verwenden Sie sie, um Telefonnummern, Menüauswahlen und andere numerische Eingaben zu erfassen, ohne auf Spracherkennung angewiesen zu sein.

Sie ist die Umkehrung des System-Tools Tastenton abspielen, das Töne vom Agenten sendet.

Es wird nur Out-of-Band-DTMF von Twilio, SIP- Trunking (Telefonie) oder Genesys unterstützt. In-Band- Töne im Audiostream werden ignoriert. Das Web-Widget und Chat-Kanäle können kein DTMF senden.

Jeder Tastendruck wird gepuffert, bis die Sequenz vollständig ist. Das Abschließen einer Sequenz erstellt einen Nutzerzug.

  1. Der Anrufer drückt eine Taste. Die erste Ziffer unterbricht den Agenten, wenn er spricht.
  2. Weitere Ziffern werden an denselben Puffer angehängt.
  3. Die Sequenz wird abgeschlossen, wenn der Anrufer # drückt (sofern der Abschluss per Raute aktiviert ist) oder wenn vor dem Timeout keine weiteren Ziffern eintreffen.
  4. Der Agent erhält die erfassten Ziffern als Nutzerzug und antwortet.

# ist ein Abschlusszeichen, wenn der Abschluss per Raute aktiviert ist; es wird nicht in die erfasste Zeichenfolge aufgenommen. Ein bei leerem Puffer gedrücktes # wird ignoriert. Der Puffer akzeptiert 0-9, *, # und A-D mit bis zu 50 Zeichen.

Konfiguration

conversation_config.conversation.dtmf_input_settings ist null, wenn die DTMF-Eingabe deaktiviert ist. Bei Aktivierung gelten folgende Standardwerte:

FeldTypStandardBeschreibung
dtmf_input_timeoutfloat2.0Sekunden, die nach dem letzten Tastendruck vor dem Abschließen der Sequenz gewartet wird. Bereich: 0.5 bis 10.0.
hash_terminatorbooleantrueBei true schließt # die Sequenz sofort ab und wird nicht in die erfassten Ziffern aufgenommen.
redact_inputbooleanfalseBei true werden Tastenfeldeingaben im gespeicherten Transkript, Unterhaltungsprotokoll und in der Analyse durch <REDACTED> ersetzt.

Die Schwärzung gilt für den Tastenfeldzug in gespeicherten Gesprächsdaten. Sie verbirgt Ziffern nicht während des laufenden Anrufs vor dem Agenten und schreibt auch keine Ziffern um, die der Agent zurückspricht oder an ein Tool sendet. Dies ist getrennt von der Schwärzung des Gesprächsverlaufs.

1

Multimodale Eingabe öffnen

Öffnen Sie Ihren Agenten im Dashboard und wechseln Sie zum Tab Erweitert.

2

DTMF-Eingabe aktivieren

Aktivieren Sie unter Multimodale Eingabe die Option DTMF-Eingabe aktivieren.

3

Timeout und Schwärzung konfigurieren

Legen Sie optional Timeout für DTMF-Eingabe, # zum Abschließen der DTMF-Eingabe verwenden und DTMF-Eingabe schwärzen fest.

4

Änderungen speichern

Speichern Sie den Agenten, tätigen Sie dann einen Anruf und geben Sie Ziffern über das Tastenfeld ein.

Aktualisieren Sie den System-Prompt des Agenten, damit er weiß, wann er nach einer Tastenfeldeingabe fragen soll. Beispiel:

If you need the caller's phone number, ask them to type it on their keypad. Wait for the DTMF
input before continuing.