多模态输入

为智能体配置文件附件和按键输入。

概述

多模态输入设置可控制用户除语音外向智能体发送信息的其他方式。它们位于智能体的 高级 标签页中,路径为 多模态输入。

文件输入

文件输入允许用户在聊天中向智能体发送图片和 PDF。所选模型支持图片和/或文档输入时,智能体可以读取这些文件。

即使已启用文件输入,如果模型不支持该文件类型,附件也会被忽略。

配置

字段类型默认值描述
enabledbooleantrue当为 true 时,如果模型支持该输入类型,用户可以附加图片或 PDF。
max_files_in_memoryinteger10可同时保存在内存中的最近上传文件数量。范围:1 到 10。达到上限后,较早的文件会被替换为简短摘要。
max_files_per_conversationinteger10用户在一次对话中可上传的文件总数。每个上传文件都会计费。使用 -1 表示无限制。必须为 -1,或大于等于 max_files_in_memory。

用户可在 widget、Slack 等支持的聊天渠道中,或通过上传对话文件 API 附加文件。

1

打开多模态输入

在控制台中打开智能体,确认所选模型支持图片和/或 PDF 输入,然后前往 高级 标签页。

2

启用文件附件

在 多模态输入 下,开启 允许文件附件。

3

设置文件限制

可选择设置 保留在内存中的文件数 和 每次对话的最大文件数。

4

保存更改

保存智能体。之后用户即可在聊天中附加图片和 PDF。

DTMF 输入

DTMF 输入允许来电者在通话期间通过电话键盘输入数字。可用于收集电话号码、菜单选项和其他数字输入,无需依赖语音识别。

这与播放按键音系统工具相反,后者由智能体发送音调。

仅支持来自 Twilio、SIP 中继(电话)或 Genesys 的带外 DTMF。音频流中的带内音调会被忽略。网页 widget 和聊天渠道无法发送 DTMF。

每次按键都会缓冲,直到序列完成。完成一个序列会创建一个用户轮次。

  1. 来电者按下一个按键。如果智能体正在说话,第一个数字会将其打断。
  2. 后续数字会追加到同一缓冲区。
  3. 当来电者按下 #(如果已启用井号终止)或在超时前未再输入数字时,序列即完成。
  4. 智能体会将收集到的数字作为一个用户轮次接收并作出回复。

启用井号终止时,# 是终止符,不会包含在收集的字符串中。缓冲区为空时按下 # 会被忽略。缓冲区接受 0-9、*、# 和 A-D,最多 50 个字符。

配置

禁用 DTMF 输入时,conversation_config.conversation.dtmf_input_settings 为 null。启用后,默认值如下:

字段类型默认值描述
dtmf_input_timeoutfloat2.0最后一次按键后,完成序列前等待的秒数。范围:0.5 到 10.0。
hash_terminatorbooleantrue如果为 true,# 会立即完成序列,且不会包含在收集的数字中。
redact_inputbooleanfalse如果为 true,存储的转录文本、对话日志和分析中的按键输入将替换为 <REDACTED>。

脱敏适用于已存储对话数据中的按键轮次。它不会在实时通话期间向智能体隐藏数字,也不会改写智能体说出的或发送给工具的数字。这与对话历史记录脱敏不同。

1

打开多模态输入

在控制台中打开智能体,然后前往 高级 标签页。

2

启用 DTMF 输入

在 多模态输入 下,开启 启用 DTMF 输入。

3

配置超时和脱敏

可选择设置 DTMF 输入超时、使用 # 完成 DTMF 输入 和 脱敏 DTMF 输入。

4

保存更改

保存智能体,然后拨打电话并在键盘上输入数字。

更新智能体的系统提示词,让它知道何时请求按键输入。例如:

If you need the caller's phone number, ask them to type it on their keypad. Wait for the DTMF
input before continuing.