多模态输入
多模态输入
为智能体配置文件附件和按键输入。
概述
多模态输入设置可控制用户除语音外向智能体发送信息的其他方式。它们位于智能体的 高级 标签页中,路径为 多模态输入。
文件输入
文件输入允许用户在聊天中向智能体发送图片和 PDF。所选模型支持图片和/或文档输入时,智能体可以读取这些文件。
即使已启用文件输入,如果模型不支持该文件类型,附件也会被忽略。
配置
用户可在 widget、Slack 等支持的聊天渠道中,或通过上传对话文件 API 附加文件。
通过控制台更新
通过 CLI 更新
通过 API 更新
DTMF 输入
DTMF 输入允许来电者在通话期间通过电话键盘输入数字。可用于收集电话号码、菜单选项和其他数字输入,无需依赖语音识别。
这与播放按键音系统工具相反,后者由智能体发送音调。
每次按键都会缓冲,直到序列完成。完成一个序列会创建一个用户轮次。
- 来电者按下一个按键。如果智能体正在说话,第一个数字会将其打断。
- 后续数字会追加到同一缓冲区。
- 当来电者按下
#(如果已启用井号终止)或在超时前未再输入数字时,序列即完成。 - 智能体会将收集到的数字作为一个用户轮次接收并作出回复。
启用井号终止时,# 是终止符,不会包含在收集的字符串中。缓冲区为空时按下 # 会被忽略。缓冲区接受 0-9、*、# 和 A-D,最多 50 个字符。
配置
禁用 DTMF 输入时,conversation_config.conversation.dtmf_input_settings 为 null。启用后,默认值如下:
脱敏适用于已存储对话数据中的按键轮次。它不会在实时通话期间向智能体隐藏数字,也不会改写智能体说出的或发送给工具的数字。这与对话历史记录脱敏不同。
通过控制台更新
通过 CLI 更新
通过 API 更新
更新智能体的系统提示词,让它知道何时请求按键输入。例如: