语音智能体功能:记忆、升级处理等
- 发布时间
传统电话系统依赖预设脚本和菜单式响应。这限制了它们适应自然语言或处理复杂 workflow 请求的能力。如今的语音智能体功能已远超这一水平:它将实时语音识别、推理和上下文结合,打造响应更灵活的语音系统。
现代语音智能体可验证客户身份、在系统中获取客户信息、根据实时数据提供合理回复、识别何时需要转交处理等。所有操作都在实时通话中完成,无需让用户在电话队列中等待人工客服。
本指南解答 AI 语音智能体功能的 6 个问题:它们如何记住来电者、应对挫败情绪、使用哪些数据学习、如何个性化、如何保护敏感数据,以及如何影响客户满意度。每个答案都会介绍 ElevenAgents 的实际做法。

摘要:
- 语音智能体将实时语音识别与实时数据推理结合,可验证来电者身份、根据最新信息作答,并在通话中完成任务,无需让任何人进入电话队列。
- 智能体记忆可在单次通话和重复互动间发挥作用:通过动态变量在通话开始时从 CRM 获取客户历史记录,并通过通话后 webhook 写回结果。
- 可通过情感检测和实时缓和策略应对情绪沮丧的来电者;当挫败感超过阈值或来电者要求人工服务时,可转接至人工或专业智能体。
- 智能体可从上传的 PDF、Word、文本、Markdown、HTML 和 EPUB 等内容中构建知识,使用 RAG 检索相关段落,而较小的文档会保留在完整上下文中。
- 个性化推荐结合 CRM 数据、实时请求和通过工具调用进行的通话中产品查询,使智能体能根据来电者历史匹配实际库存。
- 可配置的隐私设置管理数据保留、音频存储、转写文本脱敏和零保留模式;企业级医疗部署符合 HIPAA 适用条件。
什么是语音智能体功能?
语音智能体是一种可与客户进行实时语音对话的人工智能(AI)系统。它不仅具备传统语音功能,还能理解意图和情境,并代表客户完成任务。这类智能体通过聆听客户需求、推理所听到的信息、调用完成请求所需的系统,再以类似人工客服的自然语气与客户交流。
语音智能体功能指的是让智能体与客户的对话真正有用的具体能力。可分为以下几类,用于衡量其在该角色中的表现:
- 记忆和上下文:可在一次通话或与同一客户的多次互动中保留客户信息。
- 处理困难场景和对话:当来电者感到沮丧、困惑或不愿接受结果时,智能体仍能围绕主题并遵循政策。
- 根据内容学习的能力:智能体从现有的内部公司文档和政策中学习,为互动提取回复,而不是使用通用脚本。
- 客户个性化:智能体会根据来电者身份调整语气、节奏或推荐内容,而不是提供千篇一律的选项菜单。
- 数据处理:与智能体共享的信息会根据存储哪些数据、公司保留多久以及谁可访问进行管理。
- 可衡量的成功结果:通过提供内部追踪的系统,更准确地判断语音智能体是否在解决问题,以及与人工客服相比的处理准确性。
这些语音智能体功能最终可帮助企业更好地定制智能体,满足客户需求。
语音智能体如何记住与客户过去的对话?
语音智能体没有内置的跨通话记忆。跨通话记忆由三部分组成:通话开始时注入 CRM 数据的动态变量、获取数据的对话启动 webhook,以及写回结果的通话后 webhook。在单次通话中,智能体会自动保留完整对话上下文。
根据具体架构,语音智能体可在两个层面处理客户记忆:
- 单次通话内:智能体会维护对话上下文并追踪会话中说过的所有内容,减少客户在通话中反复说明的需要。
- 跨多次互动:这种记忆通过多渠道集成实现。智能体会在通话开始时从公司 CRM 或数据库调取客户历史记录,再记录此次互动结果,让下次对话能基于既有历史展开。
借助 ElevenAgents 的动态变量,可在对话开始时注入上下文。这些变量会将运行时值注入智能体的提示词、消息和工具中。无需为每位客户单独构建智能体,即可利用用户专属信息个性化每次对话。对话开始时,可将来电者姓名、账户状态、身份信息和过去的互动记录传递给语音智能体。
对于呼入电话,ElevenAgents 可通过对话启动 webhook 从公司服务器获取初始数据,并在智能体加载上下文时应用端点返回的 JSON。在实时场景中,平台会在与客户初次建立连接期间获取所需数据。智能体并行查看上下文时,这一过程通常表现为正常响铃或等待音乐。
通话结束后,流程将反向执行。智能体会通过通话后 webhook或其他通话工具,将通话结果回传至 CRM 或支持系统。它会记录通话中发生的情况,以及可能仍需向客户跟进的事项。客户互动记录让语音智能体的记忆得以持续保存。这样,客户下次对接的智能体或人工客服在对话开始前便拥有完整背景。

语音智能体如何应对沮丧或愤怒的客户?
在任何层级、任何客户服务环境中,都难免遇到沮丧或愤怒的客户。语音智能体可通过检测、调整和在需要时升级处理,妥善应对这类情况。
以下是语音智能体处理客户困难情境的方式:
- 检测挫败情绪:检测客户反馈最有效的方式是情感分析。该分析会将对话评分为正面、负面或中性。对于单次对话,情感分析会沿着从负面到正面的评分轨迹串联每条用户回复,帮助识别对话在哪个环节出了问题。汇总不同主题的检测结果后,还能发现最容易让来电者不满的主题领域,并提供改进依据。借助 ElevenLabs 提供的领先语音智能体模型,智能体甚至能从实时转写文本中理解语气并相应调整。
- 实时调整:可直接在智能体的系统提示词中定义缓和策略,让它能够认可来电者的挫败感、避免与其争辩、保持回复贴合对话且语气平静,并优先引导至解决方案。
- 升级至人工处理:转接号码工具会在满足预设条件时将通话转给人工客服,通常是在来电者要求人工服务、重复同一投诉两次,或情绪连续多个轮次保持负面时。将这些条件写入系统提示词中。来电者等待时,智能体可播放提示消息,并向接听通话的客服人员传递单独摘要,让对方接听时已掌握上下文,无需从头开始。ElevenAgents 还支持智能体间转接,当来电者需要不同专业能力而非人工服务时,可将对话路由至专业智能体。
对于处理情绪沮丧的客户,语音智能体最重要的能力是转接路径。

训练语音智能体可使用哪些文件格式?
现代语音智能体并非按传统 AI/LLM 的意义进行训练,而是获得可据以构建回复的知识。可向这类智能体提供文档、网页或纯文本资源作为知识库,智能体在通话中从中检索相关段落。这种方法称为检索增强生成(RAG)。这一过程让智能体可利用的信息远多于单条提示词所能提供的内容。
向知识库添加信息有多种方式:上传文件、为智能体指定 URL,或直接粘贴文本。在 ElevenAgents 中,每个上传文件最大可达 20 MB,并支持以下格式:
- .docx
- .txt
- .md
- .html
- .epub
格式会影响检索质量。Markdown、纯文本和 DOCX 可干净提取内容,并为 RAG 提供可预测的分块。包含多栏布局、表格或扫描页的 PDF 提取效果较差,应在上传前转换。
附加文档后,智能体会以两种方式之一使用它。小型文档可放入完整上下文中,使整份文档文本在每个轮次都保留在提示词内;第二种方式是为较大文档建立 RAG 索引。
在此过程中,对话时只会检索与每个问题最相关的段落。例如,只有提取后的文本不超过 250,000 个字符时,文档才能使用完整上下文。更大的文档会通过 RAG 处理。启用 RAG 后,系统会自动选择合适的路径。

语音智能体如何提供个性化产品推荐?
个性化产品推荐源于结合来电者与语音智能体互动时的多项输入,包括来电者是谁、其需求是什么,以及当前有哪些可用产品。智能体通过动态变量传入的 CRM 数据了解来电者信息。
它还可从实时对话中了解请求内容,并通过工具调用查询产品数据,了解当前可用的产品。随后,智能体会综合这些信息,如同充分了解情况的人工客服一样,为来电者推荐个性化选项。
为了更直观地说明其在真实语音智能体场景中的运作方式,下面来看一次实际通话。
一位回头客致电零售商技术支持热线,因无法登录用户账户而希望完成购买。以下是语音智能体如何将这通电话转化为个性化推荐:
- 开始时获取上下文:智能体已了解来电者的购买历史和其他相关信息,因为这些信息在通话开始时便已获取。
- 将请求纳入推荐:来电者说明所需内容后,智能体会将这一描述融入推荐,而非从零开始。
- 通话中查询实时产品数据:智能体会在对话期间调用产品 API,检查当前库存和价格,而不是依赖训练信息。
- 将可用产品与来电者匹配:它会将库存情况与来电者描述和购买历史进行比对。
- 推荐并完成订单:智能体会推荐产品,并根据请求完成订单,无需将来电者转至其他渠道。
整段对话由工具调用驱动。语音机器人借此可接入产品目录或订购 API 等外部系统,并将这些信息融入回复。ElevenLabs 的工具文档介绍了如何配置这种连接。

语音智能体能处理敏感客户数据吗?
语音智能体提供可配置的控制项,包括保留期限、不存储通话音频的选项、对话历史脱敏,以及面向医疗等高度监管行业的严格保留政策。
在 ElevenAgents 中,所有这些控制项均通过隐私设置配置。具体如下:
- 数据保留:对话转写文本和音频录音仅在特定期限内存储。ElevenAgents 默认将转写文本和录音保留 2 年,可自定义为 0 天至无限期;为符合 HIPAA,建议至少保留 6 年。请注意,要完全符合 HIPAA,在平台上实际处理受保护健康信息需要启用零保留模式,这意味着需要通过 webhook 在自有基础设施上安全存储这 6 年的记录。
- 音频保留:通话录音可为客户留存目的而保存,也可完全关闭,确保不保留客户音频。关闭录音保存并将保留政策设为 0 天,意味着数据会在通话结束后立即删除。
- 对话历史脱敏:对话结束后,可通过通话后处理步骤扫描每次通话的转写文本和音频,并通过脱敏保护敏感客户数据。该步骤会扫描音频和转写文本以检测敏感信息,在转写文本中显示占位符,并在音频片段中加入哔声。这既保留了可供审核的对话历史,也减少了敏感信息暴露。
- 零保留模式:此配置最适合有严格保留要求的场景。请求完成后,请求和响应中的大部分数据会立即删除。该配置适用于 API 流量,并面向企业级客户提供。
对于医疗相关部署,企业级客户签署商业伙伴协议(BAA)后,ElevenAgents 符合 HIPAA 适用条件。签署 BAA 后,我们的零保留模式旨在支持 HIPAA 合规;具体是否合规取决于客户如何配置和使用平台以满足其合规要求。有关这些控制项的完整配置详情,请参阅 ElevenLabs 隐私文档。

语音智能体可带来哪些客户满意度提升?
通常能提升客户满意度的因素包括消除或缩短等待时间、保持一致性和更快解决问题。语音智能体可立即接听电话,因此来电者通常无论何时致电,都能获得质量一致的回复。这可加快常规请求的解决速度,避免其像过去那样在队列中等待人工客服。
但需要注意的是,如果与客户的互动出了问题,将情绪沮丧的客户困在智能体循环中,对客户体验的损害比等待音乐更快。许多组织通常不会单独追踪客户满意度。与之同时报告的指标包括自助解决率(智能体无需人工介入即可解决请求的比例)、平均处理时长和首次来电解决率。
在报告中结合审查这些指标时,它们往往会呈现出与单项指标不同的情况。例如,自助解决率高但客户满意度评分下降,通常说明电话虽然很快得到处理,却没有人工参与。
Admiral 是优先重视首次联系解决率而非自助解决率的一个典型案例。正如本场网络研讨会所述,他们的目标是实现 90% 的解决率、提供 24/7 服务,并切实提升 NPS。转交人工处理从不会被视为智能体的失败,因为解决问题比让通话始终由智能体处理更重要。
了解更多,了解这项语音智能体功能如何融入其 CRM 和语音配置。
开始使用 ElevenAgents 的完整语音智能体功能
本指南介绍的语音智能体功能并非彼此独立的产品。这些功能应构建在同一个智能体和配置中,并根据组织的业务需求设置合适的动态变量、工具和隐私设置。
入门可以很简单:从一种通话类型开始,只连接其所需的系统。待指标证明其运作有效后,再逐步扩展智能体。
了解更多关于ElevenAgents,或联系销售,立即开始。




