推出 Eleven v4认识 Eleven v4:迄今情感表现最丰富的模型。 Creator+ 套餐含 3 倍点数优惠,截止至 10 月 12 日

跳至内容

有选择地专精:如何构建能在生产环境中稳定运行的智能体

发布时间

收听收听本文

构建一个演示级智能体从未如此快速。接入一个能力出色的模型,配上几项工具,一个下午就能做出可按指令预约会议、起草回复或调取报告的智能体。问题出在之后。客户体验副总裁、运营负责人、平台负责人——任何负责让智能体在企业规模下运行的人——都会碰壁。演示中表现良好的系统,一旦面对真实的业务量和风险,就会变慢且难以预测。出问题的很少是底层平台,而是上层架构。

瓶颈:一个智能体包办一切

第一个智能体成功后,人们自然会想不断给它加码:更多工具、更多上下文、更广的职责。既然能做好一件事,当然也能做好十件事。

这种想法会造成瓶颈。当单个智能体要在广泛范围内负责规划、执行、记忆和复盘时,多个问题会同时出现。

决策会变慢,也更难引导,因为每一步都要在同一个 上下文窗口 和同一次推理中争夺空间。可用工具越多,工具选择往往越不可靠,准确率也会下降。系统也会变得脆弱,因为第一步的小误解未经检查就会延续下去。职责之间没有边界,早期错误就会悄然影响后续所有环节。

设想一个 语音智能体,负责端到端处理呼入的保险理赔电话。一通电话中,它必须核实来电者身份、调取正确保单、检查承保范围、解读理赔请求、估算可能的赔付金额、记录互动情况,并决定是否转交人工处理。在演示中,面对配合的来电者和清晰的线路,它能顺利处理一切。但在生产环境中,嘈杂的移动网络可能让它在第一步就听错来电者姓名。智能体无法恢复,调取了错误保单,自信地分析来电者并不具备的承保范围,还为对方从未购买的计划报出赔付金额。姓名识别与采取行动之间没有任何检查环节,于是一次转录失误,变成了对客户亲口作出的错误承诺。

在受监管行业,这不只是糟糕的体验,更是附带责任的合规事件。这也是智能体可投保性正成为生产部署前提条件的原因之一,也是我们将 ElevenAgents 打造成首个可通过 对话式 AI 平台,经由 AIUC 获得 AI 保险资格的原因。

注意真正出问题的是什么。智能体并不擅长不了对话,而是不擅长独自承担所有职责,在理解信息和据此行动之间没有检查点。解决办法不是降低目标,也不是让智能体更谨慎,而是建立结构。

这里需要说得准确些。这主要不是模型本身的局限。更强的模型能提高上限,却不能消除结构性问题。这是系统设计问题。

思维模型:部门分工,而非由 CEO 决定一切

想想一家公司的成长过程。如果 CEO 亲自决定工程、营销和人力资源的每一项决策,公司就会停滞不前。解决办法不是聘请更聪明的 CEO,而是组建职责明确的专业团队。

同样的逻辑也适用于 AI 系统。与其使用一个庞大的智能体,不如将系统拆分为职责有边界的专业智能体。一个负责检索数据,一个负责写代码,一个只负责事实核查。每个智能体的关注范围更窄,因此单项决策成本更低、速度更快,也更值得信赖。

这些都不需要专门的基础设施。我们的平台 ElevenAgents 已提供 所需的构建模块:以对话智能体为中心,使用工具调用进行查询和更新;当职责范围变化时,通过智能体转接实现顺畅交接;利用知识检索确保回答有据可依;再通过 workflow 串联各个环节。要构建好这类系统,关键是有意识地使用这些原语,而不是把所有职责塞进一个提示词,然后希望它能运转。

这正是 多智能体架构 的吸引力所在,对于合适的工作场景确实如此。以联络中心为例。假设你想为昨天的 1 万通客服通话进行质量评分,工作可以清晰拆分:一个智能体检查客服代表是否遵循合规话术,另一个评估同理心和语气,另一个标记本应升级处理的通话,还有一个提取客户来电原因。这些判断彼此不依赖,都能针对同一份转录文本并行运行。这正是多智能体架构擅长的场景:各部分相互独立,工作以读取为主,且将每项判断隔离在各自上下文中,反而能让判断更准确。

Comparison of single-agent and multi-agent systems with roles and workflows.

需要正视的取舍

多智能体并非毫无代价。任何评估这种架构的技术负责人,在决定采用前都会——也应该——充分检验协调成本。最重要的注意事项是:

最常见的失败模式是上下文碎片化。当你将任务拆分给无法共享完整上下文的智能体时,每个智能体都只能基于局部视角行动,其决策可能产生协调器无法调和的冲突。

实时对话中也会出现同样的陷阱。设想一通催收电话被拆分给谈判智能体和合规智能体,两者不共享状态。谈判智能体为了提供帮助,向客户提出 6 个月还款计划。合规智能体从未看到这个提议,原本会拒绝它,因为客户所在地区将这类计划限制为最长 3 个月。每个智能体在各自的局部范围内表现都合理,但合在一起,却向现实中的客户作出了公司无法兑现的实时承诺。问题不在于模型能力不足,也不在于语音层,而在于两个狭窄的视角从未交汇。

解决办法不是增加更多智能体,而是保持对话完整,让智能体在作出承诺前将合规规则作为工具查询。这样,规则与提议会在说出口之前相互核对。这是一项设计选择,而能力足够的平台会让它更容易实现。

实际结论是,选择取决于任务。多智能体最适合各部分真正独立、可并行且以读取为主的工作,例如研究、检索和验证。它不适合高度耦合、所有内容都必须保持一致的工作,例如编写一整段代码。对于实时语音 pipeline 等对延迟敏感的场景,每增加一次智能体跳转,都会在紧张的延迟预算中增加往返时间,因此默认情况下,深层智能体链存在风险。这也是我们基础设施的价值所在。ElevenAgents 将语音识别、轮次切换和语音生成部署在同一技术栈中,因此在加入任何编排开销前,基础延迟已降至最低。

真正推动 ROI 的因素

真正从智能体获得回报的团队,通常不是选择最聪明的单一模型,并期待它承担所有工作的人。他们会有意识地作出架构选择:哪些环节需要专业化,哪些环节要保留在连续上下文中,以及必须协作时智能体应如何协调。

换句话说,答案很少是“一个巨型智能体”,也很少是“拆分一切”。而是选择性专业化。收益来自在正确的位置划定边界,而非智能体数量或某个智能体的能力。工作高度耦合、上下文需要保持连续时,就由单个智能体处理;工作可并行、上下文能清晰隔离时,再拆分为专业智能体。

建议

面对即将开展的项目,不要先选架构,而要先梳理工作。

列出系统实际需要的具体能力。标记哪些部分真正独立,哪些部分高度耦合。找出隔离上下文是优势而非负担的位置——例如,你希望与主推理链分开的事实核查环节。然后,也只有到这时,再决定哪些职责应拆分给不同智能体。

以生产环境中的贷款提醒热线为例。实时对话应保留在一个连续的智能体中,因为客户的话语、语气和来回交流高度耦合,并且每增加一次跳转,都会带来来电者能察觉的延迟。围绕这个单一对话核心,可以添加不打断流程的专业模块:用于获取账户和未偿余额的工具调用、在说出任何还款提议前查询的合规护栏、在情况需要时顺畅转接人工,以及一批独立的评估智能体,在次日早晨为通话录音进行质量和风险评分。

Flowchart showing a customer service process with routing, refund, and meeting options

对话是耦合的,因此应保持完整。查询、检查和评分则相互独立,因此各自需要边界。这就是选择性专业化,而非为了拆分而拆分;它直接对应优秀智能体平台已提供的原语。

这样做,就能获得专业化的优势,而无需承担不必要的协调成本:行为可预测、故障可控,系统复杂度由你主动选择,而不是在生产环境中才被迫发现。以这种方式使用时,智能体平台不会是一个随着规模扩大而日益不稳的演示,而是让每个部分职责明确后,运行会愈发稳定的基础设施。这正是我们构建 ElevenAgents 的目标。

相关内容

用高质量 AI 音频创作