有选择地专精:如何构建能在生产环境中稳定运行的智能体
- 发布时间
打造一个演示级智能体从未如此之快。接入一个能力强大的模型,配上几项工具,半天之内,就能让它预约会议、起草回复或按需调取报告。问题会在之后出现。客户体验副总裁、运营负责人、平台负责人——无论谁负责让这个智能体在企业规模下稳定运行——都会碰到瓶颈。演示中表现良好的方案,一旦面对真实的业务量和风险,就会变得缓慢且难以预测。很少是底层平台出了问题,而是上层架构的问题。
瓶颈:一个智能体包办所有事
第一个智能体成功后,自然会想不断给它加码:更多工具、更多上下文、更广的职责范围。既然它能做好一项工作,当然也能做好十项。
这种想法会造成瓶颈。当一个智能体要在广泛范围内负责规划、执行、记忆和复盘时,多个问题会同时出现。
它的决策会变慢,也更难引导,因为每一步都要在同一个上下文窗口和同一次推理中争夺空间。随着可用工具数量增加,工具选择也会变得不可靠,准确率往往会下降。系统还会变得脆弱,因为第一步的小误解无人核查。职责之间没有边界,早期错误就会悄悄污染后续所有环节。
设想有一个 语音智能体,从头到尾处理呼入的保险理赔电话。在一次通话中,它要核实来电者身份、调取正确保单、确认承保范围、解读理赔申请、估算可能的赔付金额、记录互动内容,并决定是否转交人工处理。演示时,来电者配合、线路清晰,它能顺利完成所有任务。但在生产环境中,嘈杂的移动网络可能让它在第一步就听错来电者姓名。智能体无法恢复,调取了错误保单,自信地推断客户并不具备的承保范围,并为客户从未购买的方案报出赔付金额。从听到姓名到据此采取行动之间没有任何检查环节,一次转录失误就变成了向客户当面说出的错误承诺。
在受监管行业,这不仅是一次糟糕体验,更是附带责任的合规事件。这也是智能体可保险性正成为生产部署前提条件的原因之一,也是我们将 ElevenAgents 打造成首个可通过 对话式 AI 平台,经由 AIUC 获得 AI 保险资格。
看看真正出了什么问题。智能体并不擅长不了对话,而是无法独自承担所有职责,在理解信息和采取行动之间没有检查点。解决办法不是降低目标,也不是让智能体少说话,而是建立结构。
这里需要说得更准确些。这主要不是模型本身的局限。更强的模型可以提高上限,却无法消除结构性问题。这是系统设计问题。
思维模型:部门,而不是事必躬亲的 CEO
想想一家公司如何成长。如果 CEO 亲自决定工程、营销和 HR 的每一项事务,公司很快就会停滞不前。解决办法不是聘请一个更聪明的 CEO,而是组建职责清晰的专业团队。
同样的逻辑也适用于 AI 系统。与其使用一个庞大的智能体,不如将系统拆分为职责有限的专业智能体。一个负责检索数据,一个负责编写代码,一个只做事实核查。每个智能体的关注范围更窄,因此单次决策成本更低、速度更快,也更值得信赖。
这些都不需要专门的基础设施。我们的平台 ElevenAgents 已经提供了 所需的构建模块:以对话智能体为核心,用工具调用进行查询和更新,在职责范围变化时通过智能体转接实现顺畅交接,以知识检索确保内容有据可依,再通过工作流连接各个部分。要做好这一点,关键在于有目的地使用这些基础能力,而不是将所有职责塞进一个提示词里,再期待它能稳定运行。

这就是多智能体架构的吸引力,而且对于合适的工作,它确实有效。以联络中心为例:假设你要为昨天的 10,000 通客服来电进行质量评分。工作可以清晰拆分:一个智能体检查客服人员是否遵循合规话术,另一个评估同理心和语气,另一个标记本应升级处理的通话,还有一个提取客户来电原因。这些判断彼此不依赖,都可以针对同一份转录文本并行执行。这正是多智能体最适合的场景:各部分相互独立,工作以阅读为主,将每项判断隔离在各自上下文中,反而能提升判断质量。

必须正视的权衡
多智能体并非零成本的收益。任何评估这种架构的技术负责人,在决定采用前都会——也应该——审视协调成本。最重要的注意事项是:
最常见的失败模式是上下文碎片化。当你将任务拆分给无法共享完整上下文的智能体时,每个智能体都只能基于局部视图行动,其决策可能产生协调器无法调和的冲突。
实时对话中也会出现同样的陷阱。设想一次催收电话被拆分为谈判智能体和合规智能体,两者不共享状态。谈判智能体为了提供帮助,向客户提出 6 个月分期付款方案。合规智能体从未见过这一提议,因客户所在地区规定此类方案最长只能为 3 个月,本应拒绝。每个智能体在各自负责的部分都表现合理,但合在一起,却向真实客户实时作出了公司无法兑现的承诺。问题不在于模型不够强,也不在于语音层,而在于两个狭窄的视图从未汇合。
解决办法不是增加更多智能体,而是保持对话完整,并在作出承诺前让智能体将合规规则作为工具查询。这样,规则和提议会在说出口前交汇。这是一个设计选择,而一个能力强大的平台会让它更容易实现。
实际结论是,选择取决于任务。多智能体擅长各部分真正独立、可并行且以阅读为主的工作——研究、检索和验证。它不擅长高度耦合、所有内容都必须保持一致的工作,例如编写一整段代码。对于实时语音流程等对延迟敏感的场景,每增加一次智能体跳转,都会在紧张的时延预算中增加往返时间,因此默认应避免过深的智能体链路。这也是基础设施的重要之处。ElevenAgents 将语音识别、轮次管理和语音生成部署在同一套技术栈中,因此在加入任何编排开销前,基础延迟已降至最低。
真正驱动 ROI 的因素
从智能体获得实际回报的团队,通常不是选择最聪明的单一模型并期待它独自承担所有工作的人。它们会有意识地做出架构决策:哪些地方需要专业化,哪些地方应保持在同一个连续上下文中,以及智能体必须协作时该如何协调。
换言之,答案很少是“一个巨型智能体”,也很少是“拆分一切”。答案是选择性专业化。收益来自在恰当位置划定边界,而不是智能体数量或某个智能体的能力。工作高度耦合、上下文必须连续时,应由单个智能体处理;工作可并行、上下文能清晰隔离时,再拆分为专业智能体。
建议
对于即将开展的项目,不要先选架构,而要先梳理工作内容。
列出系统实际需要的具体能力。标记哪些部分真正独立,哪些部分高度耦合。找出隔离上下文是优势而非负担的地方——例如,你希望事实核查环节与主要推理链路分开。然后,也只有到这时,才决定哪些职责应拆分给独立智能体。
以生产环境中的贷款还款提醒热线为例。实时对话应留在一个连续的智能体中,因为客户说的话、语气和来回交流高度耦合,且每多一次跳转都会增加来电者能感受到的延迟。围绕这个单一的对话核心,可以接入不打断流程的边界明确的专业能力:用于获取账户和未偿余额的工具调用、在说出任何还款提议前由智能体查询的合规护栏、需要时顺畅转接人工,以及一批独立的评估智能体,在次日早晨为录音评估质量和风险。

对话高度耦合,因此保持完整。查询、检查和评分彼此独立,因此各自应有明确边界。这是选择性专业化,而不是为了拆分而拆分,并且能直接对应优秀智能体平台已经提供的基础能力。
这样做,就能获得专业化的优势,而无需承担不必要的协调成本:行为可预测、故障可控,以及系统复杂度是经过主动选择,而不是在生产环境中才被迫发现。以这种方式使用时,智能体平台不会是一个随着规模扩大而愈发不稳定的演示方案,而会成为一种基础设施:为每个部分赋予清晰职责后,系统会更加稳定。这正是我们打造 ElevenAgents 的目标。



