Agent 一接外部接口,就从模型问题变成分布式系统问题。超时代表未知而不是失败;幂等、状态查询与控制面,才是上生产线前的底线检查。
智能体调用退款接口,网络超时,退款到底成功没有?TikTok 的站点可靠性工程师 Salman Munaf 用这个问题开场:超时从来不等于失败,而等于未知。模型一旦开始调外部服务,问题就不再只是模型问题,而变成分布式系统问题。这个转变,很多团队是在事故之后才意识到的。
早期模型是文本进、文本出,错了也只是答错,错误不会扩散。智能体不一样——它规划、调用 API、改数据库、发邮件,每一步都可能产生真实副作用。Munaf 在演讲里举了两起真实事故:美国一家模型托管平台的智能体删除过生产数据库,某航空公司的客服机器人做出过错误的退款承诺。两起事故都不是模型"不会回答",而是系统层面缺少边界。边界缺失的破坏力,在 2026 年多起智能体失控事件里被反复验证,我们之前整理过700 个智能体攻破 Hugging Face 的安全复盘。
传统分布式服务协调多步工作流是确定性的:每步做什么、出错怎么办,都是预先定义好的。智能体是概率性协调器,能执行的动作范围大得多,不是传统决策树能覆盖的。没有确定性控制来约束,概率性的选择就可能带来严重后果。因此核心问题不是"模型够不够聪明",而是怎么在概率性模型外面套上确定性控制。
重试是智能体面对失败的默认反应。它看到错误就重试,却不知道自己对系统真实状态一无所知。要避免"重试风暴"和重复副作用,下面三件事应该在设计阶段就做,而不是等事故后再补。
Munaf 还提醒把记忆当缓存处理:上下文一旦能影响行动,它就是状态,状态会过期、会和权威数据冲突。记忆应当可以被失效,并且带着来源信息。
| 维度 | 传统分布式服务 | AI 智能体 |
|---|---|---|
| 失败模式 | 确定、可枚举 | 概率性,动作空间大 |
| 重试 | 需幂等设计 | 默认行为,更危险 |
| 状态 | 有明确 schema | 上下文即状态,会过期 |
| 可观测性 | 日志加追踪 | 要记录看到什么、据此做了什么、为什么 |
| 权限 | 通常最小权限 | 常被授予过大范围 |
TiDB 团队唐刘在 2026 年 9 月的 InfoQ 专访里提出一句话:薄 Agent Loop,厚 Control Plane。智能体最内层的循环——模型协议、工具调用、流式输出——变化最快、最容易同质化,完全应该站在开源巨人肩膀上;但状态、权限、副作用的边界必须保持稳定。就像数据库:SQL 和优化器可以越来越聪明,事务、权限、持久性这些边界,不能因为"上层更聪明"就消失。
这套思路对企业有几点直接启发。第一,Agent 框架可以随时换,控制面不该跟着重写。第二,模型越强,可以放宽它在沙箱里的探索空间,但绝不能放宽它对真实生产系统的副作用边界。第三,Fail Fast 比 Retry 更重要——真正危险的不是智能体犯一次错,而是错误被反复重试后放大成雪崩。TiDB 内部已经有承载数百万个智能体工作区的实践,验证了这套控制面的扩展性。控制面最先出问题的往往是授权、上下文与成本这三处,我们拆解过这三类工程债。
微软在 2026 年 8 月发布了一套治理架构,把重点从文档政策转向运行时执行。政策定义规则,运行时控制执行规则,可观测性捕获行为,评估检验质量与安全,审计再把运营遥测变成合规证据。他们的原话很直接:只有当生产环境能够验证时,AI 策略才算真正落实。这套架构覆盖九个治理领域,智能体治理是其中之一——为智能体的身份、访问、活动与工作流检查点增加控制,影响大的操作可以要求人工审批。
对企业智能体平台选型,这套框架给出一个可用的判断标准:平台能不能在不修改智能体代码的前提下,提供身份验证、限流、审计这类运行时控制?如果答案是不能,那治理就只能停留在制度文档层面。
我们给客户做智能体交付时,通常会把这份清单放在验收标准里。模型能力再强,只要它会碰真实数据,这六项就绕不开。对照另一个高频现象——不少项目停在 POC 无法上线,卡点往往就在这类工程细节而不在模型选型,90% 企业智能体走不出 POC 的五个工程死结可以互参。
服务端可能已经成功,只是响应在网络中丢失。智能体把超时当失败去重试,就会重复执行副作用。所以超时要视为"未知",配合幂等键与状态查询来判断真实结果。
只要它会调用会改数据的工具——退款、下单、发消息、改配置——就需要。只做只读问答的可以不考虑,但那类场景通常也不需要"智能体"这个形态。
需要。控制面不是多智能体编排的专属话题;权限收口、审计留痕、人工审批,对单个智能体同样必要。事故往往不是发生在"多个智能体协作"时,而是发生在单个智能体拿到过大权限时。
不冲突。框架解决模型协议与工具调用,控制面解决状态与副作用边界,两者是正交的。框架可以频繁更换,状态、权限、审计这些边界应当稳定。
如果你的智能体项目正在从 Demo 走向生产,不确定工具层和控制面还有哪些坑,可以直接联系我们,把这份清单当成一次免费的技术评审起点——预约一次架构沟通,或者先看我们做过的企业 AI 交付案例。