Anthropic 2700 万 token 实验:协调式多智能体系统发现 266 个漏洞、独立并行只发现 21 个,但两者仅 12 个重叠。拆解实验证明与未证明的边界,给协调/并行/混合三种编排的适用场景、真实成本和企业落地判断标准。
某制造企业去年把 5 个售后流程一次性接进多智能体系统:一个总协调者 + 8 个分工智能体,看起来很美。月底对账,模型调用成本是之前的 3.2 倍,工单解决率只涨了 6%。这不是个例——Anthropic 2026 年 8 月发布的实验给出了更硬的数据:45 个协调式智能体用 2700 万 token 发现 266 个漏洞,而独立并行方法只花 650 万 token 就发现 21 个。两个数字摆在一起,很多团队的第一反应是"协调式碾压并行",但真相要复杂得多。
研究团队在 15 个开源软件项目上做漏洞挖掘对比。协调式集群由 45 个智能体组成,每个智能体有独立虚拟机、一个可互相交流的共享论坛,同一份提示词要求它们找漏洞、互相评审,另设一个仲裁智能体做最终裁决。对照组是各指一块代码的独立并行智能体。
关键数字(模型为 Claude Mythos Preview 与 Opus 4.8):
把集群输出限制到核心目录后,两者"每个漏洞的算力成本"基本打平。研究原文(经 AIHOT 编译)据此判断:协调的价值不在"更省钱",而在"覆盖更广"——集群里的智能体会自己造工具、学会分工,把注意力放到它认为漏洞最多的地方。
这次实验真正证明的有三点。第一,协调式多智能体系统在开放式搜索任务里能自主专业化,不需要人工预先分配位置。第二,个体智能体之间的信息共享确实能提升整体发现面,12 个重叠说明两种方法看的是不同的"矿脉"。第三,智能体间交互量正在逼近甚至超过人机交互,协调失败不会随模型变强自动消失。
没证明的同样重要。实验里智能体彼此不直接依赖——一个智能体漏掉漏洞不会拖累另一个。同一篇报告里还有反向实验:让多个集群在 12 小时内协作开发一个网页游戏,三种提示词(基线、指定角色、CEO 层级)差异不大,产出的游戏"无法以人类速度运行、界面难以理解"。
结论很直接:工具调用阶段的多智能体协作已经能用,长期协调(共享代码库、互相依赖的产出物)仍是短板。把漏洞挖掘实验外推到"所有任务都该上协调式",是过度解读。
| 维度 | 独立并行 | 协调式(中央调度) | 混合式 |
|---|---|---|---|
| 适用任务 | 可拆成互不依赖子任务:批量检测、多文件审查 | 开放式探索:漏洞挖掘、方案生成、情报搜集 | 多系统长流程:工单处理、合同审查、业务流转 |
| 算力成本 | 最低,650 万/21 漏洞量级 | 高,2700 万/266 漏洞量级,按单漏洞看打平 | 中,关键节点协调、常规节点并行 |
| 失败传播 | 单点失败互不影响 | 协调者单点、消息风暴、相互误导 | 按节点隔离,可控 |
| 可观测性 | 好,每路独立日志 | 差,跨智能体上下文难追踪 | 中,协调边界清晰 |
| 适合团队 | 刚上手、成本敏感 | 有专门提示词/工具团队 | 生产环境、业务价值明确 |
这张表是我们给客户做架构评审时的默认起点。三个模式不是"先进 vs 落后",而是不同任务形状的匹配问题。更细的产线落地判断,可以参考我们整理的多智能体工作流从实验到产线的 5 个工程决策。
多智能体系统的成本常被低估,因为大家只盯模型调用费。实际有四笔账:
2026 年的框架生态正在往"编排可替换"方向走:DeepSeek Harness v0.1 把模型、工具、会话、沙箱、编排、UI 全部设计成可组合插件;GPT-5.6 则在 API 层直接提供原生多智能体编排能力。行业讨论里"让 MCP 走向无状态"的动机之一,正是给编排层减负——状态越重,协调成本越高。这一点在我们自己的交付里感受很深:MCP 资源按无状态化设计后,多智能体间的上下文同步开销明显下降。插件化框架带来的选型窗口,我们在开源底座与插件化框架的工程信号里展开过。
判断标准不是"AI 能力够不够强",而是任务形状:
我们给制造、金融客户的默认方案是混合式:核心决策点用单个智能体,需要广度时临时拉起子智能体群,用完即拆。AutoGPT 团队用 AGENTS.md + PR 模板 + CI 覆盖率门槛管理智能体提交的 PR,把"不可用"变成"可用但不符合路线图"——这种门控思路在多智能体生产化里同样成立。
我们 2025 年底给一个物流客户做过一套售后工单系统,第一版是"全量协调式":一个总协调智能体调度 8 个分工智能体,每个工单都走完整评审链路。上线两周,模型调用成本是单智能体方案的 2.1 倍,工单平均处理时长反而多了 40%——大部分时间耗在智能体之间的互相等待和重复确认上。
后来改成混合式:简单工单由单个智能体直出,只有跨 3 个系统的复杂工单才拉起协调链路,总成本回到单智能体方案的 1.2 倍,复杂工单的解决率提升了 27%。这个教训和我们上面对照表的判断一致:协调式是放大器,不是省钱的银弹。
如果你的团队正在规划智能体编排,先别急着堆框架。拿真实任务跑一遍"并行 vs 混合"小对照,看调用量和成功率两个指标,再决定要不要引入协调层。那篇实验的另一个解读角度,可以看我们整理的多智能体实验的三个工程警示。
单智能体加工具是"一个人用更多工具",多智能体系统是"多个人分工协作"。实验表明,分工带来的覆盖面和专业化在开放式任务里有真实收益,但也带来协调成本。
不一定。实验里协调式发现更多漏洞,但调用量是并行的 4 倍,按"单漏洞算力成本"算两者打平。任务是否可拆分成独立子问题,决定了并行够不够用。
任务跨 3 个以上系统、需要多轮工具调用、流程长且分支多的时候收益最大。单步高准确率任务上多智能体只会增加成本和失败面。
三招:能用并行就不上协调;协调只在关键节点做;给智能体加门控(评审、阈值、超时)。我们实测混合式可以控制在单智能体方案的 1.2 倍以内。