多智能体实战:Anthropic 顾问+编排模式数据对比
Anthropic 开发者团队首次公开内部多智能体方案,SWE-bench Pro 实测:顾问模式 92% 性能/63% 成本,编排模式 96% 性能/46% 成本。含对比表、场景选择与企业落地指南。
Anthropic 官方多智能体实战:花一半钱拿九成性能的两种模式
Claude 开发者团队在 2026 年 7 月首次公开了内部高频使用的多智能体方案——附带 SWE-bench Pro 与 BrowseComp 双基准实测数据。结论很直接:组合方案用 46%–63% 的成本,拿到了旗舰模型 92%–96% 的性能。
多智能体的真正价值:模型分层,按需调度
Fable 5 在 SWE-bench Pro(482 道真实软件工程题)上单独跑出 91.5% 准确率,单次成本约 $2.25。Sonnet 5 单独跑 75.5%,只要 $0.75。差 16 个百分点,价差 3 倍。对于在 CI 流水线里跑自动修复的团队,全量用最强模型的账单不可持续——这也呼应了我们在2026 年开发范式转移中讨论过的效率拐点。多智能体的核心不是串更多模型,而是让强模型做判断、让弱模型做执行。
顾问模式:执行者主动向强模型求助
控制流自下而上。Sonnet 5 跑主循环,只在需要高层判断时通过 tool call 向 Fable 5 发起一次咨询,获取指导意见后继续执行。调用频率极低——大约每任务一次,绝大多数 token 按低价计费。关于 Fable 5 的实战表现,我们在用 165 美元推翻 Prompt 常识的实验中有更详细的记录。
SWE-bench Pro 实测:组合方案 84%,$1.40。对比 Fable 5 单独(91.5%/$2.25),用 63% 的价格拿到 92% 的性能。适合代码修复、单文件重构等流程线性的任务。
我们内部跑过类似实验:便宜模型做主干推理,关键决策点切到强模型。发现瓶颈往往不在模型不够聪明,而在不知道什么时候该换方向。顾问模式恰好用极少的强模型调用解决了定向问题。
编排模式:强模型规划,弱模型并行执行
控制流自上而下。Fable 5 先做全局规划,将任务拆成可并行的子任务,扇出给多个 Sonnet 5 worker 独立执行。强模型只在规划阶段集中消耗 token。
BrowseComp 完整集数据:
- 全 Sonnet 5:77.8%,$16.01
- Fable 5 规划 + Sonnet 5 执行:86.8%,$18.53
- 全 Fable 5:90.8%,$40.56
编排方案以 46% 成本拿到 96% 性能。相比纯 Sonnet 5,准确率提升 9 个百分点,成本仅增 $2.5。适合批量代码审查、多仓库并行迁移等"规划重、执行轻"的场景。
两种模式对比:一张表做决策
| 维度 | 顾问模式 | 编排模式 |
|---|---|---|
| 控制流方向 | 执行者向上求助 | 规划者向下委派 |
| 强模型角色 | 被动指导 | 主动规划分配 |
| 强模型调用频次 | 低(约 1 次/任务) | 规划阶段集中使用 |
| 适合场景 | 单任务需高层纠偏 | 可拆分、可并行的批处理 |
| 性价比公式 | 92% 性能 / 63% 价格 | 96% 性能 / 46% 价格 |
| 典型用例 | 修 bug、单文件重构 | 多仓库迁移、批量审计 |
工程直觉:任务像"修一个 bug"——线性流程、需中途纠偏——选顾问模式。任务像"审计 20 个微服务的安全配置"——可并行、重规划——选编排模式。
不适合的场景:我们踩过的坑
不是所有任务都适合多智能体。实际落地中遇到两类明确的反例:
上下文共享密集型任务。跨文件一致性重构时,模型间的上下文传递会造成信息衰减。不如让一个强模型一次性读完所有文件直接动手。
延迟敏感型任务。tool call 往返增加端到端延迟。用户交互式代码补全场景下,每次等 2–3 秒回调体验很差。
原则:多智能体的收益来自"规划质量提升"与"计算成本下降"的剪刀差。任务规划开销可忽略不计时(如单函数补全),多一层调度就是净亏损。关于多智能体在实际工程中的五大决策陷阱,多智能体架构 5 个工程决策(2026 实战)有更系统的拆解。
常见问题
这两种模式绑定特定模型吗?
不绑定。顾问与编排是通用架构模式。GPT-5 + GPT-5 Mini、DeepSeek V3 + DeepSeek Lite、甚至本地模型 + 云端模型都能套用。本质是"强模型判断,弱模型执行"的分层思想。
会替代单模型方案吗?
不会。SWE-bench 上 Fable 5 单模型仍是最高的 91.5%。多智能体的价值在性价比,不在绝对精度。预算充裕且追求极致质量时单强模型仍是正解。
企业落地需要什么基础设施?
至少三层:模型路由层(按任务特征分配模型);agent 框架(支持 tool call 与子任务扇出);成本监控面板。一个常被忽视的现实是:90% 企业智能体走不出 POC,缺的不是模型能力而是工程基础设施。蓝曜炬辉在给客户做 AI Agent 架构落地时,这三块通常是第一优先级。
小团队能用吗?
能。顾问模式接入成本很低——给现有 agent 加一个 tool call 即可。有一个 6 人开发团队客户用此方案做 CI 自动修复,月度成本从约 $1200 降到约 $500,准确率从 68% 提升到 81%。
参考
- Claude 开发者官方分享:团队高频使用的两种多智能体模式 — AI HOT, 2026-07-08
- Anthropic 官方 X 账号原始帖文 — X.com
- 蚂蚁集团周俊 AICon 演讲:从 Token 数量到 Token 密度 — AI HOT, 2026-07-08
