Opus 5 性能翻倍价格减半,WAIC 2026 给出同一个关键词「算账」——AIcoding 赛道规则已被重写,企业选型逻辑需要彻底更新。
先看硬数据。Opus 5 在 Frontier-Bench v0.1 上的性能是前代 4.8 的 两倍以上,在 ARC-AGI 3(要求模型解决全新问题的评测)上得分是次优模型的 三倍。CursorBench 3.2 上,它以 一半成本 达到了接近 Fable 5 的水平;Zapier AutomationBench 则直接拿到 100% 通过率,是次优模型的约 1.5 倍[1]。
早期用户反馈同样印证了代际跃升:Lovable 团队报告最难编码任务上提升 22%,且运行一致性显著改善;Box 在尽职调查工作流中测得 17% 的性能提升;一家交易公司用单次会话完成了此前任何模型都无法独立完成的市场数据源构建[1]。
但数字背后的战略信号比数字本身更重要:Anthropic 在主动把旗舰级智能压进一个半价套餐。这不是「技术又进步了」的常规叙事——这是在告诉市场:模型能力的军备竞赛已到拐点,下一阶段拼的是性价比。
同一天,WAIC 2026 的 InfoQ 直播间里,L2F 光源资本吉星用三笔账把行业现实摊开了[2]:
昆仑万维 CEO 方汉的判断更根本:文本大模型的 Scaling 可能已经到头了。但另一方面,Harness + Agent 组合却在 2025 Q4 意外改变了格局——Coding 场景的 token 消耗急速膨胀并占据绝对优势。Agent 通过调度 Harness,让概率输出的大模型开始有效解决确定性需求,完成了从「可能对」到「必须准」的关键跨越[2]。
总结成一句话:上半场拼模型能力,下半场拼工程化落地和成本控制。这和 Anthropic 主动降价的策略完全吻合。
与 Opus 5 同步发布的还有 Anthropic 官方博客的一篇技术文章。其中最惊人的一句话:他们从 Coding 产品的系统提示词中移除了 超过 80% 的内容,编码评测无任何可衡量的性能损失[3]。
新旧方法论的对比如下:
| 维度 | 过去(模型较弱时) | 现在(5 代模型) |
|---|---|---|
| 行为约束 | 写死规则:「默认不写注释」「不要创建文档」 | 给判断空间:「匹配周围代码风格」 |
| 工具使用 | 大量示例,生怕模型学不会 | 设计清晰的接口——枚举值本身就是提示 |
| 信息组织 | 所有内容塞在最前面 | 渐进式披露:按需按场景加载上下文 |
| 指令密度 | 系统提示词和工具描述重复相同指令 | 只在工具描述里写指令,系统层极简 |
| 记忆机制 | 手动写入配置文件 | 自动记忆,模型自主保存并调用 |
这对自建 Agent 的团队有直接启示:如果你还在维护一摞厚厚的配置文件和 Skill 定义,「把所有已知实践都塞进去以防模型遗漏」,那你大概率在过度约束它——和 Anthropic 一年前的做法如出一辙。建一个可在适当时机加载的文件树,比建一个臃肿的中心仓库更有效。我们在自研 vs 外包的决策框架中也讨论过类似的工程化取舍——工具链的复杂度本身就会吃掉模型能力提升带来的收益。而 Anthropic 内部数据的分析进一步印证了这一点:当 80% 的代码由 AI 编写时,上下文工程的精简程度直接决定了 Agent 的交付质量和一致性。
把这三件事放在一起看——Opus 5 降价、WAIC 三本账、上下文工程减肥——对企业技术决策者来说,核心变化是:
「最强模型是哪个」不再是正确的问题。正确的问题是:哪个方案能以最低总成本稳定交付业务结果?
这个判断有三个支点:
蓝曜炬辉在过去一年的企业 AI 开发项目中反复验证了一个模式:客户初期最关心「你们用哪个模型」,但项目上线三个月后,真正决定续约的是「系统稳定运行天数」「平均延迟」「异常自动恢复率」。模型只是起点,工程化才是终点。
编程与知识工作任务选 Opus 5——它在这些场景下效率最高且价格仅为 Fable 5 的一半。网络安全等高难度对抗场景 Fable 5 仍领先。CursorBench 上两者差距不到 0.5%,但成本差一倍。
需要,但不是关心 7000 亿基建账,而是关心推理成本账。token 单价在降但总消耗在涨——建议做全链路成本测算,别只看 API 单价。
强烈建议。可以从内置的 /doctor 命令开始,它会自动分析并建议精简配置文件。核心原则:把臃肿的中心仓库变成按需加载的文件树。
从「看模型」转向「看工程」:Agent 架构设计能力、CI/CD 中 AI 环节的集成深度、异常场景自动恢复机制、上下文工程经验——这些比「对接了哪个最新模型」更能预测项目成功率。