Opus 5 半价发布,AIcoding 行业正式进入「算总账」阶段
Opus 5 性能翻倍价格减半,WAIC 2026 给出同一个关键词「算账」——AIcoding 赛道规则已被重写,企业选型逻辑需要彻底更新。
Opus 5:一份关于「性价比」的行业宣言
先看硬数据。Opus 5 在 Frontier-Bench v0.1 上的性能是前代 4.8 的 两倍以上,在 ARC-AGI 3(要求模型解决全新问题的评测)上得分是次优模型的 三倍。CursorBench 3.2 上,它以 一半成本 达到了接近 Fable 5 的水平;Zapier AutomationBench 则直接拿到 100% 通过率,是次优模型的约 1.5 倍[1]。
早期用户反馈同样印证了代际跃升:Lovable 团队报告最难编码任务上提升 22%,且运行一致性显著改善;Box 在尽职调查工作流中测得 17% 的性能提升;一家交易公司用单次会话完成了此前任何模型都无法独立完成的市场数据源构建[1]。
但数字背后的战略信号比数字本身更重要:Anthropic 在主动把旗舰级智能压进一个半价套餐。这不是「技术又进步了」的常规叙事——这是在告诉市场:模型能力的军备竞赛已到拐点,下一阶段拼的是性价比。
三本账:WAIC 2026 揭开的产业底牌
同一天,WAIC 2026 的 InfoQ 直播间里,L2F 光源资本吉星用三笔账把行业现实摊开了[2]:
- 基建账:中美大厂基础设施投入已到 7000 亿美元量级,同期收入仅约 500 亿——缺口大到资本市场无法忽视。
- 推理账:单 token 单价降到去年的 1/8 到 1/10,但完成任务消耗的 token 总量不降反升,总成本实际在涨。「不少人反馈模型已经用不起了,可能得借钱打工。」
- 资本账:智谱、MiniMax 及一批具身智能公司公开财报后,市场焦点从「买一个大故事」转向「看实打实的经济账」。
昆仑万维 CEO 方汉的判断更根本:文本大模型的 Scaling 可能已经到头了。但另一方面,Harness + Agent 组合却在 2025 Q4 意外改变了格局——Coding 场景的 token 消耗急速膨胀并占据绝对优势。Agent 通过调度 Harness,让概率输出的大模型开始有效解决确定性需求,完成了从「可能对」到「必须准」的关键跨越[2]。
总结成一句话:上半场拼模型能力,下半场拼工程化落地和成本控制。这和 Anthropic 主动降价的策略完全吻合。
被砍掉的 80%:上下文工程也在经历「减肥」
与 Opus 5 同步发布的还有 Anthropic 官方博客的一篇技术文章。其中最惊人的一句话:他们从 Coding 产品的系统提示词中移除了 超过 80% 的内容,编码评测无任何可衡量的性能损失[3]。
新旧方法论的对比如下:
| 维度 | 过去(模型较弱时) | 现在(5 代模型) |
|---|---|---|
| 行为约束 | 写死规则:「默认不写注释」「不要创建文档」 | 给判断空间:「匹配周围代码风格」 |
| 工具使用 | 大量示例,生怕模型学不会 | 设计清晰的接口——枚举值本身就是提示 |
| 信息组织 | 所有内容塞在最前面 | 渐进式披露:按需按场景加载上下文 |
| 指令密度 | 系统提示词和工具描述重复相同指令 | 只在工具描述里写指令,系统层极简 |
| 记忆机制 | 手动写入配置文件 | 自动记忆,模型自主保存并调用 |
这对自建 Agent 的团队有直接启示:如果你还在维护一摞厚厚的配置文件和 Skill 定义,「把所有已知实践都塞进去以防模型遗漏」,那你大概率在过度约束它——和 Anthropic 一年前的做法如出一辙。建一个可在适当时机加载的文件树,比建一个臃肿的中心仓库更有效。我们在自研 vs 外包的决策框架中也讨论过类似的工程化取舍——工具链的复杂度本身就会吃掉模型能力提升带来的收益。而 Anthropic 内部数据的分析进一步印证了这一点:当 80% 的代码由 AI 编写时,上下文工程的精简程度直接决定了 Agent 的交付质量和一致性。
企业选型:该换问题,而不是换模型
把这三件事放在一起看——Opus 5 降价、WAIC 三本账、上下文工程减肥——对企业技术决策者来说,核心变化是:
「最强模型是哪个」不再是正确的问题。正确的问题是:哪个方案能以最低总成本稳定交付业务结果?
这个判断有三个支点:
- 性价比取代跑分成为第一指标。Opus 5 以一半成本接近 Fable 5,意味着 Anthropic 自己在打价格战。企业选型的逻辑应从「评测最高分」切换到「单位成本下的任务完成率最高」。
- Agent 架构比模型选型更决定成败。方汉的判断一针见血——Agent + Harness 是让模型从概率输出走向确定性交付的唯一路径。团队如果只盯着模型 API 而忽视 Agent 设计,相当于买了最好的发动机却不造车身。我们在AIcoding 落地实录中算过一笔真实账:投入在 Agent 架构设计上的时间,回报率是单纯调 prompt 的 3 倍以上。
- 上下文工程需要「瘦身」而非「增肌」。80% 系统提示词被移除且无损性能,意味着过度约束是当前大多数团队的真实瓶颈。
蓝曜炬辉在过去一年的企业 AI 开发项目中反复验证了一个模式:客户初期最关心「你们用哪个模型」,但项目上线三个月后,真正决定续约的是「系统稳定运行天数」「平均延迟」「异常自动恢复率」。模型只是起点,工程化才是终点。
常见问题
Opus 5 和 Fable 5 怎么选?
编程与知识工作任务选 Opus 5——它在这些场景下效率最高且价格仅为 Fable 5 的一半。网络安全等高难度对抗场景 Fable 5 仍领先。CursorBench 上两者差距不到 0.5%,但成本差一倍。
中小企业需要关心「算总账」吗?
需要,但不是关心 7000 亿基建账,而是关心推理成本账。token 单价在降但总消耗在涨——建议做全链路成本测算,别只看 API 单价。
内部在用 AI 编程助手,需要跟进上下文工程精简吗?
强烈建议。可以从内置的 /doctor 命令开始,它会自动分析并建议精简配置文件。核心原则:把臃肿的中心仓库变成按需加载的文件树。
AIcoding 服务商的选型标准应该怎么更新?
从「看模型」转向「看工程」:Agent 架构设计能力、CI/CD 中 AI 环节的集成深度、异常场景自动恢复机制、上下文工程经验——这些比「对接了哪个最新模型」更能预测项目成功率。
