Anthropic 7 月 24 日同步放出 Opus 5 和上下文工程新规。三重降本叠加后,一个 10 人 AIcoding 团队月账单可压缩近半。
答案比预想的乐观。把模型降价、提示词精简、缓存预热三笔账拆开算——对一个 10 人团队,月账单压缩空间接近一半。下面逐层拆。
最直观的变化:性能接近 Fable 5 前沿水平,价格只有后者的一半。和前代 Opus 4.8 相比,同价位下 Frontier-Bench v0.1 得分是 4.8 的两倍以上,ARC-AGI 3 得分是次优模型的三倍。
但基准分不是重点。对日常写代码的团队,关键指标是 CursorBench 3.2——衡量模型在真实 IDE 环境中完成任务的能力。新模型在最大努力设置下,得分与 Fable 5 相差不到 0.5%,每项任务成本却只有一半。翻译成工程语言:以前跑复杂重构不得不切 Fable 5、付全价;现在用 Opus 就够了,账单直接对折。
还有一个容易被低估的改进:自查自纠能力大幅跃升。官方披露,新模型面对一个开源包管理器的真实漏洞时,不仅找到了根因(而非表面症状),还修复了社区补丁遗漏的边缘情况;竞品只修了表面就报"已解决"。这意味着更少的返工轮次——每次返工都是真金白银。
同一天,Anthropic 在官方博客披露了一个影响面极大的变化:Claude Code 的系统提示词被移除了超过 80%,编码评测无显著损失。关键不在删了多少字,而在模型判断力发生了质变。(我们在 7 月初就提示词瘦身做过详细拆解:《AIcoding 商业化降本:Claude Code 提示词瘦身 80% 的实战拆解》,当时还在等官方确认——现在官方博客把五条新规则全公开了。)
旧时代的系统提示词塞满了防御性规则。官方自己拿出来当反面教材的一段旧指令:
「默认不写注释。永远不要写多段落的文档字符串或多行注释块——最多一行短注释。除非用户要求,否则不要创建规划、决策或分析文档。」
这类约束在 3 代和 4 代是必要的——当时判断力不够,不加限制容易出乱子。但到了 5 代,它们变成了负资产:模型被迫在每轮交互中解析大量相互矛盾的指令,消耗 token 不说,还拖慢决策。
我们团队自己踩过这个坑。之前给 Claude Code 配了 2000+ 字的 CLAUDE.md,把各种边缘情况都塞进去了——「遇到未知名依赖先查 npm」「PR 描述不超 300 字」……上线后试着删到 400 字,只保留项目特有的 monorepo 结构说明。结果:模型反而更少踩坑。那些防御性规则本身就是干扰——让模型在「遵守规则」和「完成意图」之间不断摇摆。
账单层面有两笔节省:
这是最隐蔽的一笔开销。Claude Code 的提示缓存有 5 分钟 TTL——两轮请求间隔不超过 5 分钟,对话历史就能以 0.1 倍费率从缓存读取。(关于子智能体如何在这个机制下工作,可以看《Agentic Coding:当 AI 从「写代码」变成「做项目」》里的详细拆解。)
坑在子智能体。当主智能体派生子智能体执行耗时任务(跑测试套件、大规模代码搜索),子智能体使用不同的系统提示词和工具集,永远不会刷新主智能体的缓存。子智能体跑 6 分钟,主智能体的缓存过期;子智能体返回结果时,主智能体被迫以 1.25 倍写入费率重新编码整个对话历史——此时历史已膨胀到 20 万–50 万 token。
开源工具 claude-thermos 的实测数据很扎心:约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。你每付 100 美元的 API 账单,有 22 美元花在了"重新编码片刻之前还缓存在内存里的内容"上。
解决方案轻量到一行命令:uvx claude-thermos 替代 claude,零配置。原理是本地反向代理监控主智能体空闲状态,在缓存过期前自动发一次预热请求(max_tokens=1),保持缓存热度。每次预热成本是 0.1 倍费率的读取,而避免的重写成本是 1.25 倍——投入产出比超过 10:1。
基于上面的拆解,做一个保守估算。假设 10 人 AIcoding 团队,日均 API 消耗如下:
| 项目 | 优化前(月) | 优化后(月) | 降幅 |
|---|---|---|---|
| 高难度任务模型费(Fable 5 → Opus 5) | $1,800 | $900 | −50% |
| 系统提示词 token 消耗(精简 80%) | $420 | $120 | −71% |
| 缓存过期重编码损失(thermos 追回) | $660 | $66 | −90% |
| 合计 | $2,880 | $1,086 | −62% |
实际情况不会这么整齐——不是所有任务都适合切新模型、不是所有会话都有缓存过期问题。但即便打七折,月账单从 $2,880 降到 $1,500 左右仍然非常现实,降幅约 48%。
还有一层不在账单里的收益:更强的自检能力意味着更少的代码审查返工,提示词精简意味着工程师维护配置文件的认知负担更低。这些软收益在长周期项目里比直接成本节省更大。对从提示词驱动转向智能体循环设计的团队,《Claude Code 智能体循环:从写提示词到设计循环的工程范式转移》里有更系统的讨论。
不适合。官方披露它在网络安全任务上仍落后于 Mythos 5。如果团队大量依赖模型做安全审计、漏洞挖掘,Fable 5 或 Mythos 5 仍是更优选择。但对于日常编码、重构、代码审查、测试生成等占 AIcoding 工作量 80% 以上的任务,新模型是目前性价比最优解。
没有统一标准。官方建议用 Claude Code 内置的 /doctor 命令自动诊断冗余。我们实践下来,保留项目特有约束(monorepo 结构、部署流程、命名规范)而删除"教模型怎么写代码"类的通用规则,是一个好起点。
预热请求本身消耗极少(每次 1 token),成本几乎可忽略。唯一需确认的是网络环境——如果团队通过代理访问 API,需要验证本地反向代理与现有网络配置兼容。
不必,但叠加效果远大于单独实施。如果只做一项:优先切新模型——零配置、即时生效的最大头节省。第二优先是缓存预热工具,一行命令换 22% 回报。提示词精简排在最后,需要投入工程师时间调优,但做完后是长期收益。