Anthropic 官方 2026 年 9 月给出的降本方法:最大化 prompt cache 命中率、升级模型前清理提示词反模式、按任务校准 effort。实测成本降 14.6%、准确率反升 5.3%。
同一套客服提示词从 Opus 4.8 迁到 Opus 5,Anthropic 实测在只换模型 ID、其余一字不动的情况下,成本与准确率都会恶化;而先跑一次 prompt-audit 再上线,平均成本降 14.6%、准确率反升 5.3%。这是 2026 年 9 月官方发布的方法,也是我们给客户做 Claude 类应用交付时最常被忽略的一块:账单大头不在模型单价,在请求组织方式。
模型在输出前要把整段提示词处理成内部状态,这一步叫预填充(prefill),是输入侧最贵的部分。prompt cache 把这份状态存下来:后续请求只要前缀逐字节一致,就直接读缓存,读取价格只有完整输入的一小部分。
代价是三个约束:缓存与具体模型绑定;命中要求整段前缀逐字节一致;缓存有 TTL(默认 5 分钟,从请求开始计时)。所以成本优化的第一原则不是压模型,而是让"稳定的大块内容"尽可能多地命中缓存。
Anthropic 原文点名的几类常见破坏行为,我们按交付经验排了序:
修复侧还有一个容易被忽略的动作:预热。会话开始先发一个 max_tokens: 0 且带显式缓存断点的请求,把提示词写进缓存但不生成任何内容;用户真正提问时第一个请求就能命中。长任务里如果工具调用阻塞超过 5 分钟,父级缓存会在返回前过期,此时应把前缀 TTL 提到 1 小时。
很多提示词是为旧模型的弱点打的补丁。换到更强的模型后,这些补丁不但没用,还会按字面意思被执行,白白烧 token。官方归纳了六类反模式:
| 反模式 | 典型写法 | 在 Opus 5 上的后果 |
|---|---|---|
| 验证仪式 | "仔细检查你的工作""回复前验证两次" | 每次退款重复查一遍订单,多余调用 |
| 详尽性强调词 | "做到最大限度的详尽""你必须始终…" | 触发数十次多余知识库搜索 |
| 强制流程脚手架 | "在草稿本里一步步思考" | 叠加在原生推理之上,纯耗 token |
| 过时示例 | 为旧模型失败模式调的 few-shot | 教新模型模仿冗长推理 |
| 相互矛盾规则 | "始终在政策内退款"+"未经上报绝不退款" | 扣留四笔应退款项,性能直接崩 |
| 过时配置 | 旧代际的手动思考预算 | 部分请求被 API 直接拒绝 |
官方给出的动作是 /claude-api prompt-audit:在 Claude Code 里对提示词、技能、工具描述和调用代码跑一次审计。实测数据来自一个客服支持基准:从干净提示词出发逐条植入六种反模式,再在 Opus 5 上跑审计清理,成本平均降 14.6%、准确率升 5.3%。成本下降来自多余函数调用与重复推理被消除,准确率上升则是因为矛盾规则、失效配置这类问题本身就在制造错误。这与我们之前拆解的 Opus 5 上线后 AIcoding 团队的三重降本账本可以相互印证:模型本身在降价,但提示词层不清理,省下的钱会被反模式吃回去。
effort 决定模型"用多大力气干活"。官方给出的数字很直观:Claude Fable 5 在 FrontierCode Diamond 最难 50 题上,低 effort 得分 11.5%、每题成本 5.35 美元;最高 effort 得分 30.9%、每题成本 19 美元。分数提升约 2.7 倍,成本却是 3.5 倍——这笔账在某些任务上划算,在另一些任务上不划算。
反例同样来自官方:Claude Fable 5.1 在 Humanity's Last Exam 上,从低强度到最高强度逐档提升,最后一步只增加约 0.5 个百分点,成本却多了 46%,而且这 0.5 分落在多次运行的噪声范围内。也就是说,很多人默认的"最高档最稳"其实是在为噪声付费。
两个方向的偏差都要防:档位过高会过度思考,档位过低会在证据不足时提前收手——比如基于第一条搜索结果作答,而不是第三条。校准的办法只有一个:在你自己的任务上,把各档 effort 的成本与准确率都跑出来,画一条真实的边际曲线,再决定停在哪个档。
官方在 CursorBench 3.2 上的测试显示,Fable 5.1 用低 effort 的表现约等于 Fable 5 用高 effort,成本只有后者的三分之一。两个因素叠加:低 effort 下每个任务完成的工作更少;Fable 5.1 的缓存读取定价为每百万 token 0.25 美元,而 Fable 5 是 1.00 美元。即使按旧模型价格折算,新模型低强度仍便宜约 40%。
对应用团队的启示是:每次有新一代模型发布,不要默认"升级=涨价"。先在低强度档做一次同任务对比,把"新模型低 effort"和"旧模型高 effort"作为两个独立方案分别报价,再决定迁移。这正是 推理加速与模型路由那套工程实战的延续:先在同一模型内调参,再谈跨模型路由。
prompt-audit,重点清验证仪式、矛盾规则和过时配置三类,再上灰度。这套方法不依赖具体供应商,静态前缀稳定、易变内容后置、按任务测强度曲线,是所有大模型应用通用的请求组织原则。蓝曜炬辉在给客户交付 AI 应用时会把这几步直接写进验收清单,避免上线三个月后才发现账单比预期高一倍。工具用得是否到位,直接决定同样一笔预算能买回多少产能——这个差距在 Uber 与 Meta 的 AI 编程产能数据里被量化得很清楚。
取决于应用形态。多轮客服、长文档 Agent 这类前缀稳定且复用的场景,命中率应当长期高于 90%;一次性短请求占多的话命中率天然低,优先保证静态段(工具、系统提示词)不被动态内容污染。
默认 5 分钟从请求开始计时。如果智能体在工具调用或子智能体上阻塞超过 5 分钟,父缓存会过期,此时应把前缀 TTL 提到 1 小时。官方建议在缓存本就会被破坏的操作(如压缩)之后再切换模型或推理强度,避免为一次缓存未命中付两次钱。
不是。官方数据里最高档的最后一跳常常只换 0.5 个百分点的得分却多付 46% 成本,且落在噪声区间。先画自己任务的边际曲线,再定档。
不用。Anthropic 已把 /claude-api prompt-audit 整合进 claude-api 技能,可直接对工作目录里的提示词、技能、工具描述与调用代码运行。我们建议把审计作为模型升级流程的固定一步。