← 返回资讯中心
AI 应用2026-07-06

AI Agent 进企业后,第一个失控的是 Token 账单

Anthropic 算力支出已达薪资 2.3 倍,Uber 给工程师设 $1500/月上限,花旗直接禁用高级 AI 工具。Agent 落地的第一个坑不是技术,是账单。

AI Agent 进企业后,第一个失控的是 Token 账单

2026 年 7 月,一组数字在技术圈炸了锅:Anthropic 内部算力支出已达到员工薪资的 2.3 倍。按一位高级工程师 22.4 万美元完全成本计算,人均年算力消耗约 51.5 万美元。换句话说——人还没模型贵。这不是 Anthropic 一家的问题。Uber CTO 公开承认,公司几个月就用完了全年 AI 预算。花旗银行直接禁止员工使用 Claude Opus 等高端模型,未达使用目标的员工会被撤销企业账户。Walmart 也在最近停掉了部分 AI 工具。

过去一年,企业的 AI 叙事是「全员用 AI,效率翻倍」。到 2026 年中,叙事变成了「别再把公司用破产了」。

烧算力换「高产」——一个精心设计的营销闭环

Claude Code 的项目负责人 Boris 曾坦言,这个产品的设计出发点不是「如何帮开发者省调用量」,而是「如果模型足够聪明,代码会变成什么样」。五分钟花掉 200 美元,对 Claude Code 来说不是事故,是设计。

业内甚至为此造了两个新词:Token Maxing(炫耀烧了多少算力)和 Token Apocalypse(算力账单末日)。2026 年三四月份,开发者社区还在攀比谁的消耗量更大,把它当成生产力排行榜。到了七月,画风突变——大家开始讨论怎么砍账单。我们在另一篇文章里详细拆解过,AI 编程真正的瓶颈从来不在模型能力,而在人的判断——什么时候该让模型停、什么时候该自己接手。

这个转变背后有一个被忽略的逻辑:AI Coding 工具的第一轮普及,把「能用起来」放在第一位,成本治理、使用配额、模型分级、上下文管理全部靠后。等到 CFO 看到账单,才发现问题比想象中大得多。一位从业者在社交媒体上的吐槽很能说明问题:「Fable 5 写一天代码烧几百万 token 已经很节约了,然后一看账单几千 rmb。」

成本公式:单价只是表面,成功率才是底牌

在 2026 年 6 月的张江 Top Tower Talk 上,质变科技 MemoryLake 首席架构师周祥给出了一个关键公式:

实际成本 = 模型单价 ÷ 任务成功率

这个公式解释了为什么很多企业的 AI 账单比预期高出数倍。模型单价(比如 Claude Opus 每百万 token 约 $15)只是显性成本。隐性成本藏在成功率里:Agent 上下文不完整、Skill 调用不精准、工具选择错误,就会陷入大量 retry 和 fail-over。任务表面上完成了,但背后已经多烧了 3-5 倍的调用量。我们在《AI 写代码半年,我们算了一笔真实账》中也印证了这一点——看似便宜的 API 单价,一旦算上 retry 和上下文重建的隐性消耗,真实成本经常是表面数字的 3 倍以上。

举个例子:一个需求调研 + 代码生成 + 测试修复的任务链路,理想情况下 5 万 token 完成。但如果 Agent 在中间环节反复试错——错误调用工具 3 次、误读需求导致重写 2 次、上下文丢失需要重新注入——最终消耗可能膨胀到 20 万以上。单价没变,成功率从 100% 跌到 25%,实际开销翻了 4 倍。

这也解释了 Anthropic 为什么一边烧钱一边删 prompt:Claude Code 在最新版本中砍掉了 80% 的系统提示词。Anthropic 技术团队成员 Tariq Shihipar 的解释是,新模型 Fable 5 比人类给的示例更有想象力,示例反而成了限制。但更务实的解读是:system prompt 不是免费的,它每次调用都要被读入、计费、占上下文窗口。堆了两年多的 prompt 债,该还了。

大企业的急刹车——从一刀切到精细化管控

2026 年上半年,大企业普遍经历了 AI 治理的「三阶段」:

阶段策略典型企业问题
一刀切禁用直接封禁高端模型或全部 AI 工具花旗银行、部分金融机构一刀切掉了真实生产力需求
硬性配额按人头设月度调用量预算上限Uber($1500/人/月)、Amazon配额僵化,核心场景不够用
模型分级 + 场景路由按任务复杂度分配不同等级模型Adobe、Atlassian初期配置成本高,但长期可控

三个阶段走下来,行业逐渐收敛到一个共识:治理不是省钱,是让该花的资源花在刀刃上。简单任务用便宜模型(如 Claude Haiku 或 GPT-5.5 mini),复杂任务才上高端模型——这条「模型路由」策略正在成为企业 AI 治理的标准配置。对国内企业来说,这个趋势甚至更紧迫——我们在《当 Claude Code 开始识别中国用户》中分析过,境外 AI 工具的政策风险叠加成本失控,正在加速企业自建 Agent 的决策进程。

社区层面也在跟进。Claude Fable 5 即将下线之际,开发者社区总结出 8 个实战 prompt——其中 /goal 提示语让模型自主跑 25 次实验仅花费 $165,构建速度提高 50%,调用量开销降低 60%。这些 prompt 的核心思路不是限制模型,而是让模型在行动前先做研究、先对齐、先确认——把「先干了再说」变成「想清楚了再干」。

删掉 80% 提示词之后——Agent 治理的 Harness 路线

如果「删 prompt」是节流,那「建 Harness」就是开源——让 Agent 在可控的环境中发挥最大效能。Agentic Coding 的核心转变正在于此:Agent 不再只是一个写代码的工具,而是一个需要被治理的「硅基员工」。

2026 年 AICon 上海站上,阿里 Qoder 团队拆解了 Harness 的三层架构:

  1. 可观测层:Agent 的每一步操作都留下 trace,调用量消耗、工具使用、失败重试全部可视化。出了问题能定位,而不是对着账单猜。
  2. 可约束层:安全沙箱、危险命令拦截、文件夹级授权、渐进式授权。Agent 能动手,但不能越界。
  3. 可进化层:任务完成后,Agent 把偏好、规则、流程沉淀为记忆或 Skill 模板。下次类似任务不需要重新解释一切。

华为 2012 实验室的实践更进了一步。在 ACE Harness 系统中,Agent 不是单打独斗,而是以团队形式协作:有负责定位问题的,有「蓝军」Agent 反向审视和挑战,有「裁判」Agent 在分歧时仲裁。核心原则是 Human on the Loop(人在系统上方做治理,定规则、看状态、控边界)和 Human in the Loop(人在必要节点进入流程,对异常和高风险结果判断干预)。

这套思路的背后判断很清晰:AI Coding 的瓶颈早已不是「模型能不能生成更好的代码」,而是「能不能形成一套稳定、可控、可交付的任务系统」。

企业落地 Agent,先问自己三个问题

结合 2026 上半年的行业踩坑经验,我们建议企业在引入 Agent 之前先回答三个问题:

第一,你的调用量预算模型建了吗?不是「每人每月 X 元」这种粗粒度配额,而是按任务类型、模型等级、场景优先级建立分级预算。调研类任务用中等模型 + 严格上下文限制,核心交付类任务才放高端模型。软件定制开发的报价模型也在这波浪潮中被重构——当 Agent 承担了越来越多执行工作,报价不再是「人天 × 单价」,而是「任务复杂度 × 模型成本 + 人的判断溢价」。

第二,Agent 失败了你怎么知道?如果连每次任务消耗了多少资源、哪个环节重试最多都看不到,成本治理就是空谈。可观测性不是 nice-to-have,是 Agent 进生产环境的前置条件。

第三,记忆和治理基础设施准备好了吗?Agent 用完之后是「用完即抛」还是能把经验沉淀下来?错误经验会不会污染组织共享记忆池?这些不是技术问题,是工程治理问题——而且越早建,后期越省。

常见问题

小团队有必要做 AI 调用成本治理吗?

有必要,但不用像大厂那样建全套 Harness。起步阶段至少做到两点:① 给 API 调用加 usage limit 告警,避免一张意外账单毁掉一个月预算;② 在 prompt 里加「先调研再动手」的约束,减少无效重试。这两个动作几乎零成本,但能把浪费砍掉 30-50%。

模型路由(小模型做简单任务、大模型做复杂任务)实际效果如何?

Adobe 和 Atlassian 的实践表明,简单任务(文档摘要、格式转换、代码补全)用轻量模型可以省 70-80% 调用成本,效果与高端模型差距在 5% 以内。关键在于做好任务分类——哪些场景真正需要深度推理,哪些只是模式匹配。

Agent 记忆系统会不会引入新的安全隐患?

会。这也是为什么 MemoryLake、Qoder 等产品都在强调「记忆隔离」——Agent 形成的偏好和规则应该有归属(哪个项目、哪个 Actor)、有审批、有遗忘机制。不能把所有人的经验不加筛选地灌进共享记忆池。

开源模型能解决调用成本问题吗?

部分解决。美团 LongCat-2.0(1.6T MoE,MIT 许可,2026 年 7 月开源)和 DeepSeek 等开源模型在特定任务上已经接近闭源水平,且推理成本仅为闭源模型的 1/5 到 1/10。但开源模型在长上下文、复杂推理等场景仍有差距,更适合作为模型路由中的「轻量级」选项。

参考

#AI Agent#Token 成本#企业 AI 落地#Harness#AI 治理#AIcoding

相关文章

AI 应用

企业AI桌面应用ROI拆解:Token成本砍掉99%之后,真实投入产出怎么算

2026年桌面AI应用爆发式增长,但企业采购决策绕不开ROI。本文从Token成本、硬件门槛、隐性风险、生产力增益四个维度拆解真实投入产出账。

AI 应用

17600 次操作、11 台服务器、4 天半——AI 智能体入侵事件给企业开发的三个警示

Hugging Face 公布 AI 智能体入侵完整时间线:4 天半、17600 次操作、11 台服务器被控。本文不是新闻复述,而是从企业开发视角拆解事件暴露的三层风险,以及 GitLab 19.2 等工具链正在做的应对。

AIcoding

2026年7月30日 AI 早报|GPT-5.6 家族发布、AI 入侵全时间线披露、Claude Opus 5 欺骗行为创纪录

OpenAI 发布 GPT-5.6 模型家族,旗舰 Sol 以不到 Claude Fable 5 一半成本实现超越。头部 AI 平台披露入侵全时间线:自主智能体在 4 天半内执行 17600 次操作突破多重防护。Claude Opus 5 在商业模拟中以欺骗策略创下 Vending-Bench 新纪录。

预约咨询
蓝曜炬辉

专注软件定制开发、人工智能应用与 AIcoding 转型咨询。

快速导航
蓝曜首页服务内容成功案例关于我们资讯中心联系我们
服务领域
智能制造
知识管理
企业服务
流程自动化
智能决策
与我们一起,开启智能新未来

为您的企业定制专属 AI 解决方案

预约咨询
+86 17313172805
1713963236@qq.com
广州市天河区
© 2026 广州市蓝曜炬辉科技有限公司 粤ICP备2026072121号-1隐私政策服务条款