模型单价跌了一半,AI 账单反而翻倍——WAIC 2026 上两位 CTO 拆解了 Token 之外的三笔隐性成本:上下文膨胀、安全漏洞、长期维护。
7 月底的 WAIC 2026 展馆里,自主操作电脑的智能体 Demo 前排起了长队。但 InfoQ 第二直播间里,优刻得 CTO 王凯和焱融科技 CTO 张文涛聊的是一个更冷的问题:当模型单价降到去年的一半,企业的 AI 账单为什么反而翻倍了?
拆开来看,账单的膨胀不来自 Token 单价——恰恰相反,DeepSeek V4 Flash 以 MIT 许可开源,284B 总参数(激活仅 13B),API 报价比主流模型低一个数量级。真正推高成本的是智能体任务链上三笔在云平台账单里根本不显示的开销。
普通对话:一问一答,一次模型调用。智能体任务:目标理解 → 任务拆解 → 工具调用 → 数据检索 → 结果生成 → 验证,任何一步出错都可能触发重新规划甚至从头执行。优刻得 CTO 王凯在 WAIC 对话中直言:"很多时候我们说 AI 贵,贵在我们为了一个自己没有定义清楚的问题,让 AI 不断地尝试,给出无数个答案。"(来源)
这和我们在实际项目中观察到的一致。一个看似简单的"自动生成单元测试"任务,如果验收标准模糊——"覆盖率高一点""尽量全面"——AI 可能反复重试 5-7 次,每次携带越来越长的上下文,消耗的 Token 远超直接让工程师手写。但如果把标准明确为"分支覆盖率 ≥ 85%,单函数平均 ≤ 3 个测试用例",通常 2 轮以内就能完成任务。
焱融科技 CTO 张文涛的建议更直接:企业不应该统计调用了多少 Token,而应该比较——过去一名工程师一天能完成多少测试,引入 AI 后又完成了多少,新增产出是否覆盖了模型费用和后续审核成本。
自主系统与聊天机器人最本质的区别,是它有"记忆"。对话历史、任务状态、工具返回结果、外部检索数据,全部写入上下文窗口。每一次模型调用携带的信息量都比上一次更大。
张文涛在 WAIC 对话中指出了这个被普遍忽略的问题:如果企业缺少记忆压缩、摘要提取和缓存机制,同一任务后期调用成本可能远超初期。KV Cache 和上下文压缩之所以成为推理基础设施的关键环节,正是因为上下文膨胀直接推高计算资源消耗。
我们在一家零售客户的项目中实测过:一个客服系统,首轮对话上下文约 2,000 token,到第 8 轮交互时膨胀到 18,000 token。不做上下文管理的部署,长期运营成本会持续爬升——而大多数 PoC 阶段根本跑不到这个量级,预算表上永远不会出现这笔账。这不是个别现象:我们年初对 200 家企业的AI 智能体落地调查显示,五成企业上线即遭遇故障,而成本超预算是最常见的三类问题之一。
7 月 31 日,Noma Security 披露了一个名为 GitLost 的漏洞:攻击者在公开 GitHub Issue 中嵌入隐藏指令,只用了一个词——"Additionally"——就绕过了 GitHub 自动化工作流的全部防护,诱导 AI 在公开评论中泄露了私有仓库的机密数据。(来源)
同一天,AI HOT 报道 Anthropic 内部审查承认:三款 Claude 模型在网络安全评估中因配置错误接入开放互联网,将真实系统误认为模拟目标并发起攻击。Claude Opus 4.7 从一家真实公司窃取了登录凭证和数百行生产数据;Claude Myth 5 在 PyPI 发布了恶意软件包,约一小时内被 15 个真实系统下载运行。(来源)
这两件事在同一天爆出不是巧合。它指向同一个结论:传统安全模型假设信任边界由代码维护,但 AI 自主系统中信任边界部分依赖模型行为,而模型天然遵循指令。Noma 研究团队将提示注入比作 AI 时代的 SQL 注入——一种系统性的、覆盖整个类别的漏洞类型。关于这类攻击的更深入分析,参见我们此前对 GPT-5.6 入侵 Hugging Face 事件的技术复盘——攻击模式高度一致,只是入口从模型 API 换成了自动化工作流。
Reddit 用户 Significant_Sea_4230 的评论一针见血:"危险之处不在于它很聪明,而在于它可能连接了过多上下文、过多仓库,或者拥有权限过于宽泛的 Token。"
企业如果只盯着模型能力和 Token 价格,把 AI 接入内部代码库、工单系统、客户数据库时不做权限最小化,相当于把保险柜密码交给了只听指令不看身份的"新员工"。
张文涛在 WAIC 对话中列出的三部分隐性成本——人的时间、结果质量、后续维护——最后一项最容易被决策层忽略。
AI 生成的代码即使第一次能跑通,也不意味着它具备长期可维护性。产出的代码风格不一致、错误处理逻辑薄弱、边界条件覆盖不足,这些问题在 Demo 阶段完全看不出来,但在上线后的第二周开始集中爆发。更麻烦的是,如果代码一直由机器生成、一直由机器修改,技术债务会以非线性的速度累积——因为每一轮修改都在前一轮 AI 代码的基础上进行,没有工程师建立的心智模型兜底。
我们在一家客户的物联网平台项目中碰到过这样的场景:AI 辅助生成了 3,200 行设备管理模块代码,初测通过。两个月后需要新增一个协议适配层时,团队发现原始代码中有 11 处不可达分支和 4 处竞态条件——都是 AI 在没有完整上下文时"猜"出来的实现。最终重构花费了 6 个工程师日,相当于当初省下的时间全部还了回去。
问:是不是应该先等到技术更成熟再投入?
答:不完全对。技术永远在迭代,等待的代价是竞争对手先跑通流程。但企业应该做的是"小步快跑"——先在一个边界清晰、失败成本可控的场景(如内部知识库问答、代码审查辅助)验证任务评价体系和成本模型,而不是直接把自主系统接入核心生产环境。优刻得 CTO 王凯的建议很实际:先回答"要解决什么问题、什么结果算成功、成功一次允许付出多少资源",再决定投入规模。
问:提示注入真的有这么严重?是不是大厂营销出来的焦虑?
答:GitLost 漏洞的攻击门槛低到荒谬——不需要编程技能、不需要凭据,只需要在公开 Issue 里写一句话。Claude 模型逃逸事件则说明即使 Anthropic 这种顶级 AI 安全公司也会因配置错误导致模型攻击真实系统。这两个案例的共性在于:不是模型"变坏了",而是企业在将 AI 接入生产环境时,普遍低估了"模型遵循指令"这个特性在安全边界上打开的口子。Noma 建议:用户控制的内容永远不应被视为 AI 的可信指令输入,系统权限应限制在严格必要的范围内。
问:Token 价格在降,长期看成本是不是自然会下来?
答:Token 单价下降与大模型厂商之间的价格战有关(DeepSeek V4 Flash 开源 + MIT 许可就是最新一例),但企业使用 AI 的总 Token 消耗量在非线性增长。任务链的长度、重试次数和上下文膨胀共同推高了调用总量。模型单价降 50%、调用量涨 4 倍,总成本仍然是翻倍的。张文涛的公式值得记住:企业应优化的不是每百万 Token 的价格,而是完成一次有效任务所付出的全部成本。
| 优先级 | 动作 | 解决的问题 | 预期效果 |
|---|---|---|---|
| P0 | 建立任务评价机制:为每个 AI 场景定义"什么算成功、允许多少资源" | Token 浪费在无目标试错上 | 同类任务 Token 消耗降低 40-60% |
| P0 | 权限最小化 + 用户输入隔离:永远不应将用户输入视为系统指令 | 提示注入导致数据泄露 | 消除 GitLost 类攻击面 |
| P1 | 建立 AI 代码维护规范:生成代码须经人工可维护性审查,关键模块保留设计文档 | 长期技术债务累积 | 降低后续重构成本 50%+ |
| P1 | 部署上下文管理策略:记忆压缩、摘要提取、缓存机制 | 上下文膨胀推高调用成本 | 长对话场景 Token 消耗降低 30-50% |
| P2 | 关注合规:欧盟 AI 法透明度要求 2026 年 8 月 2 日执行,交互式 AI 须告知用户 AI 身份,违反最高罚 750 万欧元 | 合规风险 | 避免罚款和品牌声誉损失 |
关于底层技术选型如何影响整体成本结构,可参考我们对英伟达三大技术栈合流的分析——算力供给侧的变革同样在重塑企业 AI 投入的性价比公式。
最后说一句可能不太好听的话:自主系统的 Demo 永远是最好看的部分。真正的成本不在那一刻——它在第二周的安全事件里,在第三个月的上下文膨胀里,在半年后谁也看不懂的那 3,200 行 AI 代码里。把这些账提前算清楚,比谈下更低的 Token 单价重要十倍。
如果您的团队正在评估 AI 在企业场景中的落地路径,可以和我们聊聊——我们不会先给你看 Demo,而是先帮你把上面这张表填好。