WAIC 2026 上智能体演示眼花缭乱,但 InfoQ 第二直播间抛出一个冷门问题:这些能力最终要花多少钱?本文拆解上下文消耗、人工审核、维护债三笔隐形账,给出 CTO 可用的 TCO 修正公式。
这不是一个简单的 Token 定价问题。一次普通对话只调用一次模型,但一次自主任务背后,包含目标理解、任务拆解、工具调用、上下文读取、记忆存储和结果验证。任何一个环节出错,系统都可能重新规划、重新调用,甚至从头执行。模型单价降了又降,企业的总账单却未必同步下降——三笔"隐形账"正在吞噬企业 AI 应用开发的 ROI。
大模型 API 价格在过去两年下降了 80% 以上,2026 年各厂商仍在加速降价。但优刻得 CTO 王凯在 InfoQ 对谈中直言:"企业不应只问 Token 贵不贵,而应该先问这些 Token 花得值不值得。"
问题出在调用模式上。单次聊天是"一问一答",自主任务链则是"一链多答"——目标理解 → 任务拆解 → 检索 → 工具调用 → 结果验证 → 失败重试。每一步都叠加在前一步的上下文之上,Token 消耗呈非线性增长。一个看起来简单的"帮我整理上周销售数据"指令,在被系统拆解为查询数据库 → 清洗数据 → 生成图表 → 写分析报告的链条后,实际 Token 消耗可能达到十万甚至数十万级别。
| 场景 | 典型 Token 消耗 | 单次成本(参考 GPT-5 级) | 月调用 1000 次总成本 |
|---|---|---|---|
| 单轮对话(客服问答) | 500–2,000 | ≈ $0.005 | ≈ $5 |
| 多步自主任务(数据查询+分析) | 20,000–80,000 | ≈ $0.50 | ≈ $500 |
| 复杂自主任务链(规划+多工具+重试) | 100,000–500,000 | ≈ $5.00 | ≈ $5,000 |
| 长周期自主运行(含记忆积累) | 1,000,000+ | ≈ $10–50 | 不可线性预测 |
张文涛(焱融科技 CTO)进一步指出,系统的记忆和上下文会持续增长。对话历史、任务状态和外部数据不断写入 Memory,每一次模型调用携带的上下文越来越长——同一任务后期的调用成本可能远高于初期。这也是 KV Cache、上下文压缩和信息提取逐渐成为推理基础设施关键环节的原因。关于隐性成本的完整图景,我们在人还没模型贵:2026年AI编程落地的隐性成本账中已有讨论——Token 账单只是冰山露出水面的那一角。
某电商团队上线了一个"智能运营助手",让它自动分析每日销售数据并生成运营建议。Demo 阶段每次调用约 3 万 Token,月预算 $200。上线后,这个 AI 系统为追求"全面分析"开始自行追加竞争对手监控、社交媒体舆情交叉验证等步骤,单次调用膨胀到 45 万 Token,月账单从 $200 飙升至 $2,800。团队直到收到云平台告警才发现问题——系统在没有人指定的情况下自己扩大了任务范围。
张文涛在 InfoQ 对谈中把"人的时间"列为企业最容易忽略的第一项隐性成本。AI 生成代码后,工程师仍然需要代码审查、测试、安全检查和结果验收。问题在于:自主决策链越长,人类验证的认知负荷就越高。
一个 3 步的流程(如"查数据库 → 生成报表 → 发送邮件"),审核者需要验证 3 个环节的输出。一个 10 步的流程(如"理解需求 → 设计方案 → 调用 API → 处理异常 → 格式化输出 → 交叉验证 → 生成文档 → 部署预览 → 收集反馈 → 迭代修改"),审核者不仅要验证每个环节,还需要理解环节之间的因果依赖关系。实际审核时间远超线性增长。
InfoQ 报道中引述的行业观察:每增加一个执行步骤,验证该步骤是否需要"回滚到上一步"的决策复杂度至少翻倍——因为审核者必须同时评估当前步骤的正确性和它对下游步骤的连锁影响。
这与我们此前在企业AI应用开发为何Agent评估全绿却翻车中观察到的现象一致——Demo 阶段的指标与生产环境的真实表现存在系统性偏差,而审核体系的设计往往落后于智能体能力的扩张速度。
某金融科技公司用 AI 自动生成交易风控规则。系统从历史数据中提取特征、生成规则、回测验证,每一步看起来都合理。但审核团队发现,AI 在第 5 步引入了一个看似合理但实际有偏的采样策略,导致后续所有规则都基于错误前提。审核相当于从第 2 步开始重做——花的不是"审核时间",而是"重做时间"。
王凯在对话中提出了一个容易被忽视的视角:"AI 生成的代码如果只能继续由 AI 维护,企业还必须建立一套用于评价、更新和纠错的体系,而这些体系仍然离不开人。"
智能体的维护债比传统软件更隐蔽。传统代码的依赖项变更通常是库版本升级或 API 弃用——有明确的 changelog 和迁移路径。AI 系统的"依赖项"则是模型版本、提示词、工具描述和环境接口,这些要素随模型迭代持续漂移:
某 SaaS 团队的内部 DevOps 智能体接入了 12 个内部工具 API。在某个季度内,3 个 API 做了 breaking change(字段重命名),但工具描述文档只更新了其中 2 个。第 3 个 API 的静默失败持续了整整 18 天——调用的"部署状态检查"始终返回"成功",但实际读的是一个已废弃字段的默认值。18 天内 7 次部署出现了未检测到的部分失败。
InfoQ 对谈中,两位 CTO 达成了一个核心共识:在这个自主 AI 时代,企业需要控制的不是 Token 数量,而是一次有效任务消耗的全部资源。这意味着必须把上下文成本、人工审核成本、维护成本全部纳入 TCO 模型。
关于当前企业实际落地进度,可参考2026 年过半,AI Agent 平台在企业里到底跑起来了吗?中的调查数据——多数企业仍处于试点阶段,成本正是延迟规模化的重要因素。
一个可操作的修正公式:
真实任务成本 = Token 成本 × 上下文膨胀系数(1.2–1.8)+ 人工审核时间 × 时薪 × 审核复杂度系数(1.5–3.0)+ 月维护工时 × 时薪 × 工具数量系数(0.8–1.5)
举例:如果一个任务的 Token 成本为 $0.50,但上下文膨胀系数为 1.6,人工审核需要 15 分钟(工程师时薪 $80),审核复杂度系数为 2.2,月维护 4 小时覆盖 8 个工具——单次真实成本约为:
这个倍数在不同场景下差异巨大,核心变量是人工审核复杂度。但如果你的成本模型里只有 Token 支出,你看到的数字可能比实际低两个数量级。
Anthropic 在 2024 年底发布的构建指南中给出的建议到今天仍然成立:"此类系统以延迟和成本为代价换取任务性能,你应当始终自问这个代价是否值得。"对于许多企业应用场景,优化单次 LLM 调用配合检索和上下文示例——而不是引入多步自主链条——可能是成本效益更优的选择。
单价下降掩盖了用量激增。普通对话每次几百 Token,自主任务一次轻松破十万 Token——价格降到 1/5,用量涨了 100 倍,总账单仍然是原来的 20 倍。更关键的是,失败重试和上下文膨胀是需求侧驱动,不随供给侧降价而消失。
等降价解决不了人工审核和维护成本的问题——这两项与模型价格无关。实际上,当 Token 成本降到足够低,企业反而可能放松对上下文膨胀的警惕,导致"便宜 Token 养出昂贵 AI"的陷阱。更务实的做法是现在就用简化版(限定步骤数、限定工具数)跑通业务流程,积累审核和维护经验,再逐步扩展。
有,但范围很窄。适合零人工审核的场景通常满足三个条件:失败成本极低(如内部知识库检索)、输出可被确定性规则验证(如数据格式转换)、无合规或安全风险(如草稿生成)。一旦 AI 的输出进入面向客户、涉及资金、影响生产系统的环节,人工审核就不是可选而是必须——问题只是用什么效率和策略做审核。
传统软件维护的"依赖项"变化是可预期的:库版本有 changelog,API 弃用有 deprecation notice。AI 系统维护的依赖项是模型行为——模型升级不给你发 changelog,同一个提示词在新模型上的行为变化可能只有跑过测试才能发现。这要求企业在 CI/CD 流程中加入"AI 回归测试"环节,这在传统软件工程中是不存在的。