Rippling 官方披露:AI token 支出月增 80%,曾预测吃掉 40% R&D 人力预算。复盘其 AI 网关模型路由、员工级成本归因、供应商上限与 AI Captains 四件套,附 CTO 自检清单。
2026 年 8 月初,Rippling 官方博客披露了一组数字:AI token 支出月环比增长 80%,按当时轨迹,一年内会烧掉 R&D 人力预算的 40%;约 10–15% 的员工驱动了 60% 的总支出,单名工程师一个月烧掉 5 万美元。
这不是某个小团队的失控,而是一家百亿美元级公司全员开放 AI 工具后的普遍轨迹。他们用 AI 网关、员工级归因和一套组织机制,把 token 成本从预测的 40% 压到 10–15%。这套打法对任何已经在为 Cursor、OpenAI、Anthropic 账单发愁的 CTO 都值得拆一遍。
官方复盘里有一个容易被忽视的细节:他们并没有"决定"用最贵的模型,而是"没人看过"——博客原文说:"最新模型被设成了 fast mode,这不是我们做出的决策,而是从来没有人去查过、去设定最佳实践。"
三件事叠加造成失控:
他们自建了内部 AI Gateway:一个位于员工与已批准模型之间的路由层,所有 LLM 流量都经过它,从而在一个地方设定并执行支出上限、模型访问策略,按任务把请求路由到合适模型,并记录每笔交易。
路由降本并不是这家公司独有。Databricks 在 2026 年 8 月的 《Managing AI Coding Costs at Scale》里给出了"效率前沿"(efficiency frontier)的框架:规模化部署时,真正重要的不是智能前沿,而是"给定智能水平下的最佳性价比"——大多数日常编码不需要数学证明或安全突破。Databricks 的 Unity AI Gateway Smart Router 内部数据显示,平均任务成本降低 30% 以上,同时质量接近工作集里最贵模型。Stripe 因 Opus 4.7 相比 4.6 无实质提升而拒绝开放,Databricks 也在 Opus 5.0 对 4.8 的成本回归后做了同样的事。
模型侧的证据也在支持"够用即止":Semgrep 在 2026 年 6 月的 实测中,开源权重的智谱 GLM 5.2 在 IDOR 检测上拿到 39% F1,击败 Claude Code 的 32%,且每发现一个漏洞的成本约 0.17 美元;Databricks 的内部 benchmark 也认为 GLM 系模型性价比突出,并已内部 rollout。HN 社区把 GLM 5.2 与 Grok 4.5 对比的观察是:性能相当,但成本差距极大。模型路由的价值就是把这类"够用的便宜模型"自动派给不需要 frontier 的任务。我们此前拆解过微软路由降本 85% 的双基线方法论,原理一致:先定义质量基线,再选满足基线的最便宜模型。
一个提醒:自建网关也有争议。Runlayer 在 2026 年 7 月起诉 Rippling,指控其在近一年的评估期获取源码后开发竞品网关(后者否认,案件尚无裁决)。网关是基础设施级投资,自建前先评估采购成熟产品与自研的边界。
只看总账单永远不知道钱去哪了。他们把 Cursor、OpenAI、Anthropic 的 token 数据拉入数据湖,用 GitHub 用户名映射员工邮箱,再关联到团队、角色、部门——归因口径从"厂商"落到"人"。
归因之后,他们建了工程团队的 AI Scorecard,五个维度:Adoption(采用率)、Usage(使用深度)、Productivity(PR 与代码产出)、Cycle time(PR 合并周期)、Efficiency(支出对产出的效率分),并把"支出 vs PR 数""支出 vs 返工量"做成看板,用于识别两类问题:
官方复盘承认生产力信号真实但不线性:重度的 Cursor 用户确实合入更多 PR,但最大提升来自"首次采用",而不是在 frontier 模型上继续加钱。归因看板让"加钱有没有换来产出"第一次变成可回答的问题。
技术层解决"能不能控制",组织层解决"谁来负责"。他们做了两件事:
官方博客给出的结果是:R&D 的 token 支出从"预测将占人力预算 40%"降到 10–15%,"每年数千万美元"的级别。注意口径——他们压掉的是预测路径,不是简单砍预算:先计量、再路由、再归因、再组织化,四条腿一起走,才没有牺牲全员 AI 采用率。
整篇复盘里最有价值的一句话:成本集中度极端——60% 的支出藏在 15% 的员工手里。如果管理层只看"总盘子涨了 X%",会得出"AI 太贵、要限制所有人"的错误结论,把高价值用户和 slop 用户一起误伤。真正该做的是按人均/人均产出拆解,先找到那 15%,再判断他们烧钱烧得值不值。
| 手段 | 解决什么问题 | 典型动作 | 见效周期 |
|---|---|---|---|
| AI 网关 / 模型路由 | 默认 frontier 模型、无路由 | 接入路由层,按任务质量基线选模型 | 1–2 周 |
| 员工/团队级归因看板 | 看不见谁在花、花得值不值 | 拉取供应商用量,映射到人,关联 PR 与返工 | 2–4 周 |
| 供应商上限 + AI Captains | 行为不改、无人负责 | per-tool 月度 cap、设专人治理 | 1–2 个月 |
AI 网关是位于员工/应用与模型供应商之间的路由层,统一管控所有 LLM 请求。它能按任务把请求路由到满足质量基线的最便宜模型、执行支出限额与访问策略、记录每笔交易。Databricks 实测其 Smart Router 平均任务成本降低 30% 以上,质量接近最贵模型。
路由的前提是定义"质量基线":先在公司自己的任务集上测,只有通过基线的模型才能进入候选池。官方与 Databricks 的做法都是先跑内部 benchmark(如 Semgrep 实测 GLM 5.2 在 IDOR 检测上超过 Claude Code),再路由,而不是盲目切便宜模型。
不需要一开始就上完整看板。先用供应商后台把用量按人导出、算人均,通常很快就能找到那 15% 的大户。等团队超过几十人、账单开始非线性增长,再考虑数据湖级别的归因。
网关是基础设施级投入:要维护路由策略、供应商适配、日志审计,还要面对"买 vs 建"的法律边界——Runlayer 诉 Rippling 的案子显示,深度评估供应商源码后自建同类产品有知识产权争议(目前无裁决)。多数企业更适合先评估成熟网关产品,自建只留给有专门平台团队的场景。