2026年7月,Vercel数据显示DeepSeek吃掉了平台三分之一以上的token流量,但Anthropic仍拿走一半以上的钱。这个剪刀差背后的双层模型经济,正在重塑企业AI Agent的架构决策。
2026 年 7 月第一周,Vercel 的 AI Gateway 仪表盘上出现了一个让技术圈沉默了几秒的数据:DeepSeek V4 Flash 以每周 5.3 万亿 token 的处理量冲到第一,占平台总流量的三分之一以上。但切到支出排行榜,Anthropic 一家就拿走了平台上一半以上的钱。一个模型吃流量,另一个模型吃利润——这个剪刀差,恰好说清楚了今天企业落地 AI Agent 时必须想明白的那件事。
7 月 7 日,Decagon CEO Jesse Zhang 在 Threads 上发了一篇文章,标题就很直接——"Everyone is wrong about open source AI in the enterprise"。他的核心判断:前沿模型和开源模型并非竞争对手,而是同一个 AI 应用生命周期里的两个阶段。
Decagon 自己的数据是很好的注脚。他们约 90% 的工作负载跑在开源模型上,但这不是因为成本,也不是客户强制要求的——
"真正的原因是,我们几乎没有其他选择。当你在生产环境运行客服 AI Agent 时,延迟会直接决定产品能不能用。每轮回复等 8 秒,没人会继续用。但开箱即用的小模型达不到客户的质量标准,只有针对特定任务大规模微调后才能满足要求。前沿模型实验室根本不提供这种组合——你没法微调它们最强的模型,它们的小模型也不属于你。"
这段话把企业 AI 落地的真实困境说透了。生产环境要的是"够用、够快、可控",这三个条件叠加在一起,今天唯一可行的路径就是"小模型 + 深度微调",等于必须用开放权重模型。这也解释了为什么我们在 2026 年上半年看到的一个现象——AI Agent 平台在企业里虽然讨论热烈,真正跑起来的团队仍然集中在那些有能力自建微调流水线的公司。
但故事还有另一面。Decagon 在昂贵前沿模型上的总支出几乎没有下降。每有一个成熟场景迁移到轻量模型,就有新的应用场景在前沿模型上被验证出来。Zhang 的结论是:"前沿模型实验室将继续主导应用发现,开源模型将越来越多地主宰生产部署。"
Zhang 的文章没有给太多数据支撑,但 TechCrunch 的 Russell Brandom 替他把数字找齐了。
OpenRouter 的数据更全面:DeepSeek V4 Flash 每周处理约 5.3 万亿 token,最受欢迎的前沿模型 Anthropic Opus 4.8 每周约 2 万亿 token——不到 DeepSeek 的一半。但 Opus 4.8 的平均 token 成本是 V4 Flash 的 23 倍:每百万 token 约 1.37 美元 vs 0.06 美元。
按这个价差推算,尽管 Opus 4.8 的 token 量明显低于 V4 Flash,它在平台上占据的模型支出很可能仍然是最高的。Vercel 的数据也印证了这一点:Anthropic 依然占据平台 AI 总支出的半数以上。
下面这张表把两条轨道的差异拉出来看:
| 维度 | 前沿模型轨道(Opus 4.8 为代表) | 开源模型轨道(DeepSeek V4 Flash 为代表) |
|---|---|---|
| 每百万 token 成本 | ~$1.37 | ~$0.06 |
| 典型延迟 | 高(复杂推理场景 3-8s) | 低(微调后 < 2s) |
| 可微调性 | 受限(仅限 API 层调参) | 完全可控(全量微调 + 量化部署) |
| 适用阶段 | 应用发现 / 原型验证 | 生产部署 / 规模化运行 |
| 通用推理能力 | 最强(处理模糊、开放任务) | 需针对性微调才能达标 |
| 数据控制 | 数据经第三方 API | 可自托管,数据不出域 |
| 典型企业支出占比 | 50%+ 的总模型支出 | 90% 的工作负载 |
这张表的最后一行的矛盾是故意保留的——它就是这个行业的现状。
我们在交付企业 AI 应用的过程中,最初也走过"一把梭"的弯路。2025 年底给一个零售行业的客户做智能客服 Agent 时,我们直接用当时最强的前沿模型做全链路——意图识别、知识检索、回复生成全走同一个模型。
上线第一周,响应延迟中位数 6.2 秒。客户那边的运营负责人打电话过来说得很直接:"用户等不了,我们自己的客服人工回复也就 3 秒。"第二周我们拆了架构:意图识别和知识检索切成开源小模型做 embedding + 路由,只有最终回复生成保留前沿模型。延迟压到 1.8 秒,模型月账单从预估的 $4,200 降到 $1,100。那个项目之后我们就定了条内部原则:不到万不得已,不要让前沿模型碰高频低复杂度任务。
这个经验放在 2026 年 7 月的语境下反而更有价值了——因为现在不是"要不要拆"的问题,而是"怎么拆才能不掉坑"。我们后来总结的教训是:PoC 阶段跑通只是开始,从 Demo 到生产这中间隔着的工程细节,才是决定项目能不能活下来的分水岭。
第一,不要幻想"一个模型吃遍天"。Anthropic 自己的工程博客在 2024 年底就写明了:最好的 Agent 实现用简单的、可组合的模式,不是复杂框架[1]。放到模型层面,这个逻辑同样成立——用对了场景的模型,比"最好的模型"更有用。
第二,预算的大头还是会花在前沿模型上,而且你应该接受这件事。前沿模型的价值不在跑量,在"探路"。一个新场景刚出现时,你不知道输入数据的分布、不知道模型需要表现出什么行为、不知道会踩什么坑——这时候为"可能用不到的智能能力"支付溢价是合理的。等到场景成熟了,再迁移到经过微调的开源模型上跑量。TechCrunch 的分析也指出:可被 AI 覆盖的任务市场增长得太快,前沿模型靠占据新场景早期验证阶段就能维持市场地位[2]。
第三,微调能力正在成为企业 AI 团队的核心竞争力。Decagon 的案例已经说明问题了——开源模型开箱即用达不到质量标准,必须经过大规模针对性微调。微调不是"训一次就完了",而是需要持续的数据飞轮:生产数据回流 → 标注 → 微调 → 评估 → 上线。90% 的企业智能体走不出 PoC,表面上看是效果问题,根上往往是数据飞轮没转起来。这条流水线的搭建成本和维护成本,正在成为企业 AI 落地的隐性门槛。
先用前沿模型(Claude Opus / GPT-5 级别)跑通原型,确认场景可行。不要一上来就纠结模型选型——场景没跑通之前,选什么都没意义。原型阶段最重要的是验证"AI 能不能解决这个问题",而不是"用什么模型最省钱"。[3]
会,如果你不做微调。开源模型开箱即用的通用能力确实不如前沿模型,但经过针对性微调后,在特定任务上的表现可以持平甚至超过通用前沿模型——因为通用模型的知识是分散的,微调模型是聚焦的。关键看你有没有能力做高质量的微调。
短期(1-2 年)不会。原因很简单:前沿模型和开源模型的能力差距在缩小,但永远不会消失——因为前沿模型实验室永远在发布更强的模型,而开源模型永远在追赶。只要这个"追赶-超越-再追赶"的循环存在,双层结构就会存在。[3]
更成立。国内企业对数据合规和自托管的要求比海外更严格,很多场景天然就不能走第三方 API。DeepSeek、GLM、Qwen 等国产开源模型的成熟度在 2026 年已经足够支撑大多数企业场景的生产部署。但同时,前沿模型(无论是海外还是国内旗舰模型)在复杂推理任务上的优势仍然明显。国内企业的典型做法是:敏感数据走自托管开源模型,复杂推理走可控环境下的前沿模型 API。