旧金山25人公司Lindy将AI调用100%从Claude切到DeepSeek,月省数百万美元。CNBC报道揭示了一个正在发生的范式转移:企业AI模型选择从"哪个最强"转向"哪个够用且便宜"。
2026年6月26日,CNBC的一篇报道让硅谷技术圈炸了锅。旧金山一家25人的公司Lindy,把AI调用从Anthropic Claude 100%切换到了DeepSeek。CEO Flo Crivello的原话是:"我们的AI账单曾经超过了全体员工工资的总和。"切换后,他预计未来几个月节省数百万美元。他补充了一句:"你现在来看我们的AI成本曲线,简直是断崖式下跌。"
这不是偶然。Uber——Crivello的前东家——本月开始为AI工具设分级支出上限,基础档每月仅1500美元。咨询公司Highspring的Jeff Henry透露,部分客户已决定暂停AI投入,"等能证明投资回报率后再继续"。2026年已经过半,企业AI支出正从狂热转向冷算账。
Lindy的切换决策看似激进,放在2026年的技术格局里却是合理推演。这家公司的主要业务场景是AI辅助编程和工具开发——恰好是CNBC报道中指出的"AI支出最先失控的领域"。开发者消耗大量Token投入新功能开发,账单增长往往先于收入增长。
DeepSeek在2026年的定位已经很清楚:不做最贵、不做最前沿,但做"够用且便宜得多的那一个"。DeepSeek-V4系列在推理、编码等主流任务上与Claude Opus的差距已经缩小到大多数商业场景感知不到的程度。当一个模型能满足90%的任务需求、价格却低一个数量级,纯经济理性会推动切换——这正是我们现在看到的。
但这不代表DeepSeek在所有维度都赢了。知识密集型任务(如GPQA-Diamond级别的科学推理)仍然是闭源前沿模型的领地。普林斯顿大学6月发布的CEO-Bench测试中,14个模型在500天创业模拟里仅有Claude Fable 5(4715万美元盈利)、Claude Opus 4.8(2780万)和GPT-5.5(2130万)超过起始资本。底层推理质量差距依然存在,只是大多数企业日常任务不需要这个级别的能力。
比"全切某一个模型"更聪明的做法是什么?CNBC的报道指向了一个关键词:模型路由(Model Routing)。企业不再把最贵的前沿模型用于所有场景,而是按任务难度分配——简单任务走便宜模型,复杂任务走强模型。我们在另一篇文章中详细拆解了企业模型路由策略与降本实战的具体方案。
2026年6月29日登上Hacker News热门的Wayfinder Router是这个思路的工程化实现。它不调用任何模型来做路由决策——而是纯文本分析:读提示词的结构(长度、标题、列表、代码块)和措辞(证明、数学、硬约束),在微秒内给出"走本地/走云端"的判断。对比RouteLLM、NotDiamond等需要额外模型调用的路由器,Wayfinder零延迟、零成本、完全确定性。
但Wayfinder团队自己也承认短板:纯语义难题(微妙代码片段、"第100个质数是什么"这类看似简单的难题)在结构上无信号,此时它不比随机选择好多少。在RouterBench的短难题条目上,它的表现确实如此。这不是Wayfinder的失败——它说明了一个原则:模型路由是工程优化手段,不是魔法。你需要在自己流量上校准阈值,了解它的失效边界。
我们在一开始做AI应用开发时也犯过类似的错——以为一个路由层加一个分类器就能完美分发。后来发现,路由策略的真正瓶颈不在"判断这一步",而在"知道每个模型在每种任务上的真实表现"。这个认知成本远高于路由本身的计算成本。
CNBC报道引入了一个术语:Token Minimizing。不是简单少用Token,而是用更少的Token完成同等复杂度的任务。这本质上是把Token消耗当工程指标来管理。
几家大厂的实践已经浮出水面:Uber设分级支出上限;部分企业对AI辅助编程工具实施配额制;咨询公司客户直接在合同中约定"AI调用ROI达标前暂停扩容"。这反过来推动了两个技术方向:一是更高效的推理框架(如DeepSeek刚开源的DSpark),二是更智能的提示词压缩与缓存策略。
辅助编程是Token消耗的最大黑洞。一个开发者一天的Cursor/Claude Code使用量轻松突破数十万Token,而很多Session里模型产出的代码最终并未进入生产。我们自己的实践是:强制Code Review环节引入"Token经济性检查"——超过50%未采用的生成代码标记出来,反向优化提示词。这个动作让单项目Token消耗平均下降约35%,且代码质量未受可见影响。
6月28日,DeepSeek开源了DSpark投机解码框架。这不是一个新模型,而是一个加速层——复用DeepSeek-V4已有权重,附加草稿模块,通过半自回归生成(并行骨干+轻量顺序头)实现无损加速。生产环境下,DeepSeek-V4-Flash每用户生成速度比MTP-1基线提升60-85%,V4-Pro提升57-78%。DeepSpec训练代码库采用MIT许可证,全部开源。关于推理加速对成本的实际影响,我们在推理加速与模型路由的工程实战中有更详尽的性能数据。
DSpark的技术要点:它把草稿生成拆成两阶段。并行骨干(类似DFlash)一次生成整个Token块——成本极低;然后轻量顺序头(仅两层马尔可夫头)在采样每个Token前添加前缀偏置,解决并行模式下"后缀接受率衰减"的老问题。第三个组件是置信度调度器——GPU空闲时验证更多Token,繁忙时自动缩减。这三点分别降低了草稿成本、提升了接受率、优化了验证效率。
这意味着什么?便宜模型不仅在价格上碾压,在生成速度上也开始拉开差距。DeepSeek-V4的成本本来就远低于Claude Opus,加上60-85%的加速,同价位下能处理的请求量直接翻倍。这是一个自我强化的飞轮:越多人用→生产数据越多→优化越好→性价比越高→更多人切过来。
对比表格能更清楚地看到当前格局:
| 策略 | 月成本(25人团队估算) | 适用场景 | 风险 |
|---|---|---|---|
| 全量Claude Opus | $50,000-$120,000 | 前沿推理、科学计算 | 账单失控,ROI难证明 |
| 全切DeepSeek V4 | $3,000-$8,000 | 常规编码、对话、内容生成 | 知识密集型任务能力下降 |
| 模型路由(Wayfinder式) | $8,000-$25,000 | 混合场景,90%任务走便宜模型 | 路由策略需持续调优 |
| 全量DeepSeek+DSpark加速 | $2,000-$5,000 | 高并发服务,对延迟敏感 | 依赖DeepSeek服务稳定性 |
蓝曜炬辉在2026年上半年为多个企业客户交付了AI应用开发项目。基于这些实战经验,我们提炼了四条关于模型选择的工程判断:
第一,不要因为"大家都在切DeepSeek"就切。先跑两周的真实负载基准测试。在你们自己的Prompt分布上,对比候选模型在准确率、延迟、成本三个维度。很多"看起来一样"的模型在特定领域Prompt上差异巨大——我们一个金融客户在合规审查Prompt上,DeepSeek-V4的准确率比Claude低了约8个百分点,但代码生成端几乎持平。
第二,模型路由的价值不在"省了多少钱",而在"建立了成本可视化能力"。路由层天然是一个计量点。有了它,你能知道哪个团队在什么类型的任务上烧了多少Token。这个数据本身比切换模型省下的钱更有长期价值。
第三,Token最小化优先于模型切换。在我们经手的项目里,优化提示词结构减少30-50%的Token消耗,其收益往往超过从Claude切到DeepSeek的价格差——而且不牺牲任务质量。先做提示词审计,再考虑换模型。
第四,不要把路由策略写成死规则。模型能力变化太快。2026年1月ChatGPT-5的编码水平被公认第一,到6月DeepSeek-V4在HumanEval上的差距已经缩小到3%以内。路由规则必须是可配置、可A/B测试的,而不是硬编码在代码里的if-else。
我们有一个反面教训:2025年底给某电商客户做AI客服系统时,我们硬编码了"简单FAQ走开源小模型、复杂投诉走GPT"的分发规则。三个月后小模型升级,原来分类为"复杂"的投诉新模型已经能处理,但我们没有及时更新路由规则,多花了几万Token完全没有必要。现在我们的所有路由策略都带自动校准脚本,每月跑一次。这个教训也在2026年AI Agent平台企业落地复盘中有更完整的记录。
DeepSeek提供API服务,数据经其服务器处理。如果你的场景涉及敏感客户数据或合规要求(如GDPR、个人信息保护法),需要评估数据出境风险。自部署DeepSeek开源模型是替代方案,但这意味着你需要自己维护推理基础设施。我们在企业知识库AI搭建实战中详细讨论了双模型接入在合规场景下的架构方案。
API网关解决"哪个供应商来服务一个调用"——基于价格、可用性和故障转移。模型路由解决"这个提示词应该属于哪个能力层级"——基于任务难度。两者互补:先用Wayfinder判断便宜还是昂贵,再通过网关选择具体供应商。
取决于手段。粗暴截断输出长度会降质;优化提示词结构、去掉冗余上下文、利用缓存机制——这些不会。我们观察到,多数企业的Prompt里30-50%的上下文Token对当前任务是冗余的。
月AI账单低于$2000的团队,模型路由的维护成本可能超过节省。但如果你有一个开发者重度使用Cursor/Claude Code,单人的月Token消耗就可能破$500——这时路由策略值得投入半天搭建。