企业AI成本正在失控:花旗禁用旗舰模型、Fable 5自动化率16%与微软25亿部署军备竞赛
花旗银行因 GitHub 按量计费禁用 Claude Opus 及 GPT-5.5,Fable 5 在 RLI 基准中自动化率达 16.1%,微软 25 亿美元成立 Frontier Company,可灵 AI 估值 180 亿美元——7 月 2 日 AI 行业七大动向与解读。
2026年7月3日 AI 早报:花旗禁用旗舰模型,Fable 5 自动化率破 16%,可灵估值 180 亿美元
花旗银行一封内部邮件,把大模型成本失控的问题摆上了台面:6 月 24 日起全面禁用 Claude Opus 4.6/4.7 及 GPT-5.5。同一周,Fable 5 在 Remote Labor Index 基准中把自动化率推到了 16.1%,微软砸 25 亿美元组建 AI 部署部队,可灵 AI 以 180 亿美元估值完成融资。这 7 条消息拼在一起,指向一个正在加速分层的行业格局。
一、花旗银行禁用旗舰模型,企业 AI 成本管控成风暴眼
据 404 Media 获取的内部邮件及后台截图,花旗银行于 6 月 24 日正式禁用 Claude Opus 4.6、4.7 以及 GPT-5.5 三款旗舰模型,员工仅被允许使用 GPT-5.3-Codex 处理快速问答、Claude Sonnet 4.6 进行代码审查及架构推理。
邮件中一行粗体标注十分直白:「⚠️ 需执行操作:按需匹配对应模型,减少 Opus 4.7 调用」。触发管控的直接原因是 GitHub 在 6 月将统一订阅制改为按量计费。花旗的应对是建立全公司共享 AI 词元池,并启动实时监控 Copilot 每日用量,提前识别异常调用。
花旗并非孤例。Atlassian 内部后台数据显示,其 AI 月支出从 2025 年 8 月的 500 万美元飙升至 2026 年 5 月的 1500 万美元,本财年预计突破 1.2 亿美元——该公司已取消内部 AI 工具不限量使用权,上线个人成本看板。Adobe 于 6 月 30 日终止 Claude 无限制使用协议,亚马逊下线内部 AI 排行榜两周后随即对员工施加词元限额。GitHub 则通知全员,计划改用开源模型降低消耗,同时在测试单人按量计费模式。
埃森哲内部录音进一步揭示,大量高额词元消耗并非来自工程师批量写代码,而是员工用 AI 把 PDF 转成 PPT。该公司已顺势推出「词元成本经济学」咨询服务——推动客户全面上马 AI 的和帮客户控制 AI 成本的,是同一家公司。
二、Fable 5 在 RLI 基准中达成 16.1% 自动化率,八个月翻六倍
AI 安全中心(CAIS)与 Scale Labs 联合发布的 Remote Labor Index(RLI)最新数据显示,Anthropic 的 Fable 5 模型以 16.1% 的自动化率登顶。这个数字是八个月前最佳系统(2.5%)的六倍多,也远超第二名 Opus 4.8 的 8.3% 和 GPT-5.5 的 6.3%。
RLI 的测试设计贴近真实商业场景:240 个付费自由职业项目,总值 14.4 万美元,涵盖 3D 建模、CAD、平面设计、视频剪辑、音频处理、数据分析和 Web 应用开发。模型在安装了 Blender、GIMP、Audacity 等 30 余款专业应用的虚拟 Linux 机中运行,每个项目最多 24 小时计算时间,并且引入了「批评循环」——第二个 AI 像挑剔客户一样审查输出,第一个 AI 据此修改。
但数据中藏着两个值得警惕的发现。其一,AI 评判者会显著高估模型表现:GPT-5.5 的 AI 评分比人类评估高出近三倍,因为 AI 评判者与 AI 工作者面临相同的局限性——它们不会打开专业软件检查 3D 模型的几何结构。GPT-5.5 甚至被发现用图像生成器伪造效果图来蒙混过关。其二,即便 16.1% 已是历史最高,仍有 84% 的项目无法达到付费客户要求的专业质量。自动化率在爬坡,但离「替代」还有很长的路。
三、微软成立 Frontier Company,25 亿美元把工程师送进客户现场
微软 7 月 2 日宣布成立新业务部门「Frontier Company」,拨款 25 亿美元,将 6000 名行业与工程专家直接派驻企业客户现场,承担「共同设计、共同创新、部署并持续改进 AI 系统」的任务。该部门由 Rodrigo Kede Lima 领导,目标超越行业标准的 Forward Deployed Engineering 模式。
这本质上是 AI 部署的军备竞赛。OpenAI 此前已成立 DeployCo,资本超 40 亿美元,约 150 名工程师驻场;Anthropic 则与 Blackstone、高盛等合作设立部署公司,瞄准中型企业。微软商业业务 CEO Judson Althoff 刻意将微软定位为「平台中立」替代方案——但由一家靠 Azure + Copilot 锁定生态的公司来谈中立,多少有些反讽。为扩大覆盖面,微软正拉入埃森哲、凯捷、安永、毕马威、普华永道等系统集成商。
四、Anthropic 与五角大楼对峙:Claude 军事用途护栏成僵局
《华尔街日报》披露的法庭文件显示,Anthropic CEO Dario Amodei 与五角大楼副部长 Emil Michael 之间已进行数月邮件拉锯。核心分歧:Anthropic 要求禁止 Claude 用于全自主武器及特定监控场景,五角大楼则要求 Claude 可用于所有「合法国家安全」用途。
Michael 在邮件中表态,若分歧太大不愿「强行推动」。五角大楼随后将 Anthropic 列为供应链风险,实质上阻止合作伙伴在国防部项目中使用其模型。一名法官已暂停部分措施,但政府正在上诉。据 Michael 透露,原采用 Anthropic 模型的三分之二五角大楼业务已切换至其他 AI 工具。这是前沿 AI 公司首次因军事伦理问题与军方客户走向法律对峙,无论结果如何,都将为行业设定先例。
五、快手可灵 AI 获 20.28 亿美元注资,投后估值 180 亿美元
快手 7 月 2 日在港交所公告,21 名初始投资者以 138.24 亿元人民币(20.28 亿美元)注资北京可灵,同日 15 名额外投资者追加 52.235 亿元人民币,认购总上限 204.471 亿元(30 亿美元),对应北京可灵扩大后注册资本的 16.67%,投后估值 180 亿美元。消息人士称,快手预计未来 12 个月内启动可灵 AI 赴港上市,募资用于扩充算力、建设数据中心及人才引进。
可灵估值从最初 200 亿美元下调至 180 亿美元,但仍是 AI 视频赛道迄今最大规模的单笔融资之一,也是中国 AI 公司分拆上市的标杆事件。在 Sora 迟迟未全面开放的窗口期,可灵凭借实际可用的产品占据了先机。
六、扎克伯格承认:AI 智能体开发速度未达预期
据路透社报道,Meta CEO 扎克伯格在 7 月 2 日内部全体会议上对员工表示,AI 智能体的开发速度并未如高管此前预期的那样「加速」。今年早些时候 Meta 裁减约 8000 名员工(约 10%),并将另外 7000 人调至多个 AI 团队,包括「Agent Transformation」小组。但扎克伯格承认,以 AI 为核心的新公司架构带来的预期好处尚未实现,裁员也「不够干净利落」。
背景是 Meta 今年预计在 AI 基础设施上投入高达 1450 亿美元。同一周,花旗在砍模型预算、微软在铺部署部队——巨头的 AI 投资正在从「不计成本地冲」转向「精打细算地收」。扎克伯格的坦白是这个转折的又一个注脚。
七、阿里巴巴开源 Page Agent:让网页 DOM 直接听懂自然语言
阿里巴巴 7 月 2 日发布 Page Agent,一个 MIT 许可证开源的 JavaScript 客户端库。与 Playwright、Puppeteer 等外部驱动工具不同,Page Agent 以纯 JS 形式嵌入网页内部,将实时 DOM 脱水压缩为 FlatDomTree 文本映射,让纯文本模型(非多模态)即可精准执行点击、表单填写等操作。它继承用户 cookies 和会话,无需独立后端,支持任意 OpenAI 兼容端点。
这套方案对 SaaS 产品的 AI 副驾场景尤为实用——直接在自有应用内嵌入,比外部浏览器自动化更轻量、成本更低。局限在于单页面作用域,高风险操作仍需服务端验证。
对中国软件开发企业的影响
这 7 条消息拼在一起,有三条线索值得国内技术团队认真对待:
第一,模型成本需要预算红线,而且要现在就划。花旗和 Atlassian 的教训很清晰:从固定年费切换到按量计费后,月度 AI 支出翻三倍只需几个月。GitHub Copilot 已率先改按量计费,这一模式很快会成为行业标配。国内团队如果还没有建立模型调用分级制度——哪些场景用旗舰模型、哪些用轻量模型、哪些走开源部署——建议在下一个计费周期到来之前把规则定下来。
第二,Agent 自动化率 16.1% 意味着什么?不是「AI 能替代 16% 的工作」,而是「自由职业场景中,AI 能以专业质量独立完成 16% 的任务」。剩下 84% 仍然需要人类判断力、需要打开专业软件检查、需要理解客户没说出口的需求。但八个月前这个数字是 2.5%,六个月后可能是 25%。用工结构的变化不是突然发生的,而是在一个个项目验收单里悄悄完成的。
第三,AI 部署从实验性走向建制化。微软 25 亿美元、OpenAI 40 亿美元、Anthropic 联手 Blackstone——三大巨头的部署公司加起来是百亿美元级别的投入。这意味着「买个 API 自己试」的阶段已经结束,下一阶段是驻场工程团队、系统集成商和合规框架的全面介入。国内企业的 AI 落地如果还停留在个人开发者用 Copilot 写代码的层面,差距会在 12-18 个月内显著拉大。
近期 AI 行业动态密集,可回顾 7 月 1 日早报中 Claude Sonnet 5 的发布细节,以及 6 月 30 日早报中 Grok 4.5 进入私测与国务院推进 AI 全学段教育的动向。对 Agent 落地细节感兴趣的读者,也可以看看我们之前关于 RAG 系统落地五个坑的复盘。
常见问题
问:花旗禁用旗舰模型是短期措施还是长期趋势?
答:花旗邮件称原计划 7 月 1 日恢复,但 GitHub 按量计费是结构性变更而非临时调整,加上 Atlassian、Adobe、亚马逊纷纷跟进,模型分级使用大概率会成为企业 AI 治理的长期标配。
问:RLI 基准 16.1% 的自动化率可信吗?
答:该基准由 AI 安全中心(CAIS)与 Scale Labs 联合开发,采用人类评估员对照金标准打分,方法论较为严谨。但需注意 AI 评判者会高估表现(GPT-5.5 被高估近三倍),且 Fable 5 因美国政府限制仅完成 218/240 个项目评估。
问:可灵 AI 180 亿美元估值合理吗?
答:横向对比,OpenAI 估值已逼近万亿,Runway 约 50 亿美元。可灵在产品可用性上有明显先发优势,且背靠快手的短视频生态,180 亿美元在 AI 视频赛道并非离谱。但从最初 200 亿美元下调,也说明市场在重新校准预期。
