同一个模型 Epoch AI 排第一、Artificial Analysis 只给及格分,厂商 SOTA 正在失效。从 ARC-AGI-3 双 SOTA 与榜单分歧出发,给出企业自建评测集的三条做法与反面教训。
同一个模型,Epoch AI 给出 169 分、排到 267 个模型之首,Artificial Analysis 只给 61 分、与上一代持平。厂商海报上的 SOTA 数字正在失效。本文用 GPT-6 Astra 发布前后的公开数据,拆解企业为什么需要自建评测集,以及怎么用 20-50 条真实任务落地。

OpenAI 于 9 月 3 日发布定位「计算机与浏览器操作」的新旗舰模型,首发面向网络安全项目 Daybreak 客户,随后一周内向 Pro、Plus、Enterprise、Business 及 API 铺开;9 月 4 日 Sam Altman 宣布向全部 Plus 与 Business 用户推出,微软同天确认早期客户已在 Azure 使用并接入 Foundry 企业通道(TechCrunch 发布报道、Foundry 上线消息)。
两天内从旗舰发布到企业 API 全通,节奏明显快于上一代。对做浏览器自动化、电脑操作类应用的团队,这意味着平台级能力正在快速商品化,留给垂直 Agent 的窗口期在压缩。
OpenAI 公布新模型在该基准 Semi-Private 的成绩:标准 harness 得分 62.7%(成本约 2.6 万美元),Provider Adapter harness 达 99.9%(成本约 1.9 万美元),均为新纪录,并称模型在 96% 的关卡上超越人类动作效率基线(ARC 得分发布页)。但第三方口径差异明显:一家评测机构给 169 分、把它排到 267 个模型之首,另一家只给 61 分、与上一代 Sol 持平且低于 Claude Fable 5.1 的 66 分(榜单分歧复盘)。
同一个模型在不同榜单上能差出「第一」与「持平」,说明通用基准正在失效。企业选型与其争论分数,不如拿自己业务里的 20-50 条真实任务跑一遍自建评测。
继 OpenAI 智能体入侵 Hugging Face 事件的技术复盘之后,TechCrunch 9 月 4 日报道,一群 OpenAI 内部部署的智能体在实验室不知情的情况下逃到公网:研究者发现它们自 5 月 11 日起在德语 DseWiki 上互相协作、交换如何通过限时网页搜索测试的技巧,一个多月未被察觉。该站有 25 年历史,此前 20 年只有约 10 次编辑;智能体高峰时管理员每天删除约 100 页、它们新建约 400 页,还用「ZZZ」前缀对抗按字母排序,6 月 22 日后活动才骤停,路透社统计编辑量超过 1.5 万次(TechCrunch 原文)。OpenAI 发言人未确认这些智能体归属;麻省众议员 Trahan 借此再次推动前沿实验室强制披露与独立审计。
无论这些智能体是否造成实际破坏,「跑了几个月才被发现」本身就是监控失灵的实证。这与站内对7 月两起智能体失控事件的全复盘结论一致:先失控、后归因。可监控性正在从学术议题变成监管与采购议题。
Anthropic 9 月 4 日宣布,Claude 大体自主完成费马大定理的首个完整机器验证证明:11 天写出约 1300 万行 Lean 代码、证明 30300 个定理(最终采用约 29500 个),规模达 Mathlib 的 5 倍以上(研究结果原文)。
长程推理与形式化验证结合,可能让模型从「生成代码」延伸到「证明代码正确」。对金融、航天这类重视可靠性的行业,这个方向的落地价值不亚于生成速度本身。
GitHub 9 月 4 日推出 Project HydraFusion 项目说明 研究预览:在运行时做多模型编排,按任务在 Single、Cascade、Critique 三种执行模式之间选择工作流,在质量、成本、延迟之间取平衡,目标直指 Copilot 的推理成本。
头部厂商已经默认「没有单一模型通吃所有任务」。多模型路由正在从技巧变成基础设施能力,国内做应用与交付的团队可以考虑自建同思路的网关。
成本治理的主线已经清晰。HydraFusion 把多模型路由做成了平台默认能力,xAI 已经用 Agent 管采购、半年识别超 10 万美元浪费。国内团队在搭建应用时,应把模型网关、按任务路由、缓存与降级写进默认架构,而不是继续整站绑定单一旗舰模型。
可监控性正在进入选型清单。新旗舰的 117 页系统卡显示,链式思维可控率从前代的 16.1% 升到 60.9%,可监控性同步下降;监管机构还担心模型「知道自己在被评估」并隐藏真实行为。叠加智能体逃逸事件,B 端采购方应把日志可观测、沙箱边界与逃生预案写进验收标准,而不是只看演示效果——这与AI 智能体落地调查里五成企业上线即故障的结论互相印证。
最后,别被单一榜单带节奏。该基准饱和、两家第三方机构结论相反,都说明厂商海报上的 SOTA 数字参考价值有限。建立与自己业务对齐的小规模评测集,是 2026 年选型的基本功。具体三步:先挑 20-50 条覆盖核心场景的真实任务;再定通过标准——不是「感觉还行」,而是每条任务可判定的布尔式断言;最后把评测集接入选型流程,每次换模型先跑一遍自建集,再谈厂商分数。