2026年7月9日,OpenAI 发布 Sol 旗舰模型和 Work 智能体,xAI 发布 Grok 4.5——AI 编码从辅助走向自主。本文用真实基准数据拆解三强格局,给企业软件团队三个可执行决策。
2026 年 7 月 9 日,Ramp 应用 AI 团队的工程师 Sam Kronick 做了一件让同行沉默的事:他用一段自然语言规格描述,让一家头部 AI 公司的最新旗舰模型端到端构建了一个完整可运行的后端服务——没有手写一行代码。[来源] 同一天,该系列三型号(Sol / Terra / Luna)和 Work 智能体正式发布,xAI 推出 Grok 4.5,Anthropic 重置全量速率限制并发起「Hard Questions」倡议。三家同一天出牌——这是 AI 编码从「辅助工具」转向「自主执行者」的分水岭。
这不是前代旗舰的线性升级。官方给出的基准数据显示,新模型在多个编码与智能体评测上实现了跨越式提升:
| 基准测试 | Sol 得分 | 对比模型 | 差距 |
|---|---|---|---|
| Agents' Last Exam | 52.7% | Fable 5 / Opus 4.8 | 领先 |
| Terminal-Bench 2.1 (Ultra) | 91.9% | Mythos 5 (88.0%) | +3.9pp |
| BrowseComp (Ultra) | 92.2% | — | 新 SOTA |
| OSWorld 2.0 | 62.6% | Opus 4.8 | 领先 |
| Coding Agent Index | 80 | Fable 5 | 领先 |
| SEC-Bench Pro (Ultra) | 74.3% | — | — |
来源:AI 雷达 / Chubby♨️ @kimmonismus
值得留意的是 Terminal-Bench 2.1——这个基准测的是模型在真实终端环境中自主完成多步操作的能力,比代码补全测试更接近「自主智能体」的定义。Sol Ultra 以 91.9% 超过 Mythos 5 的 88.0%,说明新一代模型不只是在写代码,而是在操作计算机。
同时,该厂商将产品线拆为三个型号:Sol(编码 / 安全 / 科学旗舰)、Terra(前代级别性能、更低成本)、Luna(最快最便宜,面向高容量任务)[来源]。OpenRouter 已同步上线。这种分化意味着企业可以按任务复杂度选模型——核心交付用 Sol,批量自动化用 Luna——而不是一刀切地烧旗舰预算。
如果 Sol 是引擎,Work 就是把这台引擎装进了一辆能自己开的车。
这个新产品整合了 Codex 技术,能在桌面、Web、移动端跨应用自主执行数小时级工作流。[来源] 它不是「你问一句、我回一句」的聊天机器人——给一个目标,它自己规划步骤、调用工具、读写文件、产出交付物。
技术上两个亮点值得细看:
Unified Plugins Directory(统一插件目录)。发布时已接入 Google Drive、SharePoint、Slack、Microsoft Teams、Gmail、Outlook、Salesforce、Adobe、Zoom、LinkedIn、GitHub、Canva、Dropbox。用户通过 "@" 调用特定插件,或让模型自行判断哪些数据源相关。联合创始人 Greg Brockman 承认 2023 年的第一代插件「根本行不通,因为模型还没准备好」——这次用新一代推理能力重做,赌的是多数据源上下文已经能驾驭。
Auto-Review(自动审查)。执行重要操作前,由先进模型先审查一遍。在对抗性红队测试中,该机制阻止了 100% 试图提取受保护数据的行为。对企业的合规团队来说,这是把智能体引入内部工作流的前提。
桌面端(Mac / Windows)所有用户立即可用;Web 和移动端先开放 Pro / Enterprise / Edu。该产品与 Codex 共享 agent 消费池,按任务复杂度和所选模型计费。
同一天发布的另一家新品,走了一条不同的路。
在 Artificial Analysis 的 AA-Briefcase 基准(基于数千个复杂文件的真实知识工作任务)上,Grok 4.5 拿到 1328 Elo 分——非 Anthropic 模型中最高。但更值得看的是效率:
| 指标 | xAI 新品 | Opus 4.8 (max) | Sonnet 5 (max) |
|---|---|---|---|
| AA-Briefcase Elo | 1328 | 1354 | 1390 |
| 单任务成本 | $1.12 | $8.26 | — |
| 单任务耗时 | 12.4 min | 23.9 min | 36.9 min |
| 平均交互轮数 | 23 | — | 183 |
来源:AI 雷达 / Artificial Analysis
单任务成本 $1.12,比 Opus 4.8 低了 86%,分数只差 26 分。而且平均只需 23 轮交互——Sonnet 5 要 183 轮。这说明该模型的「任务理解效率」很高,一次性就把事情做对,不靠反复试错堆分数。
另一个关键信息:这款新品是与 Cursor 联合训练的,从第一天起就为编码场景优化,而非通用模型硬套。对于已经在用 Cursor 的团队,这是一个自然升级路径。
但短板也清楚:在 AA-Briefcase 的「呈现质量」维度上较弱。它能算出正确答案,产出物的格式化、可视化不如 Anthropic 系列。交付物如果是给客户看的演示文稿,可能需要二次加工。
先试 Work 桌面端。不需要 IT 审批,不需要 API 集成,下载就能跑。找一两个低风险、可验证的任务——比如「把这 15 个 Jira ticket 整理成项目周报,发到 Slack #general」——看它能不能端到端交付。重点不是「多聪明」,而是「能不能交出完整结果」。
同时在 API 侧用 Sol 替换前代模型做编码 Agent 任务的 A/B 测试。多步推理、工具调用、终端操作是 Sol 拉开差距的地方;代码补全类简单任务感知提升可能不明显。对于正在评估 Agent 平台整体落地策略的团队,可参考我们之前的分析:2026 年过半,AI Agent 平台在企业里到底跑起来了吗?
Work 的 Web / 移动端对 Plus 和 Business 用户尚未开放,Unified Plugins 的实际可靠性未经大规模验证。插件 "@" 调用的成功率、跨应用上下文保持的稳定性、长任务运行的漂移程度——都是未知数。等 2-4 周社区反馈再决定是否纳入正式流程。
xAI 新品目前仅在 X / Cursor / OpenClaw 等渠道可用,API 成熟度不如头部厂商。成本优势诱人,但如果团队需要稳定的 SLA 和生态集成,现在切过去为时过早。
不要「全面替换」现有工具链。Sol 再强,也是 24 小时前发布的模型。没有生产环境大规模运行数据,没有长时间稳定性记录。把核心交付流程押在一个刚发布的模型上,是工程管理的反面教材。事实上,90% 的企业智能体走不出 POC 阶段,根源往往不是模型能力不够,而是工程配套没跟上——这个教训在新模型切换时同样适用。
不要盲目追低价。$1.12/任务确实诱人,但如果你现有的 Anthropic 或其他厂商工作流已经跑顺了,迁移成本——prompt 重调、输出格式适配、评估体系重建——可能远超省下的 API 费用。成本优化应该在「模型能力满足需求」的前提下进行,而不是反过来。
我们在蓝曜炬辉的实践中反复验证过一个原则:模型选型的第一变量永远是「任务匹配度」,成本排第三——排在它前面的是「生态集成度」。
第一,自主智能体从 demo 走向交付。Work 和 Anthropic Cowork 同时推向市场,说明「让 AI 干活而不是对话」的产品形态已经成熟。下半年,企业软件团队要回答的问题不再是「用不用 AI」,而是「哪些工作流可以完全交给 AI、哪些需要人机协作」。
第二,成本战正式开打。xAI 的 $1.12/任务 vs Opus 4.8 的 $8.26,头部厂商用 Terra / Luna 做价格分层——三家都在用价格锚定市场。智能体任务的成本从「实验预算」级别进入「日常运营」级别。对企业来说,这意味着 AI 落地正在分裂成两条轨道:烧钱验证 vs 省钱跑量,选型策略比以往任何时候都重要。同时,Token 账单已经成为 Agent 项目第一个失控点,成本控制需要从架构设计阶段就开始规划。
第三,安全机制成为企业采纳的硬门槛。Work 的 Auto-Review、Anthropic 的安全护栏、xAI 的开源路线——三条路各有侧重,方向一致:没有可靠的安全设计,企业不敢把自主智能体放进内部系统。
在 Coding Agent Index 上,Sol 得分 80,显著领先前代和 Fable 5。Terminal-Bench 2.1(终端自主操作)上,Sol Ultra 达 91.9%。但代码补全类简单任务的感知提升可能不明显——真正拉开差距的是多步推理和工具调用类 Agent 任务。
Auto-Review 在红队测试中阻止了 100% 的数据泄露尝试。Enterprise 和 Edu 管理员可通过 Spend Controls 管理工作区、群组和用户级限额。但生产环境的大规模安全验证数据尚未公开,建议先在非敏感工作流中试用。
在用 Cursor 且对成本敏感的团队,xAI 路线是自然选择。需要跨应用工作流(Slack → Google Drive → 演示文稿)的,目前只有 Work 能做到。交付物质量要求高(客户演示级)的,Anthropic 系列在呈现质量上仍有优势。
API 侧切 Sol 的风险可控——OpenRouter 已上线,可在小流量上先跑 A/B。Work 建议等 2-4 周社区反馈再纳入正式流程。不要在生产环境直接替换前代模型的 Agent 任务,先跑影子模式对比输出质量。
蓝曜炬辉(广州市蓝曜炬辉科技有限公司)为 B 端企业提供 AI 智能体工程化落地服务,涵盖大模型应用架构设计、Agent 工作流编排、多模型选型与成本优化。如果你的团队正在评估 Sol / Work / xAI 新品的技术选型与工程落地,欢迎访问 www.lanyaoai.com 查看我们的案例与技术方案。