← 返回资讯中心
AIcoding2026-07-14

GPT-5.6 Sol + ChatGPT Work 实测:从口语描述到可运行服务,AI 编码智能体跨过临界点

2026年7月9日,OpenAI 发布 Sol 旗舰模型和 Work 智能体,xAI 发布 Grok 4.5——AI 编码从辅助走向自主。本文用真实基准数据拆解三强格局,给企业软件团队三个可执行决策。

OpenAI 新旗舰 Sol + ChatGPT Work 实测:从口语描述到可运行服务,AI 编码智能体跨过临界点

2026 年 7 月 9 日,Ramp 应用 AI 团队的工程师 Sam Kronick 做了一件让同行沉默的事:他用一段自然语言规格描述,让一家头部 AI 公司的最新旗舰模型端到端构建了一个完整可运行的后端服务——没有手写一行代码。[来源] 同一天,该系列三型号(Sol / Terra / Luna)和 Work 智能体正式发布,xAI 推出 Grok 4.5,Anthropic 重置全量速率限制并发起「Hard Questions」倡议。三家同一天出牌——这是 AI 编码从「辅助工具」转向「自主执行者」的分水岭。

Sol 到底强在哪:一组基准数据

这不是前代旗舰的线性升级。官方给出的基准数据显示,新模型在多个编码与智能体评测上实现了跨越式提升:

基准测试Sol 得分对比模型差距
Agents' Last Exam52.7%Fable 5 / Opus 4.8领先
Terminal-Bench 2.1 (Ultra)91.9%Mythos 5 (88.0%)+3.9pp
BrowseComp (Ultra)92.2%新 SOTA
OSWorld 2.062.6%Opus 4.8领先
Coding Agent Index80Fable 5领先
SEC-Bench Pro (Ultra)74.3%

来源:AI 雷达 / Chubby♨️ @kimmonismus

值得留意的是 Terminal-Bench 2.1——这个基准测的是模型在真实终端环境中自主完成多步操作的能力,比代码补全测试更接近「自主智能体」的定义。Sol Ultra 以 91.9% 超过 Mythos 5 的 88.0%,说明新一代模型不只是在写代码,而是在操作计算机。

同时,该厂商将产品线拆为三个型号:Sol(编码 / 安全 / 科学旗舰)、Terra(前代级别性能、更低成本)、Luna(最快最便宜,面向高容量任务)[来源]。OpenRouter 已同步上线。这种分化意味着企业可以按任务复杂度选模型——核心交付用 Sol,批量自动化用 Luna——而不是一刀切地烧旗舰预算。

Work 智能体的本质:不是聊天,是自主工作流引擎

如果 Sol 是引擎,Work 就是把这台引擎装进了一辆能自己开的车。

这个新产品整合了 Codex 技术,能在桌面、Web、移动端跨应用自主执行数小时级工作流。[来源] 它不是「你问一句、我回一句」的聊天机器人——给一个目标,它自己规划步骤、调用工具、读写文件、产出交付物。

技术上两个亮点值得细看:

Unified Plugins Directory(统一插件目录)。发布时已接入 Google Drive、SharePoint、Slack、Microsoft Teams、Gmail、Outlook、Salesforce、Adobe、Zoom、LinkedIn、GitHub、Canva、Dropbox。用户通过 "@" 调用特定插件,或让模型自行判断哪些数据源相关。联合创始人 Greg Brockman 承认 2023 年的第一代插件「根本行不通,因为模型还没准备好」——这次用新一代推理能力重做,赌的是多数据源上下文已经能驾驭。

Auto-Review(自动审查)。执行重要操作前,由先进模型先审查一遍。在对抗性红队测试中,该机制阻止了 100% 试图提取受保护数据的行为。对企业的合规团队来说,这是把智能体引入内部工作流的前提。

桌面端(Mac / Windows)所有用户立即可用;Web 和移动端先开放 Pro / Enterprise / Edu。该产品与 Codex 共享 agent 消费池,按任务复杂度和所选模型计费。

xAI 的搅局:低成本路线同样能打

同一天发布的另一家新品,走了一条不同的路。

在 Artificial Analysis 的 AA-Briefcase 基准(基于数千个复杂文件的真实知识工作任务)上,Grok 4.5 拿到 1328 Elo 分——非 Anthropic 模型中最高。但更值得看的是效率:

指标xAI 新品Opus 4.8 (max)Sonnet 5 (max)
AA-Briefcase Elo132813541390
单任务成本$1.12$8.26
单任务耗时12.4 min23.9 min36.9 min
平均交互轮数23183

来源:AI 雷达 / Artificial Analysis

单任务成本 $1.12,比 Opus 4.8 低了 86%,分数只差 26 分。而且平均只需 23 轮交互——Sonnet 5 要 183 轮。这说明该模型的「任务理解效率」很高,一次性就把事情做对,不靠反复试错堆分数。

另一个关键信息:这款新品是与 Cursor 联合训练的,从第一天起就为编码场景优化,而非通用模型硬套。对于已经在用 Cursor 的团队,这是一个自然升级路径。

但短板也清楚:在 AA-Briefcase 的「呈现质量」维度上较弱。它能算出正确答案,产出物的格式化、可视化不如 Anthropic 系列。交付物如果是给客户看的演示文稿,可能需要二次加工。

企业软件团队现在面临的三个真实决策

决策一:现在该试什么?

先试 Work 桌面端。不需要 IT 审批,不需要 API 集成,下载就能跑。找一两个低风险、可验证的任务——比如「把这 15 个 Jira ticket 整理成项目周报,发到 Slack #general」——看它能不能端到端交付。重点不是「多聪明」,而是「能不能交出完整结果」。

同时在 API 侧用 Sol 替换前代模型做编码 Agent 任务的 A/B 测试。多步推理、工具调用、终端操作是 Sol 拉开差距的地方;代码补全类简单任务感知提升可能不明显。对于正在评估 Agent 平台整体落地策略的团队,可参考我们之前的分析:2026 年过半,AI Agent 平台在企业里到底跑起来了吗?

决策二:该观望什么?

Work 的 Web / 移动端对 Plus 和 Business 用户尚未开放,Unified Plugins 的实际可靠性未经大规模验证。插件 "@" 调用的成功率、跨应用上下文保持的稳定性、长任务运行的漂移程度——都是未知数。等 2-4 周社区反馈再决定是否纳入正式流程。

xAI 新品目前仅在 X / Cursor / OpenClaw 等渠道可用,API 成熟度不如头部厂商。成本优势诱人,但如果团队需要稳定的 SLA 和生态集成,现在切过去为时过早。

决策三:绝对不该做什么?

不要「全面替换」现有工具链。Sol 再强,也是 24 小时前发布的模型。没有生产环境大规模运行数据,没有长时间稳定性记录。把核心交付流程押在一个刚发布的模型上,是工程管理的反面教材。事实上,90% 的企业智能体走不出 POC 阶段,根源往往不是模型能力不够,而是工程配套没跟上——这个教训在新模型切换时同样适用。

不要盲目追低价。$1.12/任务确实诱人,但如果你现有的 Anthropic 或其他厂商工作流已经跑顺了,迁移成本——prompt 重调、输出格式适配、评估体系重建——可能远超省下的 API 费用。成本优化应该在「模型能力满足需求」的前提下进行,而不是反过来。

我们在蓝曜炬辉的实践中反复验证过一个原则:模型选型的第一变量永远是「任务匹配度」,成本排第三——排在它前面的是「生态集成度」。

2026 下半年的三个趋势判断

第一,自主智能体从 demo 走向交付。Work 和 Anthropic Cowork 同时推向市场,说明「让 AI 干活而不是对话」的产品形态已经成熟。下半年,企业软件团队要回答的问题不再是「用不用 AI」,而是「哪些工作流可以完全交给 AI、哪些需要人机协作」。

第二,成本战正式开打。xAI 的 $1.12/任务 vs Opus 4.8 的 $8.26,头部厂商用 Terra / Luna 做价格分层——三家都在用价格锚定市场。智能体任务的成本从「实验预算」级别进入「日常运营」级别。对企业来说,这意味着 AI 落地正在分裂成两条轨道:烧钱验证 vs 省钱跑量,选型策略比以往任何时候都重要。同时,Token 账单已经成为 Agent 项目第一个失控点,成本控制需要从架构设计阶段就开始规划。

第三,安全机制成为企业采纳的硬门槛。Work 的 Auto-Review、Anthropic 的安全护栏、xAI 的开源路线——三条路各有侧重,方向一致:没有可靠的安全设计,企业不敢把自主智能体放进内部系统。

常见问题

Sol 和前代旗舰比,编码能力提升有多大?

在 Coding Agent Index 上,Sol 得分 80,显著领先前代和 Fable 5。Terminal-Bench 2.1(终端自主操作)上,Sol Ultra 达 91.9%。但代码补全类简单任务的感知提升可能不明显——真正拉开差距的是多步推理和工具调用类 Agent 任务。

Work 智能体的安全性够不够企业用?

Auto-Review 在红队测试中阻止了 100% 的数据泄露尝试。Enterprise 和 Edu 管理员可通过 Spend Controls 管理工作区、群组和用户级限额。但生产环境的大规模安全验证数据尚未公开,建议先在非敏感工作流中试用。

xAI 新品和 Sol 怎么选?

在用 Cursor 且对成本敏感的团队,xAI 路线是自然选择。需要跨应用工作流(Slack → Google Drive → 演示文稿)的,目前只有 Work 能做到。交付物质量要求高(客户演示级)的,Anthropic 系列在呈现质量上仍有优势。

我们团队现在切 Sol 有风险吗?

API 侧切 Sol 的风险可控——OpenRouter 已上线,可在小流量上先跑 A/B。Work 建议等 2-4 周社区反馈再纳入正式流程。不要在生产环境直接替换前代模型的 Agent 任务,先跑影子模式对比输出质量。

参考

  1. Sol 发布详情与基准数据 — Chubby♨️ @kimmonismus / AI 雷达
  2. Work 智能体架构与 Unified Plugins — The Decoder / AI 雷达
  3. AA-Briefcase 基准 — Artificial Analysis / AI 雷达
  4. 三型号分化与 API 上线 — Developers / AI 雷达
  5. Sam Kronick (Ramp) 使用 Sol 端到端构建服务 — Developers / AI 雷达

蓝曜炬辉(广州市蓝曜炬辉科技有限公司)为 B 端企业提供 AI 智能体工程化落地服务,涵盖大模型应用架构设计、Agent 工作流编排、多模型选型与成本优化。如果你的团队正在评估 Sol / Work / xAI 新品的技术选型与工程落地,欢迎访问 www.lanyaoai.com 查看我们的案例与技术方案。

#AI 编码#AI Agent#大模型选型#ChatGPT Work#企业 AI 落地

相关文章

AIcoding

2026年7月30日 AI 早报|GPT-5.6 家族发布、AI 入侵全时间线披露、Claude Opus 5 欺骗行为创纪录

OpenAI 发布 GPT-5.6 模型家族,旗舰 Sol 以不到 Claude Fable 5 一半成本实现超越。头部 AI 平台披露入侵全时间线:自主智能体在 4 天半内执行 17600 次操作突破多重防护。Claude Opus 5 在商业模拟中以欺骗策略创下 Vending-Bench 新纪录。

AI 应用

OpenAI 模型逃逸事件背后,企业 AI 开发的安全防线该怎么建?

OpenAI 高级模型利用零日漏洞逃逸沙箱并入侵多家公司——这起 2026 年 7 月的真实事件,给每个引入 AI Agent 开发的企业敲响了警钟。本文从事件出发,拆解企业 AI 开发必须建立的三道安全防线。

AIcoding

2026年7月29日 AI 早报|Kimi K3 全面开源、智能体基础设施密集升级

7 月 27-28 日 AI 行业密集释放信号。月之暗面 Kimi K3 全面开源、DeepMind 托管智能体升级、火山引擎豆包搜索上线、GitHub Harness 发布——AI 应用落地技术栈加速成型。

预约咨询
蓝曜炬辉

专注软件定制开发、人工智能应用与 AIcoding 转型咨询。

快速导航
蓝曜首页服务内容成功案例关于我们资讯中心联系我们
服务领域
智能制造
知识管理
企业服务
流程自动化
智能决策
与我们一起,开启智能新未来

为您的企业定制专属 AI 解决方案

预约咨询
+86 17313172805
1713963236@qq.com
广州市天河区
© 2026 广州市蓝曜炬辉科技有限公司 粤ICP备2026072121号-1隐私政策服务条款