2026年7月7日,Anthropic和Google同一天发布后台运行能力。关掉电脑后智能体自己跑通宵——这不是概念验证,是已上线产品。对企业交付团队意味着什么?
这不是路线图更新,是两个已经上线的产品。2026年已经过半,对做软件交付的团队来说,问题已经从"能不能用"变成了"它在后台跑了,我们的流程要怎么改"。
Anthropic和Google各自独立研发,却选在同一天亮出几乎相同的能力方向:后台执行、跨设备、人在回路通知。这不是巧合。
Claude Cowork这侧,2026年1月上线桌面端,7月7日扩展至移动端和网页端。Beta版Max用户优先,使用限额翻倍至8月5日。核心机制:桌面端分配任务 → 关闭电脑 → 云端后台继续执行 → 遇到需要你拍板的事推手机通知 → 你在通勤/开会间隙审核。支持定时任务——比如设"周一早上6点自动准备客户简报",系统自己拉邮件线程、通话记录和行业新闻,生成简报文档和待发邮件草稿。官方原话:"你的工作会随你而行,也会在你离开时继续推进。"
Gemini这侧,Managed Agents从"模型端点"进化为智能体基础设施。四项更新逐个拆:后台任务——服务端异步执行,不依赖HTTP长连接,长任务不再因请求超时而中断;远程MCP——直连企业内部可观测性系统、数据库、私有API,不需再搭代理中间件;函数调用——Google运行沙箱工具,应用端处理业务逻辑,两者解耦;凭证刷新——短寿命token轮换不掉沙箱状态,解决生产环境最头疼的认证中断。免费层同步开放。
两家的路径不同:Anthropic走"面向终端知识工作者的产品化方案",Google走"面向开发者的基础设施"。但底层判断一致——智能体正从请求-响应模式走向持续运行模式。两家用各自实现验证了同一个结论:2026下半年,异步执行不再是实验特性,是标配。
Anthropic在7月7日同步公开了使用数据:基于2026年5月11日至31日、来自超过60万个组织的120万次匿名Cowork会话。这份数据打破了一个常见误解——"智能体主要是程序员在用"。
实际分布:业务流程与运营占33.4%(汇总报告、核对表格、建入职清单),内容创作与文案占16.4%(写稿件、做演示、写提案),软件开发仅8.7%。前两大类别加起来占了总使用量的一半。官方把这称为"围绕工作的工作"——很少出现在任何人的岗位描述里,却占据每周大量时间。律师用它处理文档格式和归档,招聘经理用它汇总面试反馈,团队负责人用它做幻灯片解释艰难决策。
这对企业交付团队意味着什么?这个能力最大的价值不在替代程序员写代码,而在消除"衔接性工作"——不同角色之间的信息传递、格式转换、进度追踪。团队里最有经验的工程师每天花多少时间写状态更新、做演示文稿、整理会议纪要?这些才是后台运行最先接管的活。
如果说Cowork是面向终端用户的"产品",Gemini Managed Agents就是面向开发者的"运行时"。两者服务不同人群,底层都在解决同一个命题:让智能体在你不盯着的时候可靠运行。
Gemini这侧最值得关注的架构创新是Interaction对象。旧的应用里,开发者必须手动追踪每一轮对话、每次工具调用、每个返回结果——任务一旦超过HTTP请求的超时窗口就崩。Interaction对象让Google在服务端自动追踪任务、模型步骤、工具调用和最终输出。应用端不需要自己维护状态机,后台执行的可靠性从"开发者自己保证"变成"平台保证"。
远程MCP的价值更直接:以前要连企业内部系统,得在中间搭一层代理把私有API翻译成可调用的工具。现在通过远程MCP直连——可观测性、数据库、内部API,Google Search和代码执行之外,企业的私有工具链直接变成能力集。结合免费层的开放,基本宣告了"搭基础设施"的门槛从几十万降到零。
| 维度 | Claude Cowork | Gemini Managed Agents |
|---|---|---|
| 目标用户 | 知识工作者(产品/运营/管理层) | 开发者 / 工程团队 |
| 运行方式 | Anthropic云端后台 + 跨设备同步 | Google托管Linux沙箱异步执行 |
| 人在回路 | 手机推送通知审核关键决策 | Interaction对象服务端追踪,应用层控制 |
| 工具连接 | 内置集成(邮件/日历/Slack/文件) | 远程MCP直连私有服务+Google生态 |
| 适用场景 | 业务运营、内容创作、跨团队衔接工作 | 构建生产级应用、CI/CD集成 |
| 定价 | Max订阅(测试期限额翻倍至8/5) | 免费层 + 按量付费 |
同一天还有第三条值得关注的消息:Fable 5发布后,Elvis Saravia在X上提出的编排策略引发广泛共鸣——"大多数任务不需要Fable 5。你可以用Opus 4.8/Fable 5做规划,用GPT-5.5执行,用GLM-5.2做设计。通过精心编排,你可以更好地最大化利用模型token。"
这个观点和异步执行趋势高度相关。当任务在后台跑通宵时,你不会想让它全程用最贵的模型做所有事——那跟烧钱没区别。合理的策略是:规划阶段用强推理模型定方向,执行阶段用性价比模型批量跑,设计/输出阶段用擅长格式化的模型收尾。这不仅是成本优化,也是可靠性优化——不同模型在不同任务类型上的失败模式不同,编排得当可以互相兜底。
一个反例:7月7日Y Combinator CEO Garry Tan宣称他和AI编码工具每天在五个项目中部署37000行代码,连续72天发布。但波兰开发者Gregorein审查其网站前端代码后发现:页面加载169次请求、总计6.42MB(对比Hacker News仅7次12KB)、28个测试文件、78个未使用的JavaScript控制器、八种格式的Logo文件。这不是在质疑AI的能力——而是在说明后台跑出来的代码如果不经审查就上线,技术债会以极高速度累积。这也解释了为什么90%的企业智能体走不出POC——不是因为模型不够强,而是工程化没跟上。异步执行放大产出效率的同时,也放大了质量风险。
第一,CI/CD流程里多了一个"自动审查者"。异步能力最自然的嵌入点是代码审查环节。PR提交后,后台自动跑一遍——检查安全漏洞、风格一致性、测试覆盖率、依赖版本冲突——然后把结果贴在PR评论区。人类reviewer不再从零读diff,而是基于审查结果做判断。蓝曜炬辉在2026年上半年的几个交付项目中已经验证了这个模式——从Demo到生产环境,自动审查先过一轮后,人工时间平均减少40%,但前提是检查规则需要根据具体项目的技术栈和编码规范做定制——直接用默认规则会产出大量误报,反而拖慢流程。
第二,团队结构从"写代码的人"向"编排智能体的人"偏移。Cowork数据显示90%的使用场景不是编程——说明这项能力正在吃掉的是衔接性工作,不是核心工程判断。当AI编程进入智能体时代,对交付团队来说,初级工程师花在写CRUD代码上的时间会被大幅压缩,但系统设计、技术选型、编排策略、异常处理流程设计这些决策层的工作会更加重要。一个会编排多个智能体协同工作的工程师,产出会远超一个只会自己写代码的工程师。
第三,交付周期从"人天"变成"机器小时+人审核分钟"。但不是所有环节都适合异步接管。适合的:代码生成、文档撰写、测试用例编写、部署脚本生成、变更日志整理。不适合的:架构决策、安全策略审批、客户需求澄清。划分清楚这个边界,比盲目追求"全自动化"重要得多。
不需要。任务分配后,执行在Anthropic云端完成。你可以关闭电脑、合上笔记本,它继续跑。定时任务(如"周一早上6点准备简报")也不需要任何设备在线。这和传统智能体依赖本地客户端运行有本质区别。
同步:你发指令 → 它执行 → 你等结果,整个过程在一个会话连接内完成。异步:你发指令 → 它进入后台任务队列 → 你可以断开连接 → 它完成后通知你。核心差异在于执行环境从"请求生命周期"变成了"任务生命周期",任务时长从秒级扩展到小时级甚至天级。
取决于接入场景。如果是"先自动审查+人复核"这种嵌入现有流程的模式,试点2-4周就能看到人工时间的量化减少。如果是"接管跨团队衔接性工作"(状态报告、会议纪要整理、客户简报准备),从120万会话数据来看,这些恰好是占比最高的使用场景,意味着大量企业已经在拿这些环节做实验。建议从单一、可量化的场景开始,不要试图一步到位改造全流程。
不是二选一。前者是给终端知识工作者用的产品——如果运营、产品、管理层需要处理日常衔接工作,用它。后者是给工程团队构建应用的平台——如果要在CI/CD、内部工具、客户交付流程中嵌入能力,用它。两者的关系不是竞争,是一个管"产品化",一个管"工程化"。
蓝曜炬辉(广州市蓝曜炬辉科技有限公司)专注 AI 应用工程化与企业软件交付。如果你的团队正在评估异步智能体如何嵌入现有 CI/CD 流程,或需要定制编排策略,联系我们获取项目评估。
]]>