Anthropic 公开 Cowork 120 万会话数据:33.4% 用于业务运营、仅 8.7% 是软件开发;Liquid AI 开源 Antidoom 将推理模型死循环率从 22.9% 降至 1%;微软自研 MAI 替换第三方模型降本。
今天几条新闻指向同一个趋势:AI Agent 的战场正从「帮程序员写代码」外溢到「帮企业运转业务」,同时推理模型的工程化质量和成本结构也在剧烈重构。
Anthropic 在 7 月 7 日首次公开了 Claude Cowork 的使用数据。基于 5 月 11–31 日 120 万次匿名会话样本,最大使用类别是业务流程与运营——占 33.4%,场景包括汇总报告、入职检查清单、核对电子表格。内容创作与文案撰写占 16.4%(起草稿件、制作幻灯片),软件开发仅排第三,占 8.7%。(来源:Anthropic Blog)
结论很直接:约一半使用量来自「工作周边事务」——广泛存在于各岗位但很少是谁的核心职责。律师用它处理文档格式,招聘经理用它汇总面试反馈。正如我们此前在 AI 智能体改写软件工程的深度分析中所讨论的,Agent 产品的 PMF 应该围绕知识工作者的衔接性工作流设计,而非仅仅替代 IDE 自动补全。
同一天,开发者团队分享了内部高频使用的两种多智能体模式。Advisor(顾问)模式:Sonnet 5 执行主循环,遇高层判断时调用 Fable 5 获取指导。SWE-bench Pro 482 题上,组合方案拿到 Fable 5 约 92% 的分数、仅 63% 的价格。Orchestrator(编排者)模式更激进:Fable 5 做规划、向多个 Sonnet 5 worker 扇出任务,BrowseComp 上 96% 性能、仅 46% 成本。(来源:@shao__meng)
多模型协同不是炫技,是实打实的省钱公式——聪明模型做规划、便宜模型干苦力。继 Sonnet 5 发布后,模型组合策略正在取代模型本身成为差异化来源。
推理模型有一个顽固问题——doom loop:输出一段文本后不断重复直到上下文耗尽,小型推理模型在长思考轨迹上尤其容易触发。Liquid AI 7 月 7 日开源了 Antidoom,基于 Final Token Preference Optimization(FTPO)做针对性修复。(来源:MarkTechPost)
该方法定位循环的第一个 token,训练模型在该位置选择连贯替代项,其他分布基本不变——「精准手术」而非「全身麻醉」:
| 模型 | 修复前循环率 | 修复后循环率 |
|---|---|---|
| LFM2.5-2.6B | 10.2% | 1.4% |
| Qwen3.5-4B | 22.9% | 1.0% |
整套流程数小时可完成,代码与数据集(LiquidAI/antidoom-mix-v1.0)全部开源。对自己训模型或微调开源模型的团队,这可以直接集成进训练管线。
据彭博社报道,微软正在 Copilot 产品中逐步将 OpenAI 和 Anthropic 模型替换为自研 MAI。MAI 已进入 Excel、Outlook 和 GitHub Copilot,每周处理数万次请求。AI 负责人 Mustafa Suleyman 在 6 月公开确认目标是「减少并最终消除」对 Anthropic 的支出。(来源:The Decoder / Bloomberg)
但基准测试不乐观:MAI-Thinking 1 号称编码媲美 Sonnet 4.6 和 Opus 4.6,实测仅与 DeepSeek V3.2 相当。CEO Satya Nadella 还暗示 MAI 为默认、第三方模型付费附加——用户支付同样价格,得到更弱的 AI。依赖 Copilot 的中国企业团队,现在就该重新评估哪些环节真正依赖旗舰模型。
蚂蚁副总裁周俊在 7 月 8 日 AICon 演讲中给出震撼数字:万亿参数模型每运行 15 分钟,算力成本约等于一辆特斯拉。团队提出从「更多 Token」转向「更高 Token 密度」策略,采用 7 份 Lightning Attention + 1 份 MLA 的混合线性注意力架构,256K 长上下文成本从指数级降至线性级。配合 Kpop 算法区分工具调用与自然语言 Token,输出减少约 4 倍而能力不降。(来源:蚂蚁百灵)
对国内企业 AI 应用开发,这指向务实路径:架构层面的效率优化——混合注意力、Token 密度提升、思维链剪枝——能让千亿参数模型在 Agent 任务中超越部分更大模型。这与我们观察到的 AI 编程效率持续提升趋势一致:工程优化带来的性价比提升,往往比等待更强模型更实际。
Code 是面向开发者的终端 CLI 工具,Cowork 将相同 Agent 能力延伸到聊天界面,面向所有知识工作者。底层能力一致,交互范式不同——命令行 vs 对话。
不。已在 LFM2.5-2.6B 和 Qwen3.5-4B 上验证,方法通用。FTPO 训练只需数小时,任何面临推理循环问题的小型模型都可接入。代码已开源在 HuggingFace。
已确认:Excel Copilot、Outlook Copilot、GitHub Copilot。Teams 预计将搭载自研转录模型。按 CEO 暗示,MAI 可能成为默认选项,OpenAI/Anthropic 模型转为付费附加。