阿里首次开源 Qwen-Max 级权重(2.4T 激活 95B、缓存输入 0.25 美元),DeepSeek Harness v0.1 以「一切皆插件」开源,Anthropic 多智能体实验显示协调式集群漏洞发现量是独立并行的 12 倍以上——开源底座、插件生态与多智能体成本三条线交汇,企业 AI 选型窗口正在重新打开。
今天 AI 圈至少有 8 件事值得企业技术负责人留意:阿里把 Qwen-Max 级别模型权重第一次开源(2.4T 参数、激活仅 95B,缓存输入每百万 token 只要 0.25 美元),V4-Pro 正式版上线并把闲时价格打到高峰一半,xAI 的 Grok 4.6 在智能体综合指数上追平 GPT-5.6 Sol。模型密度、自动执行能力、开源框架在同一天扎堆推进,企业选型窗口正在重新打开。
8 月 13 日,阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重。这是 Qwen-Max 级别模型首次开源:总参数 2.4T、每个 Token 激活 95B,原生支持 262,144 Token 上下文,可扩展至 1,010,000 Token;硅基流动、SGLang 与 Miles 均在首日提供支持。API 定价输入 2.00 美元 / 百万 token、输出 6.00 美元、缓存输入 0.25 美元,主打自主编码、深度研究与端到端智能体执行。
对企业而言,缓存输入压到 0.25 美元意味着需要反复读取长上下文的自动化工作流(代码库理解、长文档处理)可以长期挂机而不用反复烧钱。对正在做 AIcoding 选型的团队,这是把"开源自部署"与"API 低成本"结合的新选项,尤其适合数据合规要求高、必须私有化部署的行业客户,同等预算可以跑更大的上下文窗口。
详见 Qwen 开源公告详情。
V4-Pro 正式版于 8 月 13 日在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可调用。其任务执行能力显著提升:HLE(wo/w tools)达 42.7/60.0,Terminal Bench 2.1 为 87.9,并推出峰谷定价,闲时成本降至高峰一半。发布与 Grok 4.6 相隔不到 2 小时,两个模型同为 1.6T / 1.5T 参数级别。
落到企业场景,峰谷定价对批处理类 AI 应用是实打实的成本红利。凡是延迟不敏感的任务——夜间批量测试、文档批量生成、代码扫描——都可以切到闲时窗口执行,直接砍掉一半推理预算。我们给客户做 AI 应用成本评估时,一直建议把"可延迟负载"单独拆出来排队,这一策略让优化更容易落地。
8 月 12 日,xAI 发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。官方称其在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。即日起在 Cursor 和 Grok Build 中可用,第一周提供 2 倍包含用量。
官方强调"把一个宽泛产品想法转化为可运行初版"的能力,这正是 AIcoding 全栈开发最看重的场景。长时运行意味着 AI 可以连续几个小时跨多个代码库协作而不掉线,对做 Web 应用、小程序和桌面端原型的团队,这类模型可以直接缩短从需求到首版 Demo 的周期,也让 AI 应用定制开发的交付节奏更快。
官方说明见 xAI 发布公告。
8 月 13 日,DeepSeek 推出 Harness v0.1 开发者预览版,以 MIT 许可证开源整个代码库。框架基于 Cordis 元框架构建,核心设计是"一切皆插件"——模型、工具、技能、会话、沙箱、文件系统、循环、编排及 UI 均可自由组合、替换和扩展。IT 之家报道将其定位为对标 Claude Cowork 并开放插件生态。
对企业而言,智能体框架从"整体选型"转向"逐组件比较",迁移成本被大幅降低。对已经在跑自动化系统、但被单一编排方案绑定的团队,插件化框架意味着模型厂商、工具链可以按需替换,不必推倒重来;落地时优先考虑可插拔架构,能显著降低后期改造成本。
Anthropic 于 8 月 13 日发布多智能体系统研究报告:45 个协调智能体在 2700 万 token 运行中发现 266 个漏洞,而独立并行方法在 650 万 token 中发现 21 个,两种方法仅 12 个重叠;协调智能体还学会了专业化分工。研究同时警示,个体层面的良性行为怪癖可能叠加为意外的系统性失败。
实际意义在于,多智能体协作不是"人多力量大"——协调带来更高覆盖率,但 token 成本高出数倍,且需要仲裁机制避免错误叠加。给企业做系统落地时,我们通常按任务复杂度分级:可并行拆解的任务用独立智能体控制成本,需要深度交叉检查的任务(如安全扫描、代码审计)才上协调式集群,并配独立的评审环节兜底。
研究全文见 Anthropic 研究报告。
小红书 dots 团队 8 月 13 日开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。连续自回归设计跳过离散 Token 的信息损失,并用语义编码器回灌历史抑制累积误差。
对企业而言,开源 TTS 基座让语音交互类应用不再依赖商用 API 的高价调用。做客服机器人、语音助手、有声内容生成的团队,可以把 dots.tts 作为私有化语音合成的底座,音色克隆与低步数流式共用同一基座,适合对数据出境敏感、要求本地部署的企业场景。
技术介绍见 小红书技术说明。
WorkBuddy 8 月 13 日更新上线远程控制功能,将 PC、App 和小程序打通。手机端可实时同步电脑端的任务、对话、工作空间和产物,支持一台手机连接多台电脑并随时切换,连接无需扫码。App 需升级至 1.2.0 及以上,电脑端 5.3.8 及以上;更新还新增资料库、Markdown 多人共同编辑、AI 原生审阅模式。
落到企业场景,长任务跑在电脑上、人不在电脑前也能随时接管,让自动化工作流真正进入移动办公。对远程协作团队,把任务状态同步到手机端意味着技术负责人可以在通勤路上查看进度、在会议室直接干预任务,AI 从"工具"变成了"可远程管理的数字员工"。
更新详情见 WorkBuddy 更新介绍。
MiniMax 8 月 13 日推出 Music 3.0 音乐生成模型,只需提供创意概念和可选歌词,即可在单次生成中完成一首完整歌曲的作曲、编曲、演奏和制作,最长支持五分钟。官方称其为开源权重、生产级全能音乐模型。技术架构包括 8B 全局大语言模型(基于 Qwen3.5-8B 初始化)与 0.6B 局部大语言模型的层级协作。
对企业而言,音乐、视频这类多模态生成能力正在变成"基础设施"。对做内容类应用、营销素材自动化的团队,开源权重的音乐模型意味着可以本地批量生成配乐,无需为每条素材支付 API 费用;这也提示全栈 AI 应用开发中,多模态能力模块应该像代码一样可插拔、可自部署。
官方博客见 MiniMax Music 3.0 介绍。
| 模型 | 参数量 | 输入价格(百万 token) | 关键能力点 |
|---|---|---|---|
| Qwen3.8-2.4T-A95B | 2.4T(激活 95B) | $2.00 / 缓存 $0.25 | 自主编码、端到端执行、256K 上下文 |
| DeepSeek-V4-Pro | 约 1.6T | 峰谷定价,闲时半价 | Terminal Bench 2.1 = 87.9 |
| Grok 4.6 | 约 1.5T | 输入 $2.00 | 长时运行,AA 指数追平 GPT-5.6 Sol |
三款模型的共同信号:推理成本持续走低 + 自动执行能力成为主战场,企业选模型不再只看单次问答质量,而是看"挂机跑任务"的综合成本。
今天这 8 条新闻串起来,只有一句话:AI 的能力重心从"会聊天"彻底转向"能干活"。Qwen 把 2.4T 参数的模型开源到可以本地部署,另一家头部厂商用峰谷定价把批处理成本砍半,Grok 4.6 直接冲着"把一个想法变成可运行项目"去,Anthropic 则把多智能体协作从口号变成了可量化的实验数据——协调式集群发现的漏洞数是独立并行的 12 倍以上。
对企业意味着什么?第一,选型窗口期重新打开:开源权重 + 低价 API + 插件化框架同时出现,之前"被某一家模型绑定"的顾虑可以放下,AI 应用架构应该按模型能力、成本、数据合规三要素重新评估。第二,自动化正在从演示走向生产:长时运行、远程控制、多智能体编排这些词高频出现,说明客户真正想要的是"能连续干几个小时活、出可交付产物"的数字员工,而不是单轮问答机器人。第三,成本结构变了:缓存输入 0.25 美元、闲时半价、开源自部署,三条路同时压低 AI 应用的总拥有成本,之前因算力成本不敢做的项目现在可以重新算账。
这正是蓝曜炬辉 AIcoding 全栈开发服务所在的战场。我们把大模型能力封装进 App、Web、小程序、桌面端,帮企业搭自动化系统并解决长时任务的稳定性问题——从模型路由、工具调用、上下文管理到成本优化,一套完整的工程化方案。我们实测下来,用 AIcoding 方式交付,常见业务系统的开发工期可以缩短约 50%,因为重复性编码交给模型、工程师专注架构和业务逻辑。今天这些模型进展,只会让这套流程更快、更便宜。如果你的团队正考虑 AI 应用落地或软件定制开发,值得用 30 分钟聊聊你手头的具体场景,看哪条路成本最优。
今日事件可对照往期早报延伸理解:Kimi K3 开源与 Agent Swarm 树状架构、Anthropic 披露的智能体对齐漏洞、ChatGPT 模型升级与 OpenAI 收入结构。更多深度文章与案例可访问 博客列表 与 案例库。早报每日更新,模型选型、Agent 架构、AIcoding 落地经验均有长期沉淀。
如果你的团队正在评估 AI 应用落地、自动化系统搭建或全栈 AI 开发,欢迎预约 30 分钟免费咨询,我们会结合你的业务场景给出 AIcoding 转型评估与技术选型建议。点击 联系我们 即可。