阿里开放 2.4T Qwen3.8 权重、OpenRouter 证明搜索预算比换模型更影响结果、加密推理过程可被 API 提取——三条动态指向同一工程结论:底座去锁、调参杠杆、安全隔离。
今日 AI 圈有 7 件值得关注的事:阿里深夜开放 2.4T 参数的开源大模型权重,这是 Qwen-Max 级别首次开源;微软推出首个自研推理模型 MAI-Thinking-1;Grok 4.6 与 Meta Muse Glimmer 同日亮相;两大头部聊天助手双双跨过 10 亿用户门槛。对企业来说,开源推理底座与智能体工具链正在快速成熟,AI 应用落地的成本曲线再次下移。
阿里 Qwen 团队 8 月 12 日深夜在魔搭社区宣布开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型第一次开源。该模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文,可扩展至 1,010,000 Token;每个 MoE 层有 512 个专家,每次路由 10 个专家并激活 1 个共享专家,官方云端版即基于这套权重。官方评测与 Opus 4.8、Fable 5、GPT 5.6 Sol 互有高低,在 PaperBench、IFBench 等基准取得较高成绩(IT之家 8 月 13 日报道)。
对企业意味着什么:超大 MoE 权重开放,长上下文智能体、复杂办公自动化任务有了可私有化微调的国产底座,不必再依赖闭源 API。做 AIcoding 全栈开发时,这类模型适合搭在数据不出域的企业环境里:用 256K 原生上下文承接长文档 RAG,用多步 MTP 支持推理引擎预判多个后续 Token,直接降低长链路任务的响应延迟。
微软 AI 负责人 Mustafa Suleyman 于 8 月 13 日宣布,微软首个完全从零构建的推理模型 MAI-Thinking-1 已上线 Microsoft Foundry。此前微软的 MAI 系列以端侧与商用模型为主,本次补上了自研推理链路,Azure 用户在推理模型选型上多了一个完全在微软体系内验证的选项(官方 X 账号发布)。
落地参考:云厂商把推理能力纳入自家体系,对使用 Azure 的中大型企业是利好——推理请求的合规边界、账单与数据链路可以收敛到同一家云。若贵司正评估把业务系统迁移到微软生态,可以让 AI 产品开发团队先跑一轮该模型与现有方案的对比,看长文档总结、代码审查这类高频场景的准确率与成本再定方案。
xAI 于 8 月 12 日晚发布 Grok 4.6,官方称其为前沿智能水平、相比 4.5 有显著提升,且定价保持不变。AIHOT 事件追踪显示,新模型在多项基准上比肩 Fable 5 与 GPT 5.6;按量付费用户升级无需重算成本(Elon Musk 官方 X 账号)。
给企业的建议:头部闭源模型连续同价升级,按量付费的推理成本被压住,做 AI 应用的企业可以更放心地把高频调用放在最新模型上。不过同价不等于同质,对涉及代码生成、结构化输出的场景建议先做小流量 A/B 再全量切换,避免把生产链路绑在刚发布的版本上。
Meta AI 超级智能实验室首个开放权重模型 Muse Glimmer 于 8 月 12 日在 OpenRouter 上线:30B 稠密文本+图像模型,Apache 2.0 许可证,定位可靠的本地智能体,MCP Atlas 得分 75.5,SWE-Bench Pro 得分 51.2。同一时间 SGLang 为它提供 Day-0 推理支持,30B 规模可在单卡或小集群上自托管(官方账号发布)。
企业视角:Apache 2.0 许可加 30B 稠密参数加 MCP 原生,这条组合几乎是为"本地跑智能体"设计的。对于重视数据隐私、又想落地智能体系统的团队,可以用这套模型在自有 GPU 上做工具调用与编码类任务的原型验证;结合 MCP 协议接入企业内网工具,就能在不出域的前提下把自动化流程跑起来。
The Verge 报道,OpenAI 在 8 月 6 日博文中确认其助手月活用户超 10 亿、7 月周活达 10 亿;谷歌 CEO 皮查伊则宣布 Gemini 月活已达 10 亿,成为谷歌史上增长最快的产品、也是谷歌第 14 个 10 亿用户级产品。对比之下,前者从 2 月周活 9 亿到 7 月 10 亿增长放缓,后者从 2 月月活 7.5 亿到上周 10 亿增速更猛;Anthropic 不披露数据,外界估计 Claude 用户仍在数千万级,里程碑数字均有官方口径背书(8 月 12 日发布)。
对企业有什么价值:10 亿级用户意味着 AI 聊天与工作助手已成为大众基础设施,企业员工对 AI 工具的接受度不再需要教育。做 AI 产品时,交互范式可以大胆参考头部产品:把助手做成"随时可对话的工作伙伴",而不是表单式工具;同时别忽略谷歌助手在安卓端的生态位——面向移动端用户的 AI 产品,优先兼容其生态可能比押注单一巨头更稳。
OpenRouter 8 月 12 日发布实时网页搜索基准,系统评测模型、搜索引擎、搜索方式与搜索预算四类配置。核心发现:把搜索预算从 1 轮增加到 25 轮,BrowseComp 得分近乎翻倍,成本只增加 2.5-7 倍;模型选择比引擎更重要,模型间平均分差 15 分、引擎间仅 10 分。榜单实时更新,失败率高的任务应降低搜索深度以控制成本(官方公告)。
怎么用起来:这条结论直接改写智能体工程的调参直觉——同样的模型,给足搜索轮次比换更贵的模型收益更大。做智能体系统时,建议把"搜索预算"做成可配置参数,按任务失败率动态调整:研究型任务给高预算,低失败率任务给低预算,能同时提升质量与控住 API 成本。
Alexander Panfilov 团队披露,OpenAI、Anthropic、Google 等主要 AI 提供商的 API 存在可读取推理模型加密思考过程的漏洞。扫描约 7000 条公开会话发现 62 个 API 密钥、33 个邮箱和 33 个密码;通过越狱,Anthropic 的 Haiku 4.5 可逐字转写 Opus 4.8 的原始推理;解码 10000 条推理轨迹的 API 成本约 720 美元。此问题最早可追溯到今年 5 月密码学专家 Matthew Green 发现的重放攻击(The Decoder 8 月 12 日报道)。
关键提醒:推理过程可被提取,意味着"让模型在思考里处理敏感信息"不再安全。企业接入第三方大模型 API 时,应把敏感数据脱敏放在提示词之外做,密码、密钥、客户隐私一律不进推理链路;同时把推理蒸馏风险纳入选型评估——若对手能低成本拿到你的推理轨迹,自研模型的护城河就要靠数据与工程补齐,这正是软件定制开发中需要提前设计的治理点。
上述基准中,Claude Opus 5 搭配 Perplexity 引擎在不同搜索预算下的浏览检索得分(成本为单次请求估算):
| 搜索预算 | 浏览检索得分 | 单次成本估算 |
|---|---|---|
| 1 轮 | 35.8% | $0.14 |
| 5 轮 | 66.5% | $0.51 |
| 25 轮 | 89.0% | $0.99 |
从 1 轮到 25 轮,得分提升近 1.5 倍,成本约增 7 倍——质量与成本并非线性,这正是智能体系统里值得专门调优的杠杆。
今天最值得注意的信号是:开源模型重新夺回话语权。阿里把 2.4T 参数的 Qwen-Max 级别权重直接开放,Meta 把 30B 的本地智能体模型放到 Apache 2.0 下,加上此前 DeepSeek、Kimi K3 的开源路线,企业做 AI 应用时"底座被单一厂商锁死"的顾虑正在被拆掉。对预算敏感、数据敏感的国内团队,这意味着可以把推理层部署在自有环境,把精力集中在业务层的应用开发上。
我们的判断是,接下来半年企业 AI 项目的竞争点不在模型本身,而在三件事:一是智能体的可靠性工程——搜索预算、工具调用、失败重试这类细节决定体验,实时基准已经证明调参空间很大;二是安全与合规治理——推理过程可被提取这类漏洞会让"敏感数据进模型"变成高危操作,需要从架构上做隔离;三是交付速度——模型升级节奏已经按月甚至按周推进,早一天上线早一天拿到数据反馈,用 AIcoding 方式把 App、Web、小程序、桌面端一起交付、工期缩短 50%,才能在窗口期内完成验证与迭代。做软件定制开发的团队,现在接单时应当默认把智能体能力、开源底座选型与安全边界写进方案,而不是当成可选项。
更多 AIcoding 全栈开发实践与 AI 应用落地内容,可查看博客专栏与客户案例。近期早报可延伸对比:7月21日:Kimi K3 开源与 Agent 架构突破、7月15日:AGI 时间表与端侧量化部署、7月16日:智能体对齐漏洞与无代码打包。需要评估贵司项目与 AI 的结合点、智能体系统的落地方案,可直接联系我们。
蓝曜炬辉专注 AIcoding 全栈开发与软件定制,覆盖 App、Web、小程序、桌面端与智能体系统。如果你的团队正在评估大模型选型、智能体落地或整体项目外包,欢迎预约 30 分钟免费咨询与 AI 转型评估,我们基于今日这类真实行业动态给出可执行的方案。