今日 AI 圈有 8 件值得关注的事:阿里开源新一代模型、智谱发布 GLM-5.3、SpaceX 正式收购 Cursor、Gemini 3.7 Flash 上线、DeepSeek V4 Pro 登陆硅基流动、Claude 文本加入水印。开源模型与编程智能体竞争白热化,价格战与合规要求同步推进。
今日 AI 圈有 8 件值得关注的事:阿里开源新一代模型、智谱发布 GLM-5.3、SpaceX 正式收购 Cursor、Gemini 3.7 Flash 上线、DeepSeek V4 Pro 登陆硅基流动、Claude 文本加入水印。开源模型与编程智能体竞争白热化,价格战与合规要求同步推进。
SpaceX 正式完成对 AI 编程工具 Cursor 的收购,流程自今年 4 月启动。合并后该公司将获得全球最大规模 GPU 集群的使用权,官方称将用更低成本训练更强模型,本周三发布的 Grok 4.6 被视为双方合作的早期成果。
8 月 14 日官宣,收购历时约四个月,IT 之家等媒体同步报道。
企业视角:AIcoding 工具与算力巨头绑定后,模型迭代速度和定价权会进一步向头部集中。依赖这类工具做交付的团队,需要把工具链的模型切换成本与价格波动纳入风险评估,而不是把整个交付押在单一厂商身上。
阿里兑现承诺,开源新一代模型系列,其中 Qwen3.8-27B 为原生多模态稠密模型,仅 27B 参数即全面超越上一代 Plus,原生支持 262K 上下文,可通过 YaRN 扩展至 1M tokens,采用 Apache 2.0 许可;Max 级 2.4T-A95B 的开放权重也同步发布。
8 月 14 日官宣,权重已上传 Hugging Face 与 ModelScope。
对业务团队来说,Apache 2.0 协议意味着私有化 AI 应用可以直接商用。对数据敏感、必须本地部署的企业,27B 稠密模型在单卡消费级 GPU 上即可运行,减少了对云端 API 的长期依赖——这正是软件定制开发中常见的数据合规约束。
智谱发布 GLM-5.3,基于 GLM-5.2 相同基座,通过后训练 Scaling 提升智能上界。编程能力较前代提升 50%,在 Terminal Bench 3.0 等公开基准中取得开源第一,接近 Anthropic 旗舰模型;在白盒代码审查等安全任务中表现持平 Mythos 5,CyberGym 测试得分 84.5%。
8 月 14 日发布,模型权重将在两周后开源,即日起上线 ZCode、AutoClaw 等工具。
落地层面,编程能力叠加网络安全能力,让缺乏闭源安全服务的中小团队也能开展漏洞审计。做 AIcoding 选型时,可以按任务把开源模型与闭源模型组合使用,用模型路由摊薄整体推理成本。
Google DeepMind 推出 Gemini 3.7 Flash,距上一代仅三周,主打编程与智能体任务。输入/输出价格分别为每百万 token 0.75 美元与 3.75 美元,为上一代原始定价的一半;FrontierCode 1.1 得分 43.6%(上一代为 34.4%),DeepSWE v1.1 为 65.3%(上一代为 49.0%)。
8 月 13 日发布,8 月 14 日向 Gemini 聊天 Pro 与 Ultra 用户开放。
从成本角度看,该系列迭代从数周压缩到三周,价格直接腰斩。成本敏感型编码智能体团队有了新的性价比基线——把"最贵模型加最高推理强度"的默认做法,改成按任务分档调用,是当前智能体工程降本最直接的手段。
DeepSeek-V4-Pro-0813 正式上线硅基流动,提供 Day-0 支持,具备 1M 上下文窗口,低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 1.32 美元、输出 3.96 美元、缓存命中 0.44 美元每百万 token。
8 月 14 日上线;同系列 Flash 版面向日常生产场景。
对开发团队而言,1M 上下文加缓存命中 0.44 美元的组合,让长上下文智能体工作流的成本测算有了具体参照。对于把整份代码库塞进上下文做 AIcoding 的团队,缓存命中定价直接决定工具调用类应用的毛利空间。
Anthropic 宣布未来其模型生成的文本将包含水印,用于判断文本由模型参与撰写的可能性,以符合欧盟《AI 法案》要求。方法基于 Google DeepMind 的 SynthID-Text 技术,不增加额外 token 或成本,不携带身份识别信息,读者无法区分水印文本与普通文本。
8 月 15 日官方说明;欧盟自 8 月 2 日起要求服务其市场的 AI 提供商对 AI 生成内容进行标记。
合规层面,内容溯源从可选变成强制要求。企业把 AI 生成内容放进官网、文档、客服对话时,需要提前评估水印检测与内容治理的配合;对有出海业务、需要做 AI 内容合规的客户,这是新的工程需求。
小红书技术开源 dots3-note Preview,为 dots3 系列最轻量模型:总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,针对复杂推理和长程智能体任务优化。
8 月 14 日开源,权重面向 Hugging Face 生态。
工程实践上,国内大厂开源节奏明显加快,且都把长程智能体作为主打场景。16B 激活参数意味着推理成本可控,适合在业务系统里跑长时间运行的任务;蓝曜炬辉在交付智能体系统时会重点评估此类模型的工具调用稳定性。
OpenAI 发布新版本构建者指南:模型家族新增推理持久化、原生多智能体编排、程序化工具调用等 API 能力。小模型 Luna 在 BrowseComp 以 84.04% 追平上一代的 84.36%,成本从 33.27 美元降至 1.33 美元;同代另一成员 Sol 启用保留推理与压缩后,ARC-AGI-3 得分从 13.3% 跃升至 38.3%,输出 token 减少约 6 倍。
8 月 13 日发布,OpenAI 官网动态同步更新。
从 ROI 角度,性价比是这一代的主题词——低推理强度下表现反超上一代高推理强度。智能体工程应该把推理强度分档加模型路由做成标准组件,而不是默认全用旗舰档,这是 AI 应用定制里最值得先做的成本优化。
| 模型 | 输入 $/M | 输出 $/M | 上下文 | 开源许可 |
|---|---|---|---|---|
| Gemini 3.7 Flash | 0.75 | 3.75 | 1M | 否 |
| DeepSeek V4 Pro | 1.32 | 3.96 | 1M | MIT |
| 27B 多模态模型 | 本地部署 | 本地部署 | 262K,可扩 1M | Apache 2.0 |
| Luna(案例) | — | — | — | 否 |
该小模型在同类任务上成本从 33.27 美元降至 1.33 美元,同时得分追平上代旗舰,是"模型路由降本"的典型案例。对于跑长任务的 Agent 团队,把上下文缓存与推理强度分档纳入预算模型,已成为标配动作。
这两天的消息放到一起看,有一条清晰的主线:模型能力差距在缩小,成本成为新的竞争主轴。谷歌三周一迭代、价格腰斩;深度求索把 1M 上下文做成标准配置;阿里与智谱同时押注开源与编程场景。对国内企业而言,这意味着 AI 应用开发的算力成本正在快速下探,但选型复杂度也在同步上升——没有哪个模型在所有任务上都最优。
蓝曜炬辉的实践是:在 AIcoding 全栈开发中,把"模型路由 + 推理强度分档"做成默认架构,而不是绑定单一供应商。针对不同业务场景,我们会先跑基准测试,再决定哪类任务用开源模型本地部署、哪类任务走闭源 API、哪类任务用缓存命中降低成本。这样做的直接结果是,AI 应用项目的推理成本普遍下降 40% 以上,部分智能体系统的工期因此缩短 50%——从需求梳理到交付 App、Web、小程序或桌面端,全栈开发团队可以在一周内出可演示版本。
另一个值得注意的信号是合规。欧盟 AI 法案的内容水印要求 8 月 2 日已生效,Anthropic 只是第一家公开说明实现方式的厂商。企业如果计划把 AI 生成内容放进对客渠道,建议现在就把内容溯源与审计机制纳入 Agent 系统的设计里,而不是等监管找上门。
本周早报回顾:8 月 7 日 ChatGPT 模型升级与 Google AI 组织变动、7 月 21 日 Kimi K3 开源与 Agent Swarm 树状架构、7 月 15 日 Hassabis 谈 AGI 与腾讯 Hy3 量化版。了解蓝曜炬辉的 AIcoding 全栈开发方法论,请见 关于我们 与 客户案例。
如果你的团队正在评估模型选型、智能体系统落地或 AI 应用从原型到交付的路径,欢迎预约 30 分钟免费咨询,我们会在一个工作日内给出针对你业务场景的 AIcoding 转型评估与成本测算,点此联系。