9月3日 AI 早报:谷歌发布 Gemini 3.8 双版本;通义千问登顶编码竞技场;英伟达拟 129 亿美元收购开源模型平台。
9 月 3 日,编码与智能体是主线:谷歌 DeepMind 六周内第三次迭代 Flash 系列,Gemini 3.8 推理与编码明显增强且不加价;通义千问新版本以 1,691 分登顶 Code Arena;英伟达被曝接近 129 亿美元收购开源模型平台。多家厂商的动作——后台接管电脑、开源电商智能体、编码成本治理——都值得工程团队逐条对照。
谷歌 DeepMind 在六周内第三次更新 Flash 系列,推出 3.8 Flash 与专门的 Cyber 网络安全版。前者定位最聪明的多面手,在软件工程、智能体任务与专业领域多步推理上相对 3.7 提升明显;后者是该公司目前最强的网络安全模型,漏洞检测与自动修复达到前沿水平,先通过 Fairwind 计划向受信任的防御者开放。
价格与上一代保持一致:每百万输入 token 0.75 美元、输出 3.75 美元;在 HLE-Verified 上拿到 54.9%,内部覆盖 20 种编程语言的漏洞修复基准成功率超过 70%。
两个细节值得交付团队留意。一是新模型在长任务里会更主动地追加推理与工具调用,官方直言它变“卖力”了——同等任务可能烧更多词元,接入前最好先跑一轮成本基线。二是安全能力被单独做成产品线,说明企业对自动化漏洞发现的需求已成规模。做 AIcoding 全栈开发的团队可以把这条当成选型信号:编码模型换代的窗口里,先拿自己的真实仓库做回归,再决定是否升级,别被榜单带着走。官方发布说明
阿里通义千问发布新版本,在 Code Arena 的 WebDev 赛道首次亮相即排到总榜第一。官方强调,在 5 美元/百万词元的混合价档位,它是帕累托前沿上得分最高的模型,目前已在 QwenCloud 开放试用。
1,691 分登顶 WebDev 榜单;事件后续披露参数规模约 2.4T、上下文 1M,发布时间为北京时间 9 月 2 日上午。
国产模型在编码场景的性价比卡位越来越准:价格压到个位数美元,排名却压过更贵的对手。对企业来说,这直接改变 AI 应用开发的成本结构——同样的预算可以支撑更大规模的自动化编码试点。我们的建议是拿典型业务模块做一次双模型对比(国产低价模型与头部高价模型各跑一遍),用真实代码库的通过率决定默认模型,而不是默认选最贵或最熟悉的那个。官方推文整理
| 模型 | 定位 | 价格 | 亮点 |
|---|---|---|---|
| 3.8 双版本 | 通用编码与推理 | 输入 0.75、输出 3.75 美元/百万词元 | HLE-Verified 54.9% |
| Qwen3.8-Max-0902 | WebDev 编码赛道 | 混合约 5 美元/百万词元 | 编码榜总分第一 |
两条信息都来自对应厂商当天发布的官方口径,可作为评估旧模型迁移与预算规划的起点。
彭博与 The Information 先后报道,英伟达正接近以约 129 亿美元收购 Hugging Face,交易总额可能到 140 亿美元。双方尚未签最终协议,数字仍可能变动。
129 亿美元约为该平台 2023 年融资估值的 2.9 倍;按约 1.5 亿美元年化收入计算相当于 86 倍;英伟达还谈到附带 10 亿美元的员工留任方案。
模型与数据的分发平台若并入算力厂商,开源生态的话语权会进一步集中。对国内做软件定制开发的公司,短期内不必恐慌——现有开源仓库与镜像体系照常运行,但中长期应把模型权重与数据的获取通道做冗余设计,避免单一平台策略。自建模型仓库、走国产镜像,都是成本不高的对冲手段。彭博报道整理
Anthropic 旗下两款编程与协作工具新增后台使用电脑的能力:把任务交代给模型后,它会像人一样点击、输入、打开应用,用户不必守在屏幕前等待每一步确认。
官方推文发布于北京时间 9 月 3 日凌晨 3 点 06 分,属于当日更新的桌面端能力。
这一步把“人在回路”从每步批准放松为任务级委托,意味着更多重复的桌面操作(整理文件、填表单、跨应用搬运数据)可以自动化。对正在规划内部效率工具的团队,可以从最不容易出错的任务入手试点,先把权限边界和可回滚的沙箱环境做好,再逐步扩大模型能触碰的系统范围。这类桌面级 Agent 与企业系统的结合,正是 AI 应用定制里需求增长最快的方向之一。官方公告
Anthropic 基于与零售、旅游、电信团队一年的合作经验发布电商 Agent 构建指南,并开源一个参考实现,内含购物与商家两类智能体的脚手架、护栏与评测框架。
指南把最关键的架构决策浓缩成一句:用单个 Claude 在标准循环里配技能与工具,而不是按业务领域拆一堆子智能体;发布日期为 9 月 2 日。
这条对我们做 Agent 系统的同行是重要的纠偏信号。早期很多项目(包括我们自己)习惯把客服、订单、营销各拆一个子智能体,结果系统复杂度随数量指数上升。用技能与工具挂到同一个循环上,长尾需求由技能补齐、外部系统走工具调用,维护成本低得多。给客户的方案里,如果第一版就出现三个以上智能体节点,建议先回头审视是不是过度设计了。官方工程博客
Cursor 发布自托管执行方案:云智能体的工具执行可以落到企业自有网络内的机器上,代码仓库、内部服务与构建流水线都留在本地;智能体循环、推理与规划仍在厂商云端,通过 Worker 的出站 HTTPS 连接协作,厂商不会主动连入企业网络。
该公司披露云端智能体已贡献其内部合并请求的 60% 以上;新方案支持 AWS Lambda MicroVMs 等沙箱,机器可从快照近即时启动、空闲挂起。
数据敏感型企业的最大顾虑一直是代码出了内网,这个方案把执行边界画清楚了:出网的只有推理请求与结果,源码不出境。对银行、制造、医疗这类行业客户,私有化执行会成为采购智能编码工具的硬性条件。第三方软件定制开发团队在做方案时,应把“哪一层留在客户网络、哪一层走云”写进架构图,而不是笼统承诺数据安全。官方产品博客
GitHub 工程师 Erik Kristensen 公布其编码助手在不牺牲质量前提下的四项降本改动:选择性压缩工具输出、移除行号前缀、压缩 task-tool 提示词、后台任务完成后直接交付结果。
移除格式约降 5% 线下推理成本、3% 线上日均成本;压缩提示词每轮省约 1300 词元、每活跃小时归一化成本降 2.9%;后台交付让 AI Credits 用量降约 2.3%。
文章最有价值的是方法:先做离线基准评测,再做受控线上实验,且优化目标是整个任务而非单次调用——他们发现粗暴截断工具输出有时会让模型重新读文件或重跑命令,反而更贵。这套成本治理闭环可以直接搬进企业的编码智能平台:给每个编码任务记录词元与耗时,按任务维度做回归,防止局部优化伤到整体效果。官方工程复盘
美国司法部在 OpenAI 与《纽约时报》的版权诉讼中提交意见书,主张用受版权文本训练大语言模型一般不违反版权法,称训练具备“非凡转换性”,并以国家安全为由反对全面许可要求。
这是华盛顿在 AI 训练版权诉讼潮中首次正式介入;意见书对法院只有咨询意义,数据获取方式与具体输出是否复制受保护段落仍留给法院逐案判断。
对国内开发者,这条消息的参考价值在于理解海外合规趋势:训练侧的压力在松动,但使用侧(输出与数据获取)的审查会更细。做 AI 应用出海时,训练数据来源与检索的授权链条仍要留痕,别因为一次表态就放松内容合规建设。政策判断可以交给法务,产品上先保证可解释、可下架、可追溯。意见书要点整理
今天八条新闻串起来看,编码模型的能力差距在缩小,竞争重心正在从“谁的模型聪明”转向“谁把模型用得更省、更可控”。谷歌与阿里在同一天用不同方式证明同一件事:更强的推理能力意味着模型愿意多干活,但多干活要花钱,于是各家平台忙着压缩词元、把执行搬回客户内网、劝大家别把架构搞复杂。
落到蓝曜炬辉的服务上,我们做 AIcoding 全栈开发与软件定制开发(App、Web、小程序、桌面端)时最常被客户高估的是模型选型,被低估的是工具链、评测与成本治理。过去一年交付的 Agent 系统里,把工程脚手架搭对的项目,工期比传统方式平均缩短约五成;反过来,一上来就追求“最大模型加最多智能体”的项目,往往在联调期把节省的时间又赔回去。我们一开始也犯过堆子智能体的错,后来按单循环加技能与工具重构,维护成本明显下降。
今天这些发布像是把我们的经验公开验证了一遍:模型迭代越快,工程基本功越值钱。建议企业把注意力从追新模型转移到三件事上:给任务设成本基线、把评测做成发布门禁、让执行环境贴近数据所在的位置。
如果你关注模型迭代与智能体工程,以下几篇历史早报可对照阅读:
如果你的团队正在评估把编码与业务流程交给模型,欢迎来聊一次:我们提供 30 分钟免费咨询与 AI 转型评估,用你真实的一个业务模块给出落地路径与成本估算,不打包票、不卖模板。前往 /contact 预约