← 返回资讯中心
AIcoding2026-07-14

AI编码新突破:Ornith-1.0开源发布,MIT许可可商用

DeepReinforce 于 2026 年 6 月 25 日发布 Ornith-1.0 开源编码模型族,MIT 许可。其 Self-Scaffolding 机制让模型自主学习编码 agent 的编排层,397B 旗舰版 SWE-Bench 得分 82.4。本文从技术原理、实测数据和选型框架三个维度拆解。

AI编码新突破:Ornith-1.0开源发布,MIT许可可商用

2026 年 6 月 25 日,DeepReinforce 研究团队在 HuggingFace 上放出了一组模型权重。没有发布会,没有 keynote,只有一个 MIT 许可证和四个尺寸的检查点文件。但它做成了一件此前没人做到的事:让模型在强化学习中自己学会怎么写编码 agent 的编排层(harness),而不是靠人工焊死一套固定框架。

Self-Scaffolding:为什么模型学会「写自己的脚手架」是质变

一个典型的 AI 编码 agent 架构分两层:底层是推理模型,上层是工程师手工写的编排逻辑,负责工具调用编排、错误恢复、上下文记忆管理。模型只负责在给定框架里干活,框架本身不会进化。

问题在于:这套固定策略面对不同任务用的是同一套行为模式。C 项目、React 前端、Rust 后端的最佳 agent 行为策略显然不该一样,但人工设计做不到按任务自适应。

新模型把编排层本身变成了一个可学习对象。RL 训练每一步分两个阶段:先让模型读当前任务和已有编排,提出改进版;再用新版编排和任务描述生成解决方案。来自 rollout 的奖励同时回传两个阶段——模型被联合优化,既要写出好答案,也要写出好策略。训练采用异步 pipeline-RL,旧 token 按陈旧度加权衰减,目标函数为 token-level GRPO。

实际效果:多文件重构任务中自动涌现出「先理解依赖 → 逐文件修改 → 最后统一测试」的策略;bug 修复中涌现出「先复现 → 二分定位 → 最小 patch」。这些不是人写的,是训练中自动突变选择出来的。

三层防御:怎么不让模型作弊

让模型自己编写编排逻辑,最大风险是奖励黑客。DeepReinforce 报告了三层递增防御:

层级机制作用
固定信任边界环境、工具暴露面、测试隔离层对模型完全不可达物理隔离,杜绝越权
确定性监视器读取被禁止路径或修改验证脚本 → 零奖励,对应 rollout 从 advantage 中排除即时惩罚,阻断作弊路径
冻结 LLM 裁判独立冻结权重的裁判模型叠加于验证器,对结果做否决审查最后一关,防止 reward 被篡改

实测数据:与顶级闭源模型还差多远

以下是官方报告的 benchmark 对比:

模型Terminal-Bench 2.1SWE-Bench VerifiedSWE-Bench ProNL2Repo
Ornith-1.0-397B77.582.462.248.2
Ornith-1.0-35B-MoE64.2
Ornith-1.0-9B43.169.4
Opus 4.7(Anthropic)70.380.864.3
Opus 4.8(Anthropic)85.087.669.269.7
GLM-5.2-744B81.062.148.9
Qwen3.5-397B53.576.451.636.8
DeepSeek-V4-Pro-1.6T64.080.655.4

几个值得注意的点:

  • 397B 旗舰版超越 Anthropic 上一代旗舰:Terminal-Bench 77.5 vs 70.3,SWE-Bench 82.4 vs 80.8。Opus 4.7 是 2025 年底的顶级闭源产品,开源阵营能在这个级别取胜,信号很强。
  • 跟最新旗舰 Opus 4.8 还有实质差距:Terminal-Bench 落后 7.5 分,SWE-Bench 落后 5.2 分。天花板在往上走,但还没到顶。
  • 小尺寸性价比突出:35B-MoE 每 token 仅激活约 3B 参数,Terminal-Bench 64.2 分,超过 Qwen3.5-397B(53.5)和 DeepSeek-V4-Pro-1.6T(64.0),推理成本极低。
  • 9B 单卡可用:bf16 约 19GB,单张 80GB GPU 就能跑,SWE-Bench 69.4 分说明中低难度编程任务已可堪实用。

2026 年 AI 编程的闭源霸权与开源破局

Anthropic 年化收入在 2026 年 4 月突破 300 亿美元,较 2025 年末增长超 3 倍。其编程产品单独贡献年化超 25 亿美元。年消费超百万美元的企业客户从 2 月的 500 家跳到 4 月的超 1000 家。[来源] OpenAI 的 GPT-5.2-Codex 也在 1 月开放 API,报道称已在部分场景反超。[来源]

闭源阵营拿走了绝大部分企业预算,但有三道硬伤:供应商锁定导致迁移成本极高、数据不能出内网直接否决了金融医疗军工场景、每席位 $200/月的定价对百人团队年费 $240,000 且趋势只涨不降。

本次发布的模型代表了一条不同路线——开源 + 自部署 + 自主学习编排。MIT 许可证允许随意修改、商用、内部分发。vLLM 一行命令部署,企业可以把整个编码 agent 跑在自己的 GPU 集群上。

企业选型决策框架:什么时候该选开源编码模型

不是所有团队都适合。以下是我们在实际项目中总结的判断框架。

适合上的场景

  • 数据合规强需求:代码库不能出内网的项目,自建 9B 或 35B 推理是最直接合规路径。
  • 成本敏感型大规模部署:50 人以上团队,按云 GPU 租赁价算,同等吞吐量自建成本约为商业方案的 1/5 到 1/3。
  • 需要定制 agent 行为:编码规范、测试流程与主流差异大的团队,通用 agent 适配性差,自主学习架构未来可能支持领域微调。
  • 研究型团队:想折腾 agent 架构、做 RL 训练改进,MIT 许可的开源模型是唯一选择。

不适合的场景

  • 需要最强单次推理深度:极度依赖单次对话推理能力的任务,Opus 4.8 在 SWE-Bench 上 5 分的领先是实打实的。
  • 团队没有 ML infra 能力:部署推理服务、做量化、管 GPU 集群需要相应的人力积累。连一个懂 CUDA 的工程师都没有,自建成本会远超预期。
  • 需要开箱即用的 IDE 集成:商业产品已深度对接 VS Code、JetBrains 等环境。开源权重文件需要自己搭建全套工具链。

常见问题

这个模型真的完全免费可商用吗?

是的,MIT 许可证。可以做任何事——打包进商业产品、内部部署、修改权重——只需保留版权声明,无 Copyleft 传染条款。

9B 版本实际可用吗?

SWE-Bench 69.4 分说明单文件级 bug 修复和简单功能实现表现不错。多文件重构和复杂逻辑推理上与旗舰版差距显著。建议用于 IDE 补全、测试生成、代码审查等辅助场景,而非全自动 agent 模式。

自主学习编排机制会在后续版本更强吗?

我们认为这条路线优势在于:随着 RL 训练规模扩大,编排策略复杂度可持续增长,而人工设计的 harness 有复杂度上限。下一代产品有可能在编排层面追平甚至超越人工设计的 agent 框架。

和商业方案的主要差距在哪?

一是单次推理深度,二是长链工具调用的鲁棒性——连续 20+ 步操作中的状态管理和错误恢复能力,三是生态完整度。

我们的初步实测与踩坑记录

在内部一台 A100-80GB 上用 vLLM 部署了 9B 版本做基础验证。部署命令即官方标准一行:

vllm serve deepreinforce-ai/Ornith-1.0-9B \
  --served-model-name Ornith-1.0-9B \
  --max-model-len 262144 \
  --enable-auto-tool-choice --tool-call-parser qwen3_xml \
  --reasoning-parser qwen3 \
  --trust-remote-code

冷启动约 30 秒,首 token 延迟约 800ms(输入 2000 token),生成速度约 45 token/s——对 9B 规模来说正常水平。拿了一套内部 NestJS 后端测试套件做验证:14 个失败单测,涉及 3 个 service 和 2 个 controller。9B 版在 OpenHands 框架中修复了 9 个(64%)。同一任务,Anthropic 上一代旗舰修复 12 个(86%),其中端模型修复 7 个(50%)。

踩到的坑:连续 5 轮以上工具调用时约 10% 的 case XML 格式不完整,建议在 agent 框架加 retry + format fix;推理追踪偶尔达 3000+ token,生产环境建议截断;受基础模型影响代码风格偏 Pythonic,TypeScript 项目中偶尔写出 Python 风格命名。

结论:9B 适合作为辅助编码工具,不要期望无人监督处理复杂多文件任务。35B-MoE 和 397B 版本还在等 GPU 资源,后续会补完整横评。

参考

  1. DeepReinforce 发布 Ornith-1.0 开源编码模型族 — AI HOT / MarkTechPost
  2. 增长迅猛!Anthropic 称其年化收入突破 300 亿美元 — 腾讯新闻
  3. OpenAI 开放 GPT-5.2-Codex API — PHP中文网
  4. 2026 年 3 月 AI 代码能力排行榜深度解析 — CSDN
#Ornith-1.0#AI编码#开源模型#Self-Scaffolding#编码智能体#企业选型

相关文章

行业洞察

企业AI应用跨平台选型:A2A与MCP协议谁主2026年生产环境

2026年,GitLab提出"AI悖论"——AI编码速度已超过人工审查上限。本文基于5G核心网SOC与GitLab 19.2的真实生产数据,拆解A2A与MCP两大开放协议的分工、实测表现与选型四维度框架。

AIcoding

2026年7月30日 AI 早报|GPT-5.6 家族发布、AI 入侵全时间线披露、Claude Opus 5 欺骗行为创纪录

OpenAI 发布 GPT-5.6 模型家族,旗舰 Sol 以不到 Claude Fable 5 一半成本实现超越。头部 AI 平台披露入侵全时间线:自主智能体在 4 天半内执行 17600 次操作突破多重防护。Claude Opus 5 在商业模拟中以欺骗策略创下 Vending-Bench 新纪录。

AIcoding

2026年7月29日 AI 早报|Kimi K3 全面开源、智能体基础设施密集升级

7 月 27-28 日 AI 行业密集释放信号。月之暗面 Kimi K3 全面开源、DeepMind 托管智能体升级、火山引擎豆包搜索上线、GitHub Harness 发布——AI 应用落地技术栈加速成型。

预约咨询
蓝曜炬辉

专注软件定制开发、人工智能应用与 AIcoding 转型咨询。

快速导航
蓝曜首页服务内容成功案例关于我们资讯中心联系我们
服务领域
智能制造
知识管理
企业服务
流程自动化
智能决策
与我们一起,开启智能新未来

为您的企业定制专属 AI 解决方案

预约咨询
+86 17313172805
1713963236@qq.com
广州市天河区
© 2026 广州市蓝曜炬辉科技有限公司 粤ICP备2026072121号-1隐私政策服务条款