AI编码新突破:Ornith-1.0开源发布,MIT许可可商用
DeepReinforce 于 2026 年 6 月 25 日发布 Ornith-1.0 开源编码模型族,MIT 许可。其 Self-Scaffolding 机制让模型自主学习编码 agent 的编排层,397B 旗舰版 SWE-Bench 得分 82.4。本文从技术原理、实测数据和选型框架三个维度拆解。
AI编码新突破:Ornith-1.0开源发布,MIT许可可商用
2026 年 6 月 25 日,DeepReinforce 研究团队在 HuggingFace 上放出了一组模型权重。没有发布会,没有 keynote,只有一个 MIT 许可证和四个尺寸的检查点文件。但它做成了一件此前没人做到的事:让模型在强化学习中自己学会怎么写编码 agent 的编排层(harness),而不是靠人工焊死一套固定框架。
Self-Scaffolding:为什么模型学会「写自己的脚手架」是质变
一个典型的 AI 编码 agent 架构分两层:底层是推理模型,上层是工程师手工写的编排逻辑,负责工具调用编排、错误恢复、上下文记忆管理。模型只负责在给定框架里干活,框架本身不会进化。
问题在于:这套固定策略面对不同任务用的是同一套行为模式。C 项目、React 前端、Rust 后端的最佳 agent 行为策略显然不该一样,但人工设计做不到按任务自适应。
新模型把编排层本身变成了一个可学习对象。RL 训练每一步分两个阶段:先让模型读当前任务和已有编排,提出改进版;再用新版编排和任务描述生成解决方案。来自 rollout 的奖励同时回传两个阶段——模型被联合优化,既要写出好答案,也要写出好策略。训练采用异步 pipeline-RL,旧 token 按陈旧度加权衰减,目标函数为 token-level GRPO。
实际效果:多文件重构任务中自动涌现出「先理解依赖 → 逐文件修改 → 最后统一测试」的策略;bug 修复中涌现出「先复现 → 二分定位 → 最小 patch」。这些不是人写的,是训练中自动突变选择出来的。
三层防御:怎么不让模型作弊
让模型自己编写编排逻辑,最大风险是奖励黑客。DeepReinforce 报告了三层递增防御:
| 层级 | 机制 | 作用 |
|---|---|---|
| 固定信任边界 | 环境、工具暴露面、测试隔离层对模型完全不可达 | 物理隔离,杜绝越权 |
| 确定性监视器 | 读取被禁止路径或修改验证脚本 → 零奖励,对应 rollout 从 advantage 中排除 | 即时惩罚,阻断作弊路径 |
| 冻结 LLM 裁判 | 独立冻结权重的裁判模型叠加于验证器,对结果做否决审查 | 最后一关,防止 reward 被篡改 |
实测数据:与顶级闭源模型还差多远
以下是官方报告的 benchmark 对比:
| 模型 | Terminal-Bench 2.1 | SWE-Bench Verified | SWE-Bench Pro | NL2Repo |
|---|---|---|---|---|
| Ornith-1.0-397B | 77.5 | 82.4 | 62.2 | 48.2 |
| Ornith-1.0-35B-MoE | 64.2 | — | — | — |
| Ornith-1.0-9B | 43.1 | 69.4 | — | — |
| Opus 4.7(Anthropic) | 70.3 | 80.8 | 64.3 | — |
| Opus 4.8(Anthropic) | 85.0 | 87.6 | 69.2 | 69.7 |
| GLM-5.2-744B | 81.0 | — | 62.1 | 48.9 |
| Qwen3.5-397B | 53.5 | 76.4 | 51.6 | 36.8 |
| DeepSeek-V4-Pro-1.6T | 64.0 | 80.6 | 55.4 | — |
几个值得注意的点:
- 397B 旗舰版超越 Anthropic 上一代旗舰:Terminal-Bench 77.5 vs 70.3,SWE-Bench 82.4 vs 80.8。Opus 4.7 是 2025 年底的顶级闭源产品,开源阵营能在这个级别取胜,信号很强。
- 跟最新旗舰 Opus 4.8 还有实质差距:Terminal-Bench 落后 7.5 分,SWE-Bench 落后 5.2 分。天花板在往上走,但还没到顶。
- 小尺寸性价比突出:35B-MoE 每 token 仅激活约 3B 参数,Terminal-Bench 64.2 分,超过 Qwen3.5-397B(53.5)和 DeepSeek-V4-Pro-1.6T(64.0),推理成本极低。
- 9B 单卡可用:bf16 约 19GB,单张 80GB GPU 就能跑,SWE-Bench 69.4 分说明中低难度编程任务已可堪实用。
2026 年 AI 编程的闭源霸权与开源破局
Anthropic 年化收入在 2026 年 4 月突破 300 亿美元,较 2025 年末增长超 3 倍。其编程产品单独贡献年化超 25 亿美元。年消费超百万美元的企业客户从 2 月的 500 家跳到 4 月的超 1000 家。[来源] OpenAI 的 GPT-5.2-Codex 也在 1 月开放 API,报道称已在部分场景反超。[来源]
闭源阵营拿走了绝大部分企业预算,但有三道硬伤:供应商锁定导致迁移成本极高、数据不能出内网直接否决了金融医疗军工场景、每席位 $200/月的定价对百人团队年费 $240,000 且趋势只涨不降。
本次发布的模型代表了一条不同路线——开源 + 自部署 + 自主学习编排。MIT 许可证允许随意修改、商用、内部分发。vLLM 一行命令部署,企业可以把整个编码 agent 跑在自己的 GPU 集群上。
企业选型决策框架:什么时候该选开源编码模型
不是所有团队都适合。以下是我们在实际项目中总结的判断框架。
适合上的场景
- 数据合规强需求:代码库不能出内网的项目,自建 9B 或 35B 推理是最直接合规路径。
- 成本敏感型大规模部署:50 人以上团队,按云 GPU 租赁价算,同等吞吐量自建成本约为商业方案的 1/5 到 1/3。
- 需要定制 agent 行为:编码规范、测试流程与主流差异大的团队,通用 agent 适配性差,自主学习架构未来可能支持领域微调。
- 研究型团队:想折腾 agent 架构、做 RL 训练改进,MIT 许可的开源模型是唯一选择。
不适合的场景
- 需要最强单次推理深度:极度依赖单次对话推理能力的任务,Opus 4.8 在 SWE-Bench 上 5 分的领先是实打实的。
- 团队没有 ML infra 能力:部署推理服务、做量化、管 GPU 集群需要相应的人力积累。连一个懂 CUDA 的工程师都没有,自建成本会远超预期。
- 需要开箱即用的 IDE 集成:商业产品已深度对接 VS Code、JetBrains 等环境。开源权重文件需要自己搭建全套工具链。
常见问题
这个模型真的完全免费可商用吗?
是的,MIT 许可证。可以做任何事——打包进商业产品、内部部署、修改权重——只需保留版权声明,无 Copyleft 传染条款。
9B 版本实际可用吗?
SWE-Bench 69.4 分说明单文件级 bug 修复和简单功能实现表现不错。多文件重构和复杂逻辑推理上与旗舰版差距显著。建议用于 IDE 补全、测试生成、代码审查等辅助场景,而非全自动 agent 模式。
自主学习编排机制会在后续版本更强吗?
我们认为这条路线优势在于:随着 RL 训练规模扩大,编排策略复杂度可持续增长,而人工设计的 harness 有复杂度上限。下一代产品有可能在编排层面追平甚至超越人工设计的 agent 框架。
和商业方案的主要差距在哪?
一是单次推理深度,二是长链工具调用的鲁棒性——连续 20+ 步操作中的状态管理和错误恢复能力,三是生态完整度。
我们的初步实测与踩坑记录
在内部一台 A100-80GB 上用 vLLM 部署了 9B 版本做基础验证。部署命令即官方标准一行:
vllm serve deepreinforce-ai/Ornith-1.0-9B \
--served-model-name Ornith-1.0-9B \
--max-model-len 262144 \
--enable-auto-tool-choice --tool-call-parser qwen3_xml \
--reasoning-parser qwen3 \
--trust-remote-code
冷启动约 30 秒,首 token 延迟约 800ms(输入 2000 token),生成速度约 45 token/s——对 9B 规模来说正常水平。拿了一套内部 NestJS 后端测试套件做验证:14 个失败单测,涉及 3 个 service 和 2 个 controller。9B 版在 OpenHands 框架中修复了 9 个(64%)。同一任务,Anthropic 上一代旗舰修复 12 个(86%),其中端模型修复 7 个(50%)。
踩到的坑:连续 5 轮以上工具调用时约 10% 的 case XML 格式不完整,建议在 agent 框架加 retry + format fix;推理追踪偶尔达 3000+ token,生产环境建议截断;受基础模型影响代码风格偏 Pythonic,TypeScript 项目中偶尔写出 Python 风格命名。
结论:9B 适合作为辅助编码工具,不要期望无人监督处理复杂多文件任务。35B-MoE 和 397B 版本还在等 GPU 资源,后续会补完整横评。
