DeepReinforce 于 2026 年 6 月 25 日发布 Ornith-1.0 开源编码模型族,MIT 许可。其 Self-Scaffolding 机制让模型自主学习编码 agent 的编排层,397B 旗舰版 SWE-Bench 得分 82.4。本文从技术原理、实测数据和选型框架三个维度拆解。
2026 年 6 月 25 日,DeepReinforce 研究团队在 HuggingFace 上放出了一组模型权重。没有发布会,没有 keynote,只有一个 MIT 许可证和四个尺寸的检查点文件。但它做成了一件此前没人做到的事:让模型在强化学习中自己学会怎么写编码 agent 的编排层(harness),而不是靠人工焊死一套固定框架。
一个典型的 AI 编码 agent 架构分两层:底层是推理模型,上层是工程师手工写的编排逻辑,负责工具调用编排、错误恢复、上下文记忆管理。模型只负责在给定框架里干活,框架本身不会进化。
问题在于:这套固定策略面对不同任务用的是同一套行为模式。C 项目、React 前端、Rust 后端的最佳 agent 行为策略显然不该一样,但人工设计做不到按任务自适应。
新模型把编排层本身变成了一个可学习对象。RL 训练每一步分两个阶段:先让模型读当前任务和已有编排,提出改进版;再用新版编排和任务描述生成解决方案。来自 rollout 的奖励同时回传两个阶段——模型被联合优化,既要写出好答案,也要写出好策略。训练采用异步 pipeline-RL,旧 token 按陈旧度加权衰减,目标函数为 token-level GRPO。
实际效果:多文件重构任务中自动涌现出「先理解依赖 → 逐文件修改 → 最后统一测试」的策略;bug 修复中涌现出「先复现 → 二分定位 → 最小 patch」。这些不是人写的,是训练中自动突变选择出来的。
让模型自己编写编排逻辑,最大风险是奖励黑客。DeepReinforce 报告了三层递增防御:
| 层级 | 机制 | 作用 |
|---|---|---|
| 固定信任边界 | 环境、工具暴露面、测试隔离层对模型完全不可达 | 物理隔离,杜绝越权 |
| 确定性监视器 | 读取被禁止路径或修改验证脚本 → 零奖励,对应 rollout 从 advantage 中排除 | 即时惩罚,阻断作弊路径 |
| 冻结 LLM 裁判 | 独立冻结权重的裁判模型叠加于验证器,对结果做否决审查 | 最后一关,防止 reward 被篡改 |
以下是官方报告的 benchmark 对比:
| 模型 | Terminal-Bench 2.1 | SWE-Bench Verified | SWE-Bench Pro | NL2Repo |
|---|---|---|---|---|
| Ornith-1.0-397B | 77.5 | 82.4 | 62.2 | 48.2 |
| Ornith-1.0-35B-MoE | 64.2 | — | — | — |
| Ornith-1.0-9B | 43.1 | 69.4 | — | — |
| Opus 4.7(Anthropic) | 70.3 | 80.8 | 64.3 | — |
| Opus 4.8(Anthropic) | 85.0 | 87.6 | 69.2 | 69.7 |
| GLM-5.2-744B | 81.0 | — | 62.1 | 48.9 |
| Qwen3.5-397B | 53.5 | 76.4 | 51.6 | 36.8 |
| DeepSeek-V4-Pro-1.6T | 64.0 | 80.6 | 55.4 | — |
几个值得注意的点:
Anthropic 年化收入在 2026 年 4 月突破 300 亿美元,较 2025 年末增长超 3 倍。其编程产品单独贡献年化超 25 亿美元。年消费超百万美元的企业客户从 2 月的 500 家跳到 4 月的超 1000 家。[来源] OpenAI 的 GPT-5.2-Codex 也在 1 月开放 API,报道称已在部分场景反超。[来源]
闭源阵营拿走了绝大部分企业预算,但有三道硬伤:供应商锁定导致迁移成本极高、数据不能出内网直接否决了金融医疗军工场景、每席位 $200/月的定价对百人团队年费 $240,000 且趋势只涨不降。
本次发布的模型代表了一条不同路线——开源 + 自部署 + 自主学习编排。MIT 许可证允许随意修改、商用、内部分发。vLLM 一行命令部署,企业可以把整个编码 agent 跑在自己的 GPU 集群上。
不是所有团队都适合。以下是我们在实际项目中总结的判断框架。
是的,MIT 许可证。可以做任何事——打包进商业产品、内部部署、修改权重——只需保留版权声明,无 Copyleft 传染条款。
SWE-Bench 69.4 分说明单文件级 bug 修复和简单功能实现表现不错。多文件重构和复杂逻辑推理上与旗舰版差距显著。建议用于 IDE 补全、测试生成、代码审查等辅助场景,而非全自动 agent 模式。
我们认为这条路线优势在于:随着 RL 训练规模扩大,编排策略复杂度可持续增长,而人工设计的 harness 有复杂度上限。下一代产品有可能在编排层面追平甚至超越人工设计的 agent 框架。
一是单次推理深度,二是长链工具调用的鲁棒性——连续 20+ 步操作中的状态管理和错误恢复能力,三是生态完整度。
在内部一台 A100-80GB 上用 vLLM 部署了 9B 版本做基础验证。部署命令即官方标准一行:
vllm serve deepreinforce-ai/Ornith-1.0-9B \
--served-model-name Ornith-1.0-9B \
--max-model-len 262144 \
--enable-auto-tool-choice --tool-call-parser qwen3_xml \
--reasoning-parser qwen3 \
--trust-remote-code
冷启动约 30 秒,首 token 延迟约 800ms(输入 2000 token),生成速度约 45 token/s——对 9B 规模来说正常水平。拿了一套内部 NestJS 后端测试套件做验证:14 个失败单测,涉及 3 个 service 和 2 个 controller。9B 版在 OpenHands 框架中修复了 9 个(64%)。同一任务,Anthropic 上一代旗舰修复 12 个(86%),其中端模型修复 7 个(50%)。
踩到的坑:连续 5 轮以上工具调用时约 10% 的 case XML 格式不完整,建议在 agent 框架加 retry + format fix;推理追踪偶尔达 3000+ token,生产环境建议截断;受基础模型影响代码风格偏 Pythonic,TypeScript 项目中偶尔写出 Python 风格命名。
结论:9B 适合作为辅助编码工具,不要期望无人监督处理复杂多文件任务。35B-MoE 和 397B 版本还在等 GPU 资源,后续会补完整横评。