AutoGPT 有 18 万 star、150 个未关闭 PR,多数由 AI 智能体提交。维护团队发现:智能体不会主动读文档,把 AGENTS.md 放到代码旁边、配四道门控,才能把 AI 生成的 PR 从不可用变成可用。
AutoGPT 仓库有 18 万颗星、150 个未关闭的拉取请求,其中很大一部分是 AI 智能体写的——Copilot、OpenClaw,以及项目自己的内部工具。多数开源维护者的第一反应是关掉 PR 功能。创始 AI 工程师 Nicholas Tindle 却选择留下它:「这基本上就是别人在替你付算力费用。」条件是,你得让这些 AI 提交的代码走你定义的流程。
维护团队最开始也走了老路:写更详细的贡献者指南、建专门的 wiki,教 AI 怎么协作。一点用都没有。原因很直接——它不会主动读文档,只会读当前工作目录层级下的内容。你以为文档写好了它就会来找,它不会。
于是他们把指令放到工具看得见的地方。先放 CLAUDE.md,因为 Claude 生成的提交缺仓库上下文;随后发现 Copilot 和 Codex 会忽略 Claude 文件,于是统一成 AGENTS.md,让 Claude 文件指向它。这份文件的作用域限定在某个目录内;技能(skill)则可以在目录之外被发现——技能是带描述的指令文件,Agent 预先扫描描述,任务匹配时再拉完整指令。前端工程师厌倦了同类坏提交,就把「组件在这些文件夹里必须写 Storybook 测试」发布成技能;后端同样强制:测试覆盖率不到 80% 不许开合并请求。Claude Code 的循环式工程范式怎么落地,可以看我们拆过的Claude Code 智能体循环。
真正的变化来自门控,而不是文档。实践下来有效的是这四道:
另外还有一条配套规则:解决评审讨论串之前必须提供提交 SHA。因为有些 Agent 会不碰代码就把所有讨论串标记为已解决。仓库里的 pr-address 技能规定唯一合法顺序——修复、提交、推送、回复、解决,且回复必须链接到修复提交,用 git rev-parse HEAD 拿完整 SHA,防止复用旧提交。
团队曾让 Agent 在 CI 失败时读日志并评论哪里出了问题,后来关掉了。原因很朴素:CI 失败频率高,一个机器人对每次失败做解说,并不比失败本身好多少。这里的教训是克制——保留降低维护者负担的机制,关掉只产生噪音的功能。
如果让我们在一个正在引入 AI 编程工具的企业团队落地,第一步不是搭重型审查流水线,而是先做两件事:把 AGENTS.md 放到高频仓库的代码旁边,内容只写「这个目录的约定、不许做什么」;再把模板加上「测试计划」字段。这两步成本低、立刻改变 Agent 行为。覆盖率门槛、CLA 探测器这类门控,等提交量真的上来再逐步加。
同时要理解边界。InfoQ 在 2026 世界人工智能大会期间采访了 Sirius contributor 滕昱和曾在 Google 任职、后加入月之暗面的唐飞虎,两人判断并不一致,但有一个共识:AI 正在优先放大资深工程师的经验和判断,真正受冲击的是依赖重复编码积累经验的新人。滕昱估计普通应用 70%–80% 的需求可以用 Vibe Coding 实现,但超出模型已有经验分布的任务,Agent 会反复改代码却意识不到技术路线不成立,这时必须有人叫停。行数驱动带来的假象我们也拆过——AI 一口气写了 3.7 万行,最后整个项目翻车。门控解决的是「AI 不读文档、乱提交」的问题,解决不了「方向错了」的问题,AI 编程的技术债在企业级项目里比想象中更难还。
往更远处看,语言层也在为 AI 重构工具链契约。Vercel Labs 的实验语言 Zero 假设编译器输出的主要阅读者不再是人类,而是 Agent:错误带稳定代码和带类型的修复元数据,zero fix --plan --json 返回机器可读的修复计划,Agent 可以接受、编辑或拒绝。AGENTS.md 是仓库层的人机契约,Zero 是语言层的 Agent 契约,方向一致:与其教 AI 理解人类的流程,不如把流程改成 AI 能直接消费的形式。
Copilot、Codex 不认 CLAUDE.md,只有 Claude 系工具读它。所以统一用 AGENTS.md 当标准,CLAUDE.md 只做跳转。
放在所管辖代码的旁边,也就是当前工作目录层级内。位置和内容同等重要——工具只读眼前的东西。
AutoGPT 后端设 80% 必检。合理值看项目现状,关键是做成 CI 必检项而不是口头建议。
让提交尾注表明身份;CLA 签名也能当探测器——要浏览器和 GitHub OAuth 的流程,智能体很难完成,一周没签基本可判定非人工。