2026 上半年,多位技术负责人在把 AI 写代码推进生产环境后得出同一结论:模型能力已经溢出,真正跟不上的,是人的决策带宽和工程判断力。本文基于一线实战复盘,拆解这个新瓶颈。
2026 年春节,Apache APISIX 的维护团队被一个棘手 bug 卡住了——试遍各种方法都复现不了,读了几轮代码也没定位到。最后抱着试试看的心态,把现象描述给一个 AI Agent。不到 10 分钟,它仅靠静态代码分析就准确指出了问题所在。
这是 API7.ai 创始人温铭在 2026 年 6 月 InfoQ 采访中描述的场景。他在过去一两个月里烧掉了几百亿 token,让 AI 从零写了一个叫 AISIX 的生产级 AI 网关。他的结论很直接:「AI 已经达到、甚至超过了一个资深工程师的编码能力,这一点毋庸置疑。瓶颈早就不在 AI 这一头了——AI 的能力已经溢出,真正跟不上的,是人。」
同一时间,TiDB 联合创始人兼 CTO 黄东旭公布了 db9 项目的完整数据:100 多万行 Rust 代码,0 行由人类手写,0 行由人类 review,峰值一天消耗约 10 亿 token——月成本约 2000 美元。上线后服务了超过 10,000 个数据库实例。他的原话是:「我现在陷入到一种巨大的虚无主义里,AI 什么都能写。」
两条独立的实践路径,在 2026 年年中交汇于同一个判断:AI 软件开发的代码生成能力已经不再是需要验证的命题,真正的战场转移到了人这一侧。关于 AI 从「写代码」到「做项目」的跃迁,我们在另一篇文章中详细拆解过 Agentic Coding 的工作模式——当 AI 不再只是补全函数,而是能自主规划任务、拆分模块、迭代交付时,对人的指挥能力要求是指数级上升的。
2025 年整个行业还在争论「AI 写的代码能不能上生产」。到了 2026 年 6 月,这个问题已经基本有答案了。三个案例足以说明变化的速度:
这三个案例的共同点不是「AI 很厉害」,而是「能指挥 AI 的人很厉害」。黄东旭是数据库内核专家,温铭是 Apache APISIX PMC 主席,Bun 的作者本身就是系统编程老手。他们都没有把 AI 当成自动驾驶,而是当成一个需要精确指令的超高速执行器。
温铭在 InfoQ 采访中总结了六条实战经验,值得每一个正在或计划把 AI 引入软件开发流程的技术负责人认真读一遍:
| # | 经验 | 为什么重要 |
|---|---|---|
| 1 | AI 看得懂 What、能完成 How,但 Why 还得人来 | AI 接管了打字,没接管工程师脑子里的架构图和权衡判断。代码可以生成,但「为什么选这个方案而不是那个」的知识不在任何公开训练集里。 |
| 2 | 「禁止手写代码」的最大反弹来自资深工程师的领地意识 | 把自己定位为「前端」或「后端」的工程师最容易不适应。AI Agent 打破了角色边界,一个不写前端的人也能做出六七十分的 Dashboard——前提是你能说出前端的评判标准。 |
| 3 | 是玩具还是生产级,这条线画在人身上,不在代码上 | 核心标准不是「哪些代码能交给 AI」,而是「指挥 AI 的人对架构、代码、测试有没有清晰理解,对推上生产有没有敬畏之心」。 |
| 4 | AI 写的代码,得再用一个独立的 AI 去 review | AI coding 一天能提几十个 PR、几千行代码,人根本看不过来。API7.ai 的做法是用 Claude Code 写 + 冷启动另一个独立 Agent 审计 + CodeRabbit 和 GitHub Copilot 做第二层验证。 |
| 5 | 让项目稳定下来的不是代码漂亮,而是真有用户在生产环境里用它 | AI 最革命性的地方是把迭代速度拉到了极致——任何反馈、任何 bug 都能很快定位、很快修复。用户凌晨两点提的 bug,AI 十分钟内完成静态分析 + 环境搭建,人只做最后的判断。 |
| 6 | 从「上瘾式编码」转向「高质量决策」 | 以前一天两三个技术决策,AI 加速后变成四五十个。温铭现在的节奏是并行五六个研发任务,重要的架构选择都由人拍板,机器负责调研、补背景、补盲区。机器执行和编码,人做判断。 |
这六条的核心指向同一个变化:企业 AI 应用开发的组织瓶颈已经从「AI 不够强」转移到了「人的决策带宽不够用」。一家公司人多还是人少不重要,重要的是它能不能先「变厚」——把核心工程师的经验沉淀为 AI 可用的原则文件(比如 agents.md 或 CLAUDE.md),再「变大」——让这些经验通过 AI Agent 规模化执行。
如果你的团队正在评估是否要把 AI coding 引入正式开发流程,2026 年上半年的这些一线数据至少指向三个行动方向:
关于企业实际落地时的成本结构和隐性开销,我们在《AI 写代码半年,我们算了一笔真实账》里有过详细的拆解——token 费用只是冰山一角,真正的成本在组织流程改造和人的决策精力消耗上。
但也要泼一盆冷水:上述三个案例的主角都是各自领域的顶尖工程师。对于缺少这种「架构级人物」的团队,AIcoding 并不会自动带来生产力跃升——它反而可能放大技术债务,因为你写得越快,错误决策传播得也越快。
温铭的原话值得反复读:「没有一个对技术、对代码有追求的人,哪怕是 CRUD,他也没法用 AI 写好。AI 的决策正确率有 85%、90%,剩下那 10% 足以让整个项目的质量大幅下降。」
能。db9(100 万+行 Rust,服务 10,000+ 实例)和 AISIX(生产级 AI 网关)都是 2026 年的活案例。关键不是 AI 本身能不能,而是指挥 AI 的人有没有能力审核它的产出、有没有建立双重 AI review 的流程。关于 2026 年主流 AI 编程模型的选型对比,可以参考我们整理的 Claude、GPT、DeepSeek 三线技术选型分析。
能用,但要调整预期。AI 能帮小团队把原型和 MVP 的速度拉上去,但如果没有能做架构决策的人把关,技术债务会以更快的速度积累。建议至少找一个有经验的兼职技术顾问来 review 关键决策。
db9 的 token 成本峰值约每天 10 亿 token,月均约 2000 美元。Cloudflare 工程师重写 Next.js(Vinext 项目)的 token 成本约 1100 美元。对比人力成本,这个开销基本可以忽略。但隐性成本是人的决策精力——温铭现在一天要做四五十个决策,这种强度的消耗不可忽视。
从 2026 年的实践来看,边界清晰的系统最适合——有明确的输入输出规范、有现成的文档和测试用例作为约束条件。最不适合的是需要大量隐性知识和非正式规则的遗留系统。不过这个边界也在快速模糊,Thoughtworks 已经用 LLM 辅助反向还原了完全丢失源代码的企业系统。