Codex 与 Claude Code 负责人公开互撕,暴露 2026 年 AI 编程真正的战场从模型转向 Harness。汇丰、网龙、TiDB 一线数据 + 哑铃质量模型,给企业落地四条可执行建议。
7 月 12 日,OpenAI Codex 负责人 Tibo 在 X 上公开教用户把 GPT-5.6 Sol 塞进 Claude Code,还承诺"如果这个办法被封,我欠大家一次 reset";一个月后,照做的开发者 Alex Getman 的 Anthropic 账号真的被暂停。这场封号闹剧背后,是 2026 年 AI 编程最重要的一个信号:竞争焦点已经离开模型本身,转向了执行框架(harness)。
事情起因是开发者 Theo 的观察:同一个 GPT-5.6 Sol,放进竞争对手的编程工具里跑,在部分任务上的表现反而比放在自家 Codex 里更好——模型没变,变的是外面那层执行框架。随后 Tibo 在 7 月 12 日公开了实现方式:保留官方、未修改的命令行客户端,在本机跑一个 CLIProxyAPI 把推理请求转发给其他模型提供商。开发者 Alex Getman 基于此搭了 claudex 项目,并记录了自己账号被以"suspicious signals"为由暂停的经过。
Anthropic 的 Boris Cherny 下场时没有先解释封号,而是先问 Tibo"要不要来上班",随后澄清不会因为用户在自己的工具里用其他模型而封禁账户,并通过 LiteLLM 等方式支持多模型。最终 Alex 的账号恢复,Tibo 拒绝了工作邀请,并按承诺重置了 Codex 和 ChatGPT Work 用户的额度。
比事件本身更有信息量的是 OpenAI 官方对 GPT-5.6 技术架构的说明:Codex 和 ChatGPT Work 使用的执行框架是连接模型、工具和用户环境的一层 Rust 编排系统,负责管理上下文、工具调用、重复任务和整个循环。InfoQ 对这场交锋的完整复盘把问题摆到了桌面上:模型和执行框架既然能被拆开,最好的 GPT 不一定非要跑在 Codex 里,最好的模型也不一定非要跑在自家工具里。对企业选型来说,这意味着只看模型跑分已经不够了,工具链怎么配才是真正的分水岭,我们之前对 Claude Code 智能体循环的拆解说的就是这个。
InfoQ《极客有约》请来汇丰科技内部开源负责人李渭宁、网龙网络资深技术总监陈洁、平凯数据库(TiDB)智能研发中心负责人柏佳辰,聊了各自把 AI Coding 放进生产环境后的真实情况(完整内容见 InfoQ),几个数字值得反复看:
网龙陈洁把团队分成两种模式,对 CTO 做规划很有参考价值:
| 维度 | 智能体协作、人工主控 | YOLO Mode(激进 Pilot) |
|---|---|---|
| 适用团队 | 业务相对稳定、对 AI 编程接受度仍在提升 | 愿意验证激进做法的技术小组 |
| 工作流 | Codex、Gemini CLI 等编程智能体 + Superpowers,覆盖需求设计、技术调研、架构设计、详细设计和实现 | 先明确目标和边界,让智能体持续执行,人工只做关键节点把关 |
| 审查方式 | 流程规范,实施细节交给工具,链路较长 | 不再逐行审查,靠自动化门禁 + 端到端验收 |
| 安全要求 | 常规权限控制 | Bypass Permissions 必须在与主机、敏感数据、生产资源隔离且默认无互联网访问的环境中使用 |
我们蓝曜炬辉在交付 AI 应用项目时也观察到同样的分化:同一套编程工作流,有的客户团队两周跑通 RAG 链路,有的团队一个月还在和幻觉死磕。差别不在工具,而在有没有把需求规格写清楚、有没有把验收门禁建起来。
TiDB 柏佳辰给了一个很准的比喻:代码质量从原来的纺锤形变成哑铃形——AI 编程工具更像是自然语言的编译器,团队更在意的是前面的 SPEC 和后边的 testing。"每个开发都变成 QA,关注 End2End",不再把逐行人工审查作为默认方式,而是风险分级审查、自动化门禁和端到端验收。这个转变和 Agentic Coding 里"AI 从写代码变成做项目"是同一件事的两面。
这个判断和 Anthropic 内部的技术观察互相印证。Anthropic 的 Daisy Hollman(前 C++ 标准委员会主席,负责 Claude Code 插件与智能体团队设计)在 NDC Copenhagen 的演讲(InfoQ 整理稿)指出:上下文窗口一年来基本停滞在百万 token 级,把越来越多的信息塞进固定上下文已经变成一项全职工程任务;2026 年的核心转变是"从把信息输入模型,转向把信息从模型输出给用户——人的注意力才是系统中最小的盒子"。她还引用 METR 的图表:模型能以 50% 成功率完成的任务时间跨度大约每四个月翻一番,但这条曲线今年年初开始停滞——不是能力到顶,而是"什么算 16 小时任务"的误差范围已经大到图表几乎失效。
反面教训同样来自这次公开讨论:Mozilla 4 月用最新模型修复的安全漏洞数量,超过过去 15 个月修复的总和——工具上限很高;但如果团队把 Bypass Permissions 当默认模式,数据库结构变更、生产环境操作、外部网络访问没有人工门禁,工具的"高产出"就会直接变成生产事故。这类翻车不是个例,YC CEO 在一个 3.7 万行的项目上踩过的坑值得先看一遍。安全没有一劳永逸,只能"发现问题快速亡羊补牢",每个智能体要有身份标识、操作日志可追溯。
问:2026 年企业该选 Codex 还是 Claude Code?
答:问题本身问错了。Tibo 的演示已经证明模型和执行框架可以拆分,真正要评估的是执行框架与你们工程流程的契合度、权限体系、可观测性,以及团队对工具链的熟练度。建议拿自己的代码库跑一轮真实任务再做决定,别只看基准分。
问:AI 写代码会替代工程师吗?
答:汇丰的实践是反例——AI 来了业务需求大幅增加,团队在扩招。AI 编程改变的是工程师的时间分配:从逐行写代码转向写 SPEC、审方案、做端到端验收。被替代的不是工程师,而是"只写代码、不负责结果"的工作方式。
问:怎么避免 AI 生成的代码变成技术债?
答:用哑铃结构:前面 SPEC 写清楚完成条件和验收标准,后面端到端测试自动化兜底,中间让工具自由发挥。出问题回到门禁处理,而不是回到逐行 review——逐行审查已经跟不上工具的产出速度。
问:token 计费对企业成本影响大吗?
答:汇丰的例子是每人每月几百美金、只有少数人用光。企业要治理的不是总额,而是"无差别给所有人开智能体权限"——按任务范围授权,让 token 花在高价值改造上,而不是让工具到处乱试。