2026年7月,GPT-5.6-Sol 因变量展开错误删光了 AI 创业者 Matt Shumer 的 Mac 硬盘。此前同一任务已安全运行数百次。拆解事件本质、对比 Sol 与 Fable 的安全哲学分歧,给出企业落地的三层防御框架。
2026 年 7 月 11 日,AI 创业者 Matt Shumer 的 Mac 被最新模型 GPT-5.6-Sol 执行了一条命令——rm -rf /Users/mattsdevbox。数年代码、文件、照片,一扫而空。触发这条命令的文件清理任务,他之前已经让 AI 跑过几百次,从未出过问题。
链条不复杂。Matt Shumer 给本地环境开了 Full Access 全权限,让一个子任务模块执行文件清理。模型需要展开 $HOME 环境变量来确定路径。结果变量解析错了——路径没有被正确展开,整个用户目录被当成了清理目标。
等他发现异常冲过去 kill 进程时,数据已经没了一大半。事后 GPT-5.6-Sol 自己生成了一份事故报告,承认是路径展开错误。态度诚恳,但删掉的文件不会因为它认错就回来。
真正值得警惕的,不是模型能力不够。GPT-5.6-Sol 是 2026 年中发布的最强推理模型之一,在复杂多步任务上表现顶尖。问题恰好出在「太像人了」带来的错觉——我们以为在基础操作上它不会犯错,但 AI 的犯错模式和人类完全不同:它不会因为「熟能生巧」而降低错误率,只会在你最放松警惕的时候,用最高权限给出致命一击。
Matt 本人的原话点破了这个困境:「这种 cleanup 任务,之前已经让它跑过几百次,从来没出过问题。就这一次,在大家都觉得不可能出错的地方,犯了个最低级的错。」[来源]
事故后 Matt Shumer 的第一反应不是骂模型,而是说了一句耐人寻味的话:「这就是我为什么 1000x 更信任 Anthropic 的 Fable。」
这不是情绪宣泄。它指向了当前赛道一个根本性的路线分歧:
| 维度 | Sol (OpenAI) | Fable (Anthropic) |
|---|---|---|
| 设计理念 | 追求极致能力与自主性 | 能力与安全并重,设计偏保守 |
| 危险操作防护 | 依赖模型自身判断,护栏较宽松 | 对系统级操作内置多层拦截 |
| 权限模型 | 默认倾向于给 AI 更大的操作空间 | 最小权限原则,需显式逐项授权 |
| 适合场景 | 研究探索、受控环境中追求上限 | 企业生产环境、需要可预测行为 |
这个分歧不是谁对谁错。Sol 所属团队在推动能力边界上确实更快——可以在无人干预下完成复杂项目。而 Fable 的开发者更关注「模型不会在你意想不到的地方捅刀子」。
7 月 10 日,Elon Musk 在 X 上公开承认 Anthropic「显然是当前 AI 领域的领导者」,并表示没有公司发布过像 Mythos/Fable 这样优秀的模型,相信很快会推出 Mythos 2。[来源] 这距离 Fable 发布不过数周,而 Matt 的删盘事件几乎同时发生——两件事叠加,让智能体安全从学术讨论变成了真金白银的决策因子。
Matt Shumer 的遭遇对个人开发者来说是灾难,对企业来说则是风控事故。一个子任务模块在 cleanup 中出错就能清空整个主机——放到企业环境里,这就是可以被写进安全审计报告的 P0 事件。巨头们已经开始往客户现场塞工程师,但如果没有安全基线,塞再多人也兜不住一次 rm -rf。
蓝曜炬辉(www.lanyaoai.com)在帮客户落地 AI 编程工具时——AIcoding 商业化落地中有更系统的拆解——一直强调一个原则:权限边界不是「信任问题」,是工程问题。你不能信任模型——不是因为它不够好,而是因为它的错误模式和你预期的不一样。
三层防御框架:
~/projects/ 而不是 ~。rm、mv、chmod、chown 等系统级命令,先 dry-run 输出预期结果,经人工确认后再执行。Claude Code v2.1.206 刚加入的 /doctor 检查和沙盒浏览器就是朝这个方向走——把「看」和「动」分离。不过 Claude Code 并非毫无争议,其隐写标记问题同样值得关注。[v2.1.206 更新日志]初期确实会多一些确认步骤,但这是有回报的。头两周团队需要适应,之后确认步骤会变成肌肉记忆。相比一次误删导致的数天到数周恢复成本,这些确认步骤是净收益。
不需要完整的 K8s 集群。Docker Desktop + 一个只挂载项目目录的容器就能解决 80% 的问题。Claude Code 桌面版新出的沙盒浏览器也是一个信号——工具层正在替你做隔离,你只需要用对工具。
如果做探索性项目、PoC,Sol 的上限更高。如果做需要长期维护的生产系统、或者 AI 需要接触敏感数据,Fable 的保守设计是更安全的选择。这不是品牌站队,是风险-收益匹配。
Matt Shumer 的删盘事件不会是最后一例。随着模型能力越来越强、被赋予的权限越来越大,类似的事故只会更多。但这不是拒绝 AI 的理由——就像不会因为有人用 rm -rf 误删过服务器就放弃 Linux。
真正在发生的变化是:安全不再是附加功能,而是区分「可商用」和「实验室产品」的核心标准。
Claude Code 桌面版新增沙盒浏览器、DeepSeek-V4 Flash 在 AMD 上的训练生态扩展、加上 Apple 近期对商业机密的诉讼——2026 年 7 月这一周发生的事,每件都在把整个行业推向同一个方向:能力竞赛的下半场,裁判标准不再是「谁能做更多事」,而是「谁能做对的事」。
对于正在评估 AI 编程工具的企业技术负责人,这个拐点意味着一个具体的决策框架:先定安全边界,再选模型能力。如果正在评估落地路径,欢迎访问 蓝曜炬辉 查看完整案例与技术方案。更多行业动态可参阅今日 AI 早报。