Fable 5 撤下前,我们用 165 美元推翻了一个 Prompt 常识
Anthropic 在 Fable 5 上堆了最强安全护栏,结果日常 debug 都被误拦。一位开发者在模型暂停期间花 165 美元跑了 25 次实验,发现 8 套可跨模型迁移的交互框架。核心结论:别再研究怎么跟模型说话,把你的偏好固化进系统指令,让模型来理解你。
Anthropic 在官方复盘里承认了更值得关注的事:为防范越狱而调大的安全分类器,把大量日常编码和调试请求也误拦了。原文:"the new classifier flags benign requests more often during routine coding and debugging tasks."
在这个窗口期,一位开发者做了一场极端实验——让模型自主设计并执行 25 轮迭代,总花费 165 美元,最终沉淀出 8 套可跨模型迁移的交互框架。核心结论一句话:别再研究怎么跟模型说话,把你的编码习惯、架构偏好、决策逻辑固化进系统指令,让模型来理解你。
时间线与关键事实
- 6 月 9 日:Anthropic 发布该模型,搭载最强安全护栏。
- 6 月 12 日:美国以 Amazon 研究员发现越狱路径为由实施出口管制,Anthropic 暂停全球访问。
- 6 月 30 日:管制解除。改进版安全分类器上线,拦截率达 99%——代价是更多良性编码请求被误拦。
- 7 月 1 日:全球恢复,Pro/Max/Team 享 50% 免费额度至 7 月 7 日,之后走 credits。
Anthropic 的补充测试还发现:同一越狱方法在 Opus 4.8、GPT-5.5、Kimi K2.7 上同样生效。该模型不是更危险,是它的外围防护层被调得太敏感。这个细节对理解后续实验的意义至关重要——当模型外围在持续变化,调模型本身远不如调系统指令稳定。
165 美元实验的 8 套框架
公众号「卡尔的AI沃茨」作者在停服期间,让 Claude 自行设计实验、执行、评估,循环 25 轮,产出以下成果。这本质上是一次 Agentic Coding 的极限测试——从「写代码」到「自主做项目」的跨越:
| 框架 | 核心逻辑 | 实测数据 | 跨模型通用性 |
|---|---|---|---|
| 目标驱动实验 | 给目标而非步骤,让模型自行设计执行路径并迭代 | 构建速度 ↑50%,token ↓60% | ✅ 支持 tool-use 即可 |
| 编码习惯固化 | 把个人编码偏好写成结构化规则注入系统指令 | 消除每轮对话的重复解释成本 | ✅ 几乎所有模型 |
| 子任务边界定义 | 用自然语言划定 subagent 的行动范围 | 跑偏率大幅下降 | ✅ Claude Code / Copilot / Cursor |
| Shadow A/B 测试 | 同时跑两套指令变体,自动选优 | 持续优化交互质量 | ⚠️ 需并行调用支持 |
| 关键点人工确认 | 重大决策节点自动暂停,等待人工介入 | 减少连锁错误 | ✅ tool-use 模型均可 |
| 错题本记忆 | 维护历史错误模式库,遇到同类场景自动调取教训 | 同类错误复现率降低 | ⚠️ 需持久化存储 |
| 反向需求澄清 | 执行前追问模糊点,确认度达 95% 才动手 | 大幅减少"做了但不对" | ✅ 所有对话模型 |
| 定时循环调度 | 预设 tick,每个 tick 自动触发一项任务 | 适合日报、监控等周期工作 | ⚠️ 需外挂调度器 |
注意上表的共性:没有一套是在教模型"怎么做",它们全都在教模型"你是谁"。
为什么"研究模型"这条路到头了
过去三年,行业通行做法是逐模型调参:GPT 系偏好 markdown、Claude 系吃 XML 标签、Gemini 对角色设定敏感。每换一个模型就得重新学一套方言。
这次事件拆掉了这条路的三根支柱:
- 外围防护层持续迭代。 模型核心能力没变,安全分类器一周一个版本。上周能用的对话模板,下周可能被误拦。
- 底层能力趋同。 Anthropic 官方测试显示 Opus 4.8、GPT-5.5、Kimi K2.7 完成同一技术任务的水平已无明显差距。真正拉开体验的,是模型能不能在对话开始前就了解你的上下文。
- 用量计费倒逼效率。 7 月 7 日后走 credits。如果前 5 轮对话都在解释"我用 strict TypeScript、no any、函数式风格",这些 token 全是浪费。
解法反直觉但简单:把团队编码规范、架构约定、甚至"哪些决策不需要问我"一次性写入持久化系统指令。模型加载对话时自动读取,不需要你重复。
我们走过的一段弯路
蓝曜炬辉团队 2025 年刚开始用 Claude Code 做 AIcoding 交付时,踩的就是"研究模型"的坑。两周全花在调对话模板上:XML 还是 markdown?角色设定要不要?指令放前还是后?关于这个阶段的完整复盘,见从个人提效到团队 10x 交付的流程重塑。
结果一团糟。同一套模板在 Sonnet 4.5 顺畅,升级到 4.6 频繁翻车。更严重的是,四个开发各自用各自的对话风格,同一个项目 API 命名在 snake_case 和 camelCase 之间横跳。
后来我们彻底换了一种策略:不再花一分钟研究模型的"脾气",而是把 800 字的项目编码宪法写进所有对话的系统指令头部——精确到依赖版本号、目录树结构、错误处理模式、以及"不确定时优先查哪个文档"。切换后,Claude Code、Cursor、GitHub Copilot 三套工具产出风格高度一致。新人入职第一天就能提交风格统一的 PR。
今天就能落地的三个动作
一、建规则目录。 在项目根目录创建 .claude/skills 或 .cursorrules,写入反向澄清逻辑——让模型在任何代码修改前先确认目标、边界、禁区。Claude Code 对中国用户的隐式风险与企业自建 Agent 的拐点一文中有更详细的安全边界讨论。
二、用 A/B 方式迭代指令。 不要凭感觉调整。每次改系统指令,同时保留新旧两版,同一任务各跑 5-10 次对比输出。Claude Code 可通过不同标记区分版本。
三、把团队共识从人脑迁到系统。 每次 code review 都在重复"命名不对""错误处理方式不要用",说明这些规则该进指令而非靠人纠正。一次写入,长期生效。
常见问题
Fable 5 是不是下线了?
没有。已于 2026 年 7 月 1 日全球恢复访问。7 月 7 日后免费额度取消,改走 credits 计费,API 和 Claude Code 通道不受影响。
这 8 套框架只对 Claude 有效?
不是。其中目标驱动实验、编码习惯固化、子任务边界定义、反向需求澄清、关键点人工确认这 5 套是模型无关的,依赖的是 tool-use 和上下文理解,GPT-5、Kimi、DeepSeek 上都能用。
"让模型理解你"具体怎么操作?
把偏好从每次对话口头解释迁移到持久化指令。比如不要每次都打"请用 strict TypeScript、禁止 any 类型",而是写进 CLAUDE.md 或 .cursorrules,模型加载对话时自动读取。
165 美元实验划算吗?
按构建速度提升 50%、token 降低 60% 估算,日均 AI 协作 3 小时以上的开发者回本约需 2-3 个工作日。
