2026 年披露的主流 AI 推理 API 漏洞让加密思考链可被提取。企业接入 Claude/Gemini/o 系列前,先看这 5 条安全基线。
2026 年 8 月,安全研究者 Alexander Panfilov 团队公开演示:通过主流 AI 提供商 API,可以提取本应「加密」的内部推理标记。你的业务数据在进入推理链的那一刻,就不再只属于你。
推理模型(Claude 的 extended thinking、Gemini 的 thinking mode、OpenAI o 系列)在返回最终答案前会生成一段内部思考。提供商把它标记为「加密」或「不透明」,接口文档也承诺用户看不到这段内容。
问题在于这个「加密」很薄。Panfilov 团队发现,所有主流提供商的 API 都存在可构造的路径:只要让模型在输出里复述自己的思考过程,就能拿到与计费单位数量严格匹配的推理标记。数量对得上,说明提取是完整的,不是猜测。
更麻烦的是可移植性:加密思考在会话、用户、模型之间可以搬移。公开演示中,Anthropic 的 Haiku 4.5 被越狱后,能逐字转写 Opus 4.8 的原始思考——小模型读出大模型的内部推理。
这在学术上早有铺垫。Google Research 2024 年的论文《Chain-of-Thought Reasoning Without Prompting》证明:不需要任何 prompt,只改变解码方式(top-k 采样),就能从模型输出分布中诱导出完整思维链路径。既然推理路径本来就在输出分布里,接口层的「加密」更多是遮挡而不是隔离。
RAG 场景:检索到的私有文档进入上下文后,会被模型在推理链里反复引用。即使最终回答做了脱敏,内部推理标记里仍可能保留文档原文的改写片段。
Agent 场景:每一步工具调用、每一次中间判断都发生在推理链里。一个能调用内部系统的 Agent,其推理链就是一份内部系统交互日志。
数据流层面:推理链一旦可提取,「数据不出推理链」这个假设就不成立。企业如果已经按《个人信息保护法》和数据出境评估要求做了数据分级,那么进入推理模型的数据等于进了第三方处理链路,合规评估需要重新做。
| 基线 | 落地动作 | 优先级 |
|---|---|---|
| 敏感数据不入推理链 | 先分级脱敏再进模型;身份证、手机号、合同金额在网关层替换为占位符 | P0 |
| 网关脱敏 | 统一走企业 LLM Gateway,入口脱敏、出口审计,模型看不到原始字段 | P0 |
| 密钥轮换 | API key 短周期轮换,按业务线分 key、最小权限,泄露后立即吊销 | P1 |
| 会话隔离 | 不同业务线用独立会话与模型实例,禁止跨业务共用上下文 | P1 |
| 推理标记异常监控 | 监控思考耗时与输入输出的比例,长思考、频繁「复述」立即告警 | P1 |
我们给某零售行业客户做智能客服时,第一版直接把客户主数据(手机号、地址、会员等级)拼进 prompt。模型回答质量确实高,但安全评审时发现:内部推理标记里能还原出这些字段的改写。
后来全部改造:客户数据留在业务库,网关层用占位符映射,模型只拿到「用户#A1024 的订单问题」,真实字段在出口处回填。回答质量下降约 5%,但数据不再进推理链。这个代价值得。
推理模型的思考过程真的能被读取吗?能。Google Research 论文证明思维链可通过解码诱导;2026 年的披露进一步证实主流 API 存在可构造路径,推理标记与计费单位数量匹配即代表完整提取。
「加密」的思维链为什么还能被提取?接口层的加密更接近遮挡而非密码学隔离。模型解码时本来就会在输出分布中暴露推理路径,攻击者通过提示词或采样方式即可诱导复述。
企业还能不能继续用推理模型处理业务数据?可以用,但要把「推理链可见」当成默认假设:敏感数据先脱敏、统一网关、密钥隔离、监控异常,把安全基线当作成本项纳入选型。
本地部署开源推理模型是不是就安全了?只是把「第三方可见」变成「自己可见」。推理链泄露风险依然存在,但数据不出域,合规压力小很多,仍需做出口审计。
怎么判断我的 API 是否已被提取?重点看计费与行为异常:思考耗时突然增长、同一会话被反复要求复述思考、密钥在其他 IP 使用。建议接日志审计和告警。
如果你的团队正在把业务数据接入推理模型,建议先做一次 AI 应用安全评估:私信我们报价;也可以先看已交付案例里我们如何处理数据链路,更多工程实践在技术博客。