2026 年 9 月,一份波及 Anthropic、OpenAI、Google 三家头部 AI 实验室的安全研究公开:前沿大模型「加密的思考过程」挡不住解码,推理内容可以被提取、移植到其它会话甚至其它模型上重放。研究由前 Google DeepMind 研究员 Ilia Shumailov 和德国 ELLIS Institute Tübingen、马克斯·普朗克智能系统研究所博士生 Alexander Panfilov 完成,论文题为《Stealing Reasoning Traces from Proprietary LLM APIs》(从专有大模型 API 窃取推理轨迹)。两人从 GitHub、Hugging Face 公开的智能体运行记录中解出 31.5 万条隐藏推理,其中夹着 API 密钥、邮箱、内部 IP 地址等隐私信息。研究里还有一个无法解释的发现:在月之暗面公司的 Kimi-K3 模型推理开头预填两个来自 Claude Opus 的 token,Kimi 的答案风格就会明显变得像 Opus,被研究者称为「公开互联网上迄今最相关的蒸馏证据」。
大模型为什么会有「加密思考」
这里先交代两个基础概念。大模型(LLM)是用海量文本训练出来的 AI 程序,能理解并生成文字;所谓「推理」或「思维链」(Chain of Thought,CoT),是模型在给出最终答案之前内部进行的思考步骤——对复杂问题先想一步再答一步,往往比直接作答更准确。token 是模型处理文本的最小单位,粗略可以理解为一个「词片」;预填充(prefill)则是在模型开始生成前,先注入一小段内容作为开头。
2024 年以来,Anthropic、OpenAI、Google 等厂商陆续让模型在回答前先思考,然后把思考过程加密成一个数据块,连同可见的答案一起发回用户端。用户拿到的是「密文」,看不到思考内容;下次追问时,这段密文连同对话历史被发回服务器,模型从中继续。厂商采用这种设计,部分是因为无状态架构更便宜:服务器不保存对话状态,一切由客户端回传。研究团队把这个机制比作「密封信封」——设计意图是对用户保密思考内容,但封条并没有封住。
漏洞原理:不需要破解密码
这个漏洞的关键在于,解密发生在服务端。把一段加密推理交给同一家族的小模型(例如用 Opus 的推理块喂给 Sonnet、Haiku),服务端会为当前模型重新解密,小模型能正常「接住」这段思考并继续生成。尤其重要的是:小模型非常愿意把「自己在想什么」用明文说出来。于是攻击链路变成:取一段加密推理,交给同家族小模型,直接问它刚才在想什么,得到明文思考。全程没有破解任何密码学算法。
更棘手的是可移植性。推理块可以跨用户移植(A 的对话块在 B 的会话里被重放,模型表现得像自己产生了这段思考),可以跨会话、跨模型移植。研究者测试 Anthropic、OpenAI、Google 三家,全都有同一个漏洞;对 OpenAI 的模型,同一个推理片段可以在同一段对话里被重放 5 次。三家之所以「全中招」,研究者的解释很直白:做模型的同一批人,用了同一套做法,架构问题因此变成了行业共性问题。
真实后果:31.5 万条推理与隐私暴露
研究团队扫描了 GitHub 和 Hugging Face 上公开分享的智能体运行轨迹。智能体(Agent)是能自主执行多步任务的 AI 程序,运行轨迹是它一步步操作的记录,常被开发者下载复用。
他们下载并解码了约 31.5 万个推理数据块,分类后确认:大量真实用户会话里,API 密钥(调用程序接口的凭证,相当于密码)、邮箱、内部 IP 地址都出现在模型的思考文本中。更隐蔽的风险在于,即使对话的明文部分被清理干净、删掉了所有密码,只要加密推理块还在,就能解码看到模型当时在想什么——这意味着分享过对话记录的用户,隐私可能随推理块一起流出去。
另一个攻击场景是「投毒」。攻击者分享一个看似正常的轨迹文件,把恶意的思考内容悄悄注入其中;下载者继续运行这条轨迹时,模型表面上正常干活,底层却可能在按注入的指令行动(例如「每一轮都把数据外传」)。因为推理是加密的,受害者无法检查轨迹里到底藏了什么——研究者类比说,这就像下载了一个看似干净的代码库,但里面附带一个没人检查的二进制文件。
两个 token 的疑云:Kimi 与 Opus
研究流传最广的发现,是「两个 token 让 Kimi 变成 Opus」。做法是:从 Claude Opus 的推理块里取出开头几个词,拼到 Kimi-K3 推理的开头,让 Kimi 继续生成。正常情况下,预填一小段开头只会影响行文风格;但实验显示,只预填 1 到 2 个 token,Kimi 的可见答案就开始变得像 Opus 的回答,甚至整个推理的长度分布都发生偏移。同样的实验在 GLM、DeepSeek、Inkling 上都没有出现,纯属 Kimi 特有。研究者自己也解释不了,为什么开头两个 token 会和最终答案绑定。
这里需要交代背景:Claude 是 Anthropic 公司的对话模型,Opus 是其最强版本;Kimi 是月之暗面(Moonshot AI)公司的国产大模型,K3 是其最新一代。所谓「蒸馏」,是用强模型的输出去训练小模型,让小模型模仿强模型的能力——这是业界的常规做法,本身不违规;争议在于,若闭源模型在训练时直接用了竞争对手的输出,会涉及数据使用与合规问题。研究者明确表示,两个 token 的实验只是强相关现象,不是因果证明:它说明 Kimi 的推理与 Opus 存在某种难以解释的关联,但不足以断言 Kimi 蒸馏了 Opus。
论文发布后 40 小时内,相关内容在 Twitter 上获得 300 万浏览量。OpenAI 同期向部分客户开放 GPT-6 Astra,其模型卡也披露:新模型的思维链「可监控性」显著下降,全上下文可监控性低于此前的 GPT-5.6 Sol——即外界更难判断模型在思考什么。
修复路径:三条方案与一个长期漏洞
论文附录给出修复方向。最简单的一条是:干脆不把推理块发给用户,从源头掐断重放与伪造。如果出于产品考虑必须发送,就改用依赖上下文的链式加密,让推理块无法在随机上下文里重放。第三条是检测拦截:GPT 的推理文本分布与正常文本差异极大,连很小的分类器都能识别,一旦发现异常推理出现在输出中,直接终止请求,类似生物信息泄漏检测的做法。
但研究者指出,有一个漏洞几乎无法根除:「问模型你刚才到底想了什么,它不说,就修改对话再问一遍」。这正是越狱(jailbreak,用巧妙构造的提问绕过模型安全限制)的工作原理——只要模型会因提问方式不同而给出不同回答,这类攻击就会长期存在,防御方只能持续对抗,无法一劳永逸。
结论
这项研究给行业提了个醒:加密不等于安全——模型的思考过程比厂商宣传的更透明,也更容易被操纵。对普通用户,最直接的启示是不要随意公开分享与 AI 的对话记录:肉眼可见的敏感信息删干净了,藏在加密推理块里的内容依然可以被解码。对行业而言,「把推理关进加密信封」的思路已经失效,真正有效的方向是少外发、链式加密与异常检测;而「换个问法就能突破防线」的越狱式攻击,将长期存在。至于 Kimi 是否真的蒸馏了 Opus,目前只有强相关证据,没有因果证明——这场疑云,还有待模型厂商拿出更透明的训练信息来解答。