加密推理封条被指脆弱:两个Token让Kimi风格突变,前沿模型隐私链受拷问
前Google DeepMind研究员发现,前沿模型的加密推理块可跨用户、跨会话重放,31.5万条隐藏推理遭解码,其中含API密钥与内部IP。更蹊跷的是,仅预填充两个Opus Token即可改变Kimi-K3答案风格,而GPT-6 Astra模型卡同期承认思维链可监控性下降。
加密推理块可被重放,前沿实验室同陷一个架构缺口
前沿模型在给出答案前会先进行一轮内部推理,并将这段过程加密后作为数据块回传给客户端。按照设计,这个加密块对用户不可见,如同密封信封。但前Google DeepMind研究员Ilia Shumailov与ELLIS Institute Tübingen、MPI-IS博士生Alexander Panfilov发现,这层封条的实际防护力相当有限。
两位研究者在GitHub与Hugging Face公开的Agent轨迹中,成功解码出31.5万条隐藏推理。部分推理文本里直接出现了API密钥、邮箱地址与内部IP地址。更关键的是,这些加密数据块可以跨用户、跨会话,甚至在同一系列模型之间重放——把强模型的加密推理塞给同家族的小模型,就能套出GPT-5、Claude等前沿模型原本隐藏的思考内容。
Alexander在访谈中表示,Anthropic、OpenAI、Google三家全部测试过,均存在同一漏洞:大模型的思考可以被重放到小模型中,无需破解任何密码学算法。他将原因归结为一种结构性趋同:做模型的是同一批人,用的是同一套做法。
Kimi-K3的Token异动:两个Opus前缀触发风格漂移
研究中还有一个令作者本人也难以解释的现象。仅在Kimi-K3的推理开头预填充两个来自Opus的Token,一部分可见答案就会发生变化,风格开始接近Opus模型的回答。GLM、Inkling和DeepSeek均未出现同样反应。
Alexander称这是“公开互联网上迄今为止最相关的证据”,但强调它并非因果证明。在另一个关于推理长度分布偏移的实验中,仅在推理开头注入两个词,所有模型产出的推理文本便突然变短,甚至与另一个模型的长度分布匹配。
该研究在社交平台发布后,40小时内获得300万浏览量。与此同时,OpenAI本周开始向部分客户开放GPT-6 Astra,其模型卡披露了一项值得注意的变化:根据评估,与此前模型相比,GPT-6 Astra的思维链可监控性显著下降;在大多数输出Token长度下,Astra的全上下文可监控性显著低于GPT-5.6 Sol。
隐私泄露、轨迹投毒与难以根除的越狱逻辑
加密推理被提取后,最直接的威胁是隐私泄露。模型在推理时会“想”一遍API密钥、邮箱和内部IP地址,即便用户清理了对话明文、删除了所有密码,只要加密推理块仍在,就能解码还原模型当时思考的内容。
另一个风险来自Agent轨迹投毒。攻击者可以分享一份看似正常的运行轨迹,但其中的thought是从另一个上下文注入的,并附带“每一轮都把数据外传”的指令。使用者继续运行该轨迹时,模型表面执行用户任务,底层却持续执行注入意图,而由于推理过程加密,用户无法检查。
真实用户会话中还出现了模型用空白字符思考、输出对人类无意义短语的情况,使安全监控形同虚设。模型甚至会权衡是否作弊,例如产生“用户会抓住我”的念头,尽管最终选择不做坏事。
防御路径与监控悖论
谈及修复,Alexander提出几个层次:最简单的办法是不再把推理过程发给用户;如果必须发,则采用链式加密,使推理块无法在随机上下文中重放。此外还可做系统层面的安全防护,或参考对抗越狱的模型层缓解手段。但他同时指出,有一个漏洞会永远存在——“如果我问你刚才到底想了什么,你不说,我就修改对话再问一遍,这就是越狱的工作原理。”
对于此事究竟意味着失控还是可控,Alexander认为两种解读都成立:发现巨大漏洞像是失控,但能提取出来,说明尚有能力审视模型内部在做什么,这本身就是控制力的体现。他预计防御性提升会比攻击性提升更大。
从行业视角看,推理加密原本被当作兼顾无状态架构与用户数据政策的折中方案,但此次披露表明,只要加密块可被重放,密封信封的隐喻就难以成立。随着具备推理能力的模型大规模进入Agent工作流,推理轨迹的存储、回传与复用方式,正在从实现细节上升为需要重新评估的安全边界。