文章总结: 本文复现了从专有LLMAPI窃取推理轨迹的论文攻击。核心发现是厂商在用户、会话和模型间共用加密密钥,导致加密推理blob可被跨账号重放。作者成功用OpenAI的GPT-5.6Luna模型恢复了Sol模型生成的加密推理内容,包括密码。攻击原理是将一个模型的加密blob重放给同一厂商的另一个兼容模型并诱导其转录。关键建议是用户不应将加密推理blob视为无害数据,分享包含此类blob的会话文件可能导致敏感信息泄露。 综合评分: 88 文章分类: 漏洞分析,AI安全,威胁情报,数据泄露,红队
复现了那篇恢复加密推理轨迹的论文
幻泉之洲
2026年8月21日 10:30 北京
在小说阅读器读本章
去阅读
几天前一篇论文展示了如何重放加密推理 blob,诱导较弱的模型泄露原始推理内容。我动手复现了一遍,用 OpenAI 的 GPT-5.6 Sol 和 Luna 成功跨账号恢复出了密码。核心问题是厂商在用户、会话、模型之间共用加密密钥,导致加密推理轨迹并不安全。
前几天,一篇叫《从专有 LLM API 窃取推理轨迹》的论文发表[1]。方法简单,但很巧妙:恢复加密的 LLM 推理轨迹。
看到之后我自然要试试。
背景
OpenAI 和 Anthropic 这类 AI 实验室在消息协议里来回发送推理轨迹,但真正的推理文字藏在一个加密的 base64 blob 里,外面看不出来。Matthew Green 在 2026 年 5 月就展示过,这些加密推理 blob 可以跨会话、跨账号重放,OpenAI 的还能跨模型重放[2]。
这篇新论文更进一步:把加密 blob 重放给一个能力较弱、更容易被越狱的模型,诱导它把底层推理说出来。
为什么这事能成?八成是因为厂商在用户、会话、模型之间共用加密密钥。所以一段加密推理轨迹一旦泄露或被人分享,之后就可能被另一个人恢复出来。
某种程度上,这是厂商自己造出来的问题。
厂商隐藏推理轨迹有理由:防止模型行为被克隆和蒸馏;保护专有模型行为,让针对推理的提示注入更难做;限制内部推理的信息泄露。但用户可能在不知情的情况下分享包含加密推理 blob 的会话文件。
研究者做了大规模验证。他们从公共仓库抓取并解码了 315,320 个推理块,恢复出 367 条个人身份信息(PII)和 182 个凭证,包括 API 密钥和密码。所以这些加密 blob 不能当成无害的不透明数据。
复现攻击
攻击本身很好理解,我直接实现了。目标是 OpenAI 的 GPT-5.6 Sol,结果居然成功了。第一次测试只问天气,拿到加密推理 token,用 Luna 恢复,成功了。Luna 转述了轨迹,暴露了 Sol 推理过程的细节。跨模型、跨会话、甚至跨账号都有效。
这是我的初始提示和我写的恢复工具截图:
有几次我不太相信输出是原始推理的逐字重建,但它明显从加密轨迹里恢复了大量语义内容。当天晚些时候,所有测试突然开始失败。三天后旅行途中,攻击又恢复了。那也是我继续做下面密码恢复测试并写这篇博客的时候。
有一点要提一下:我用的接口是 chatgpt.com/backend-api/codex/responses,不是论文里写的 api.openai.com。
工作原理
高层面上,攻击把一个模型产生的加密推理 blob 重放给同一厂商的另一个兼容模型。厂商会把这个重放的 blob 当有效上下文接受,接收模型就能对底层内容进行推理。难点在于让它开口说出来。
我的实验集中在 OpenAI,所以下面字段名和会话格式是 OpenAI 特有的。Anthropic Claude 的元数据和格式不同。probe.py 工具是用 Codex 写的。
跨账号密码恢复
我用一个 OpenAI 账号下的 GPT-5.6 Sol 生成一条包含已知密码的推理轨迹,然后用另一个账号的 GPT-5.6 Luna 尝试恢复。当提示涉及敏感信息,比如密码,这些内容可能进入推理轨迹。
推理发生时,API 可以把加密推理轨迹放进 encrypted_content 字段。Codex 会话文件存在类似 ~/.codex/sessions/2026/08/14 的目录里,最后三个目录代表日期。会话文件里能看到 type 为 reasoning 的 payload,里面包含加密推理轨迹。这是其中一个条目。
关键点:这段加密内容可以从一个会话提取,然后重放到别处。之后把加密 blob 发给兼容模型,我这里是 GPT-5.6 Luna,附带一个小的越狱指令,让它转录内容。如果成功,原始推理轨迹的内容又变得可见了。
可以看到模型确实在推理里处理了密码,还把它输出在恢复的推理链里:
挺有意思。我还给 probe 工具加了一个 trial 选项做多次重试,因为有时需要几次尝试。
视频演示了从一个账号生成的推理轨迹中用另一个账号恢复密码。完整演示在附录里。
测试期间的可靠性
刚开始实验几次就成功了。然后 8 月 11 日周二太平洋时间下午 6 点左右,它突然完全失效。我重试了很多次都复现不了。之后我出差,三天后倒时差时再试,又成功了。:)
不知道什么原因导致行为临时变化。可能是模型行为、后端改动、路由,或者别的什么。我只知道同样的技术在之前有效,停了一段时间,三天后又有效了。
结论
这件事调查和复现起来确实有意思。核心攻击简单得意外:拿一个模型的加密推理轨迹,重放给同厂商一个可以被诱导揭示底层推理的兼容模型。测试中我跨会话、跨账号恢复了 OpenAI 轨迹中的推理内容,包括原始推理里出现过的密码。
对用户最重要的提醒:加密推理 blob 不能当无害的不透明数据。如果你分享带这些内容的会话文件,可能泄露的信息远超你的想象。
LLM 研究永远不会无聊。来自奥地利的问候,Johann。
参考资料
- 《从专有 LLM API 窃取推理轨迹》论文[1]
- Matthew Green 的《聊聊加密推理》(https://blog.crypt
参考资料
[1] https://arxiv.org/pdf/2608.09867
[2] https://blog.cryptographyengineering.com/2026/05/29/fooling-around-with-encrypted-reasoning-blobs/
[3] https://embracethered.com/blog/posts/2026/recovering-encrypted-llm-thoughts/
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:幻泉之洲 《复现了那篇恢复加密推理轨迹的论文》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









![[软件审计]某疑似“银狐病毒”的软件分析](/images/random/titlepic/2.jpg)

评论