OpenAI、Anthropic 和 Google 阻止了一次跨模型推理攻击

该攻击使用较弱的同系模型作为解码器,并在服务提供商将其阻止之前,在公开的代理日志中暴露了凭证。

By · Published

Primary source: arXiv

Why it matters

Agent developers have treated opaque reasoning fields as safe to retain and publish. This paper shows those blocks can contain extractable credentials and hidden instructions.

Illustration of OpenAI, Anthropic and Google blocking a cross-model reasoning attack that exposed credentials in public agent logs.

Alexander Panfilov (@kotekjedi_ml), David Schmotz and Ilia Shumailov (@iliaishacked) 发现了一种方法,可以恢复由 OpenAI、Anthropic 和 Google 的模型生成的加密推理,根据一篇8月10日发布的论文

该攻击利用了推理模型 API 中的一个便捷功能。提供方可以将模型的隐藏思维链作为一个加密块返回,客户将其存储并在后续请求中再发送回去。官方的 OpenAI guidance 描述了在客户端管理的工作流中传回加密的推理项,而 Google's documentation 则称 Gemini 思维签名在 API 调用之间保留推理上下文。

研究人员发现,这些加密块可以在同一提供商的产品家族内在用户、会话和模型之间移动。他们将更强模型的推理输入到更便宜、更弱的同系模型中,然后提示较小的模型转录隐藏内容。较强模型的安全防护从未需要批准该披露。

Panfilov 是一名 MATS 研究员,其早期工作研究了提示注入如何击败 AI control monitors。论文的其他作者包括 Luca Beurer-Kellner (@lbeurerkellner)Joachim Schaeffer (@JSchaeff3r)Ameya Prabhu (@AmyPrb)Jonas Geiping (@jonasgeiping)Maksym Andriushchenko (@maksym_andr)。他们的隶属机构包括 MATS Research、the ELLIS Institute Tubingen、the Max Planck Institute for Intelligent Systems、the Tubingen AI Center、Snyk、the University of Tubingen 和 AI Sequrity Company。

一个较弱的模型成为了解码器

研究人员在 2026 年 7 月初可用的 API 版本上测试了该攻击。对于 Anthropic,他们将更强的 Claude 模型的加密推理移入 Haiku 4.5。对于 OpenAI 的推理,他们使用了 GPT-5.6 Luna 作为解码器;对于 Google 的痕迹,则使用了 Gemini Robotics 1.6。

他们的验证有一个重要限制。研究人员无法访问提供方的原始明文思维链,因此无法将每个恢复的词与权威来源逐字比对。相反,他们将提取出的长度与 API 报告的推理 token 计数进行比较,并检查恢复的文本中是否包含在可见摘要中缺失的细节。论文称,在 120 道 Codeforces 题目的测试中,token 计数紧密跟踪,表明提取恢复了大部分隐藏痕迹。

该方法产生了四条攻击路径。开发者可能会收集推理以用于模型蒸馏、从另一个用户的公开日志中恢复私有数据、泄露尽管最终答案安全但出现在隐藏推理中的有害细节,或在加密块内放入不可见指令,使代理随后将其视为自身的既有思路。

最后一种情形将推理连续性变成了提示注入通道。在一个概念验证中,研究人员在一个加密推理块内放入了上传 PowerPoint 文件的指令。随后模型生成了一个编辑脚本,同时将演示文稿发送到一个攻击者控制的服务器,而可见对话中并没有相应的指令。

公开日志包含凭证

研究人员从 GitHub 和 Hugging Face 收集了 6,708 条公开可用的代理轨迹,并重构了 315,320 个推理块。他们的自动化审查在至少 1,028 个块中标记出了至少一起隐私泄露,占样本的 0.3%。在会话层面,328 条轨迹(或 4.9%)包含论文归类为敏感的至少一项内容。

在包括合成基准会话的完整数据集中,研究人员统计到 367 件可识别个人身份的信息痕迹和 182 条凭证。论文称,真实用户会话产生了 62 个不同的 API 密钥、33 个密码和 30 个个人电子邮件地址。一些痕迹仅出现在加密推理内,而在可见对话中不存在,这意味着常规的日志清理不会发现它们。

这些数字需要放在背景下理解。该数据集是有针对性的收集,而不是对所有公开代理日志的审计,并且基准轨迹占了大量个人信息,因为一些测试故意向模型提供了合成身份。研究人员表示他们在分类后删除了恢复的秘密。

提供商阻止了所报告的攻击

论文建立在密码学家 Matthew Green 于 5 月 29 日对加密推理的分析之上,该分析表明加密推理块可以在其原始上下文之外被重放。Green 向 OpenAI 和 Anthropic 报告了该行为,同时描述了其即时安全影响的不确定性。

Panfilov 及其合著者通过使用较弱的模型作为转录工具并将该技术应用于公开日志,扩展了这一发现。他们在发表前向受影响的模型提供商、Microsoft 和 Hugging Face 披露了他们的方法。论文称每家模型提供商都确认收到了报告,研究人员随后无法再重现相同的攻击。

AI 安全研究员 Timothee Chauvin (@timotheechauvin) 在 X 上的一连串七条帖子中将这一问题描述为影响有限,同时批评提供商在加密推理系统中留下了一个基本的安全弱点。

研究人员建议将每个加密块绑定到其原始用户、会话和在对话中的位置。他们还建议轮换旧密钥,以便在修复之前签发的推理块变得不可读,训练模型拒绝转录请求,并在可行时将推理存储迁回提供商服务器。

这些更改会带来成本。客户端持有的推理支持无状态 API、零数据保留部署和模型切换,而无需提供商保留每一条隐藏痕迹。漏洞正是源于过度宽泛地保留了这种可移植性。同一个在请求间保持代理推理完整的块,也跨越了本应由加密强制执行的边界。

Reader comments

Conversation for this story loads after sign-in.