新闻股票研究人员曝光每款主流AI模型的加密“内心想法”

研究人员曝光每款主流AI模型的加密“内心想法”

作者: Decrypt·

要点速览

  • Anthropic、OpenAI和Google各自为AI推理token使用单一的提供商级加密密钥,使加密推理区块在每个生态系统内的不同会话、用户和模型之间可以互换。
  • 研究人员从GitHub和Hugging Face上6,708份公开分享的AI智能体对话记录中解码了315,320个推理区块,恢复了182个凭证——包括62个有效API密钥和33个密码——以及367个个人身份信息数据项。
  • 该攻击的原理是将能力较强模型(如Claude Opus 4.8)的加密推理轨迹注入防护较弱的同级模型(如Claude Haiku 4.5),后者会逐字输出该轨迹,且除标准API使用外无需任何特殊权限。
  • 隐藏在加密推理区块内的敏感数据可以躲过GitHub等平台的自动密钥扫描服务,因为这些工具无法检查加密内容。
  • 在负责任披露之后,Anthropic、OpenAI和Google均已部署服务器端缓解措施,但已被抓取的6,708份公开对话记录仍在线上,建议开发人员从共享日志中剥离加密思维区块并轮换暴露的凭证。
研究人员曝光每款主流AI模型的加密“内心想法”

安全研究人员找到了读取每款主流AI推理模型加密“内心想法”的方法,并在此过程中发现了埋藏在会话日志中的62个有效API密钥和33个密码——这些日志是开发者在不知情的情况下公开分享到网上的。

这项发现的核心在于:Anthropic、OpenAI和Google都为AI推理token使用单一的全局加密密钥。通过解码从公开的GitHub和Hugging Face代码库中抓取的315,320个推理区块,研究人员恢复了182个凭证,其中包括62个有效API密钥、33个密码和30个个人电子邮件地址。

“通过解码从公开代码库中抓取的315,320个推理区块,我们恢复了367个个人身份信息(PII)数据项和182个凭证,”研究人员在其论文中写道。该论文于8月10日提交,由来自MATS Research、ELLLIS Institute Tübingen、马克斯·普朗克智能系统研究所以及安全公司Snyk的团队完成。

隐藏“草稿纸”的运作机制

该研究针对一类特定的AI:推理模型。这类模型不会立即作答,而是先进行内部思维链——一个逐步推演的“草稿纸”,AI在其中先行演算问题,然后才给出最终回复。如今,这些模型正处于编程助手和自主智能体的核心,后者会读取文件、运行命令并处理真实用户数据,这正是凭证和个人信息可能流经私密“草稿纸”、却从未出现在可见回复中的原因。

Anthropic、OpenAI和Google都对这一隐藏的“草稿纸”进行加密。加密——即将数据打乱成无法读取的代码的过程——旨在保护公司的知识产权,并防止敏感的中间推理被用户看到。每条后续消息都会将加密区块传回提供商的服务器,在不于公司端存储任何内容的情况下维持对话。各实验室也会自行监控这种隐藏推理作为安全检查,在答案到达用户之前观察思维链中是否出现模型计划违规的迹象。

一把密钥统管一切

该缺陷属于架构层面。三家提供商并未将每个加密推理区块绑定到特定用户、会话或模型,而是在其整个生态系统中使用单一的提供商级加密密钥。

“这些加密区块在提供商生态系统内的不同会话、用户甚至不同模型之间完全兼容且可互换,”研究人员写道。

这意味着,Anthropic旗舰模型Claude Opus 4.8的加密推理区块可以被注入更便宜、防护更弱的同级模型Claude Haiku 4.5中,而不会违反Anthropic的规定。Haiku缺乏Opus所具备的反蒸馏对齐——一种专门用于阻止模型按指令逐字转录自身推理的安全训练。

只要让Haiku逐字读出加密区块,它就会照做。

论文指出:“通过将某一模型的加密推理轨迹注入同一提供商更弱、防护更少的模型,我们迫使后者解码并以明文逐字输出该轨迹,而无需直接越狱能力更强的模型。”

“跨模型可移植性意味着Haiku 4.5可以读取Opus 4.8的想法,”首席研究员Alexander Panfilov在X上写道

同样的攻击在OpenAI的GPT-5.6系列和Google的Gemini模型阵容中均可复现。这不需要任何特殊权限——标准API访问(开发人员用于在AI模型之上构建应用程序的连接)就足以执行该攻击。

We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company. We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7 — Alexander Panfilov (@kotekjedi_ml) August 11, 2026

公开日志中包含的内容

为了展示现实世界的危害,该团队抓取了6,708份公开分享的AI智能体对话记录——即开发人员例行发布到GitHub和Hugging Face上用于协作或调试的自动化会话日志——并从中解码了315,320个推理区块。

论文指出:“开发人员经常在网上公开分享其会话日志和加密思维轨迹,完全没有意识到加密区块中隐藏的敏感数据。”这些秘密大多从未出现在可见的AI输出中;它们只存在于加密推理内部,对未运行该攻击的人而言不可见。由于敏感内容位于加密区块而非明文中,GitHub等平台对公开代码库运行的自动密钥扫描服务无法将其捕获——标记暴露API密钥的标准防护机制无法看透加密推理的内部。

除简单的凭证窃取外,该漏洞还打开了四种攻击向量:

  • 窃取AI公司的专有推理模式,通过蒸馏训练竞争模型——即较小的AI通过研究较大AI的输出来学会模仿后者
  • 从共享日志中提取私密数据
  • 执行隐形提示注入,即恶意指令隐藏在安全监控工具永远看不到的加密推理区块中
  • 通过防护较弱的同级模型越狱强大的模型

在该团队遵循负责任披露程序后,Anthropic、OpenAI和Google均已部署服务器端缓解措施。正如Decrypt此前报道的那样,Anthropic今年一直是安全研究人员反复关注的焦点,尤其是因为其最新模型在推理过程中消耗的token多得多。

补丁已经上线——但已从公开网络上抓取的6,708份含解码推理区块的会话记录并不会消失。对于已发布智能体对话记录的开发人员而言,应对此类暴露的标准做法是从共享日志中剥离加密思维区块,并轮换在这些会话中流转过的任何凭证。