新聞股票研究人員揭露所有主要 AI 模型經加密的「內心想法」

研究人員揭露所有主要 AI 模型經加密的「內心想法」

作者: Decrypt·

重點速覽

  • Anthropic、OpenAI 與 Google 各自為 AI 推理 token 使用單一把涵蓋整個供應商的加密金鑰,使加密推理區塊能在各生態系內跨工作階段、使用者與模型互相替換。
  • 研究人員從 GitHub 與 Hugging Face 上 6,708 份公開分享的 AI 代理對話紀錄中解碼了 315,320 個推理區塊,取得 182 項憑證——包括 62 個有效 API 金鑰與 33 組密碼——以及 367 項個人身分識別資訊工件。
  • 此攻擊的原理,是將 Claude Opus 4.8 等能力較強模型的加密推理軌跡,注入 Claude Haiku 4.5 等較弱且防護較少的同系列模型,後者會逐字輸出該軌跡,且除了標準 API 使用外無需任何特殊權限。
  • 隱藏在加密推理區塊內的敏感資料能躲過 GitHub 等平台的自動化機密掃描服務,因為這類工具無法檢查加密內容。
  • 在負責任揭露後,Anthropic、OpenAI 與 Google 皆已部署伺服器端緩解措施,但已遭擷取的 6,708 份公開對話紀錄仍留在網路上,建議開發者從共享紀錄中移除加密思考區塊,並輪替已暴露的憑證。
研究人員揭露所有主要 AI 模型經加密的「內心想法」

資安研究人員發現了一種方法,能讀取所有主要 AI 推理模型經加密的「內心想法」,並在過程中發現 62 個有效 API 金鑰與 33 組密碼,這些機密深埋於開發者在網路上公開分享的工作階段紀錄中,而開發者根本不知道其中藏著什麼。

這項發現的核心,在於研究人員發現 Anthropic、OpenAI 與 Google 皆為 AI 推理 token 使用單一把全域加密金鑰。透過解碼從公開的 GitHub 與 Hugging Face 儲存庫擷取的 315,320 個推理區塊,研究人員取得了 182 項憑證,其中包括 62 個有效 API 金鑰、33 組密碼以及 30 個個人電子郵件地址。

「透過解碼從公開儲存庫擷取的 315,320 個推理區塊,我們取得了 367 項個人身分識別資訊(PII)工件與 182 項憑證,」研究人員在他們的論文中寫道。該論文於 8 月 10 日提交,作者為來自 MATS Research、ELLIS Institute Tübingen、Max Planck Institute for Intelligent Systems 以及資安公司 Snyk 的研究團隊。

隱藏草稿區如何運作

這項研究鎖定特定類別的 AI:推理模型。這類模型不會立即回答,而是先進行內部思維鏈——一個逐步演算的「草稿區」,AI 在其中推演問題、之後才給出答案——然後才交付最終回應。這些模型如今位於程式設計助理與自主代理的核心,能讀取檔案、執行指令並處理真實的使用者資料,這正是憑證與個人資料可能流經私人草稿區的原因,即使它們從未出現在使用者看得到的回覆中。

Anthropic、OpenAI 與 Google 都會對這個隱藏的草稿區加密。加密——即將資料轉換成無法讀取的密碼的過程——旨在保護公司的智慧財產權,並讓敏感的中間推理過程遠離使用者。加密區塊會隨著每一則後續訊息傳回供應商的伺服器,在不於公司端儲存任何資料的前提下維持對話。實驗室自己也會監控這些隱藏推理作為安全檢查,在答案送達使用者之前,觀察思維鏈中是否出現模型打算違反規則的跡象。

一把金鑰掌控一切

這個缺陷屬於架構層面。三家供應商並未將每個加密推理區塊綁定至特定使用者、工作階段或模型,而是在其整個生態系中使用單一把涵蓋整個供應商的加密金鑰。

「這些加密區塊在不同工作階段、不同使用者、甚至供應商生態系內的不同模型之間,完全相容且可互相替換,」研究人員寫道。

這意味著來自 Anthropic 旗艦模型 Claude Opus 4.8 的加密推理區塊,可以在不違反 Anthropic 規則的情況下,被注入 Claude Haiku 4.5——一個更便宜、防護較弱的同系列模型。Haiku 缺少 Opus 所具備的反蒸餾對齊訓練——這是一種專門設計來阻止模型依指令逐字輸出自身推理過程的安全訓練。

只要叫 Haiku 逐字讀出加密區塊,它就照做。

「透過將某個模型的加密推理軌跡注入同一供應商旗下較弱且防護較少的模型,我們迫使它解碼並以純文字逐字輸出該軌跡,而完全無需直接越獄能力更強的模型,」論文指出。

「跨模型可攜性意味著 Haiku 4.5 能讀取 Opus 4.8 的想法,」首席研究員 Alexander Panfilov 在 X 上寫道

同樣的攻擊也在 OpenAI 的 GPT-5.6 系列與 Google 的 Gemini 模型陣容中重現。這不需要任何特殊權限——標準 API 存取(開發者用來在 AI 模型之上建構應用程式的連線)便足以執行。

We can finally talk about it: We found a way to extract hidden reasoning of frontier models using a vulnerability in the APIs of every frontier AI company. We verified that our reasoning token count matches billed API thinking tokens 1:1 for most of the prompts we queried. pic.twitter.com/S7wN8aP3X7 — Alexander Panfilov (@kotekjedi_ml) August 11, 2026

公開紀錄中的內容

為了證明實際危害,團隊擷取了 6,708 份公開分享的 AI 代理對話紀錄——即開發者例行發布到 GitHub 與 Hugging Face 以便協作或除錯的自動化工作階段紀錄——並從中解碼出 315,320 個推理區塊。

「開發者經常在網路上公開分享他們的工作階段紀錄與加密思考軌跡,渾然不覺加密區塊中隱藏著敏感資料,」論文指出。這些機密大多從未出現在使用者看得到的 AI 輸出中;它們只存在於加密推理內部,對任何未執行此攻擊的人而言都是隱形的。由於敏感內容位於加密區塊而非純文字中,GitHub 等平台在公開儲存庫上執行的自動化機密掃描服務無從察覺——這些用來標記外洩 API 金鑰的標準防護機制,無法看進加密推理的內部。

除了單純的憑證竊取之外,這個漏洞還開啟了四種攻擊向量:

  • 竊取 AI 公司的專有推理模式,透過蒸餾訓練競爭對手模型——即較小的 AI 透過研究較大 AI 的輸出來學習模仿它
  • 從共享的紀錄中提取私人資料
  • 執行隱形提示注入,惡意指令被藏在安全監控工具永遠看不到的加密推理區塊中
  • 透過防護較弱的同系列模型越獄強大模型

在團隊依循負責任揭露程序通報後,Anthropic、OpenAI 與 Google 皆已部署伺服器端的緩解措施。正如 Decrypt 先前報導,Anthropic 今年持續成為資安研究人員關注的焦點,尤其是其最新模型在推理過程中消耗了多得多的 token。

修補程式已上線——但已從公開網路擷取的 6,708 份含解碼推理區塊的工作階段紀錄並不會消失。對於已發布代理對話紀錄的開發者而言,面對這類暴露的標準因應方式,是從共享紀錄中移除加密思考區塊,並輪替所有曾在這些工作階段中流動的憑證。