Tratopedia
BM
設定

文字大小

佈景

高對比

中文排版

豎排會把內文排成由右至左的直行,如同台灣的實體書籍。

版本

v1.177.0

本頁建置時的版本編號,也是 service worker 快取所依據的版本。

AI 安全 · 密碼學 · 資訊安全 · AI 代理 · 研究簡報arXiv:2608.09867,2026 年 8 月 10 日 · 紀錄更新至 2026 年 9 月

一把金鑰,通用所有模型

AI 推理軌跡:加密,而非隱藏

Anthropic、OpenAI 與 Google 如今都把模型逐步推理的過程,以加密區塊而非明文回傳給用戶端,藉此防止競爭對手取得,也不讓使用者直接讀取。一篇 2026 年 8 月發表的論文指出,這種加密並未綁定產生它的工作階段、使用者或模型:只要把擷取到的區塊,重放給同一供應商旗下較弱、防護較鬆的同門模型,該模型就會將其逐字解碼並複誦出來。

從業餘實驗到可行攻擊,中間隔了十週 在分級之前,先看關鍵數字。

  • 315,320從 6,708 份公開代理逐字稿解出的推理區塊數
  • 704僅來自真實(非基準測試)工作階段的隱私痕跡數量
  • 64上述痕跡中,僅存在於加密推理內、從未現身可見對話的數量
  • $720以某供應商最低階模型定價,解碼一萬筆推理所需的估計成本

哪些已經確立,確立到什麼程度 依確立程度排序;同一列之內不混雜不同等級。

確立程度紀錄怎麼說出處
已確認研究者已對 Anthropic、OpenAI 與 Google 三家的 API 完成攻擊示範:從防護嚴密模型擷取的推理區塊,重放至同一供應商旗下防護較鬆的較弱同門模型後,該模型將其逐字轉錄。Panfilov 等人,2026 年 8 月
已確認從 6,708 份公開代理逐字稿解出的 315,320 個推理區塊中,僅真實工作階段就找出數百筆憑證與個資,包括 62 組 API 金鑰、33 組密碼、24 組存取權杖與 7 組私鑰。Panfilov 等人,2026 年 8 月
已確認論文作者在發表前已向受影響的供應商、Microsoft 與 Hugging Face 揭露此漏洞,各方均已確認收悉。而這篇論文所延伸的先前發現者 Matthew Green,也曾於 2026 年 5 月,另行向 OpenAI 與 Anthropic 回報過重放行為本身。Panfilov 等人;M. Green
確認但無法在此查核論文自述,截至 2026 年 8 月,其核心擷取結果已無法在各供應商的 API 上重現,原因是各方在收到揭露後部署了緩解措施。Panfilov 等人,2026 年 8 月(自述)
確認但無法在此查核The Hacker News 報導指出,Anthropic 目前的文件已將思考區塊與產生它的模型綁定,並建議在切換模型時將其移除,因為其他模型會忽略該區塊。The Hacker News,2026 年 8 月 12 日
確認但無法在此查核截至該報導發表當日,The Hacker News 未發現 Anthropic、OpenAI 或 Google 任一方公開承認、點名回應這篇論文。The Hacker News,2026 年 8 月 12 日
未確認在各供應商修補之前、已流出網路的推理區塊,如今是否仍可被解碼——這是與「新的擷取攻擊是否仍然有效」不同的問題——目前尚無定論。The Hacker News,2026 年 8 月 12 日
非公開截至論文測試期間,尚無任何供應商公開發布其推理區塊所用加密機制的詳細說明。Panfilov 等人,2026 年 8 月

從週末業餘實驗,到可規模化的擷取方法 日期依各自來源所載。

  1. 2026約翰霍普金斯大學密碼學家 Matthew Green,發布一篇業餘實驗紀錄,發現 OpenAI、Anthropic 與 Google API 回傳的加密推理區塊,即使沒有有效的解密金鑰,也能跨工作階段、跨帳號重放,OpenAI 甚至能跨模型重放。
  2. 2026 年 5 月 29 日Green 透過漏洞獎金計畫,向 OpenAI 與 Anthropic 回報上述重放行為。據其自述,OpenAI 稱該回報無法重現,Anthropic 則表示未見重放或側通道行為有安全疑慮。
  3. 2026 年 7 月論文作者展開跨 Anthropic、OpenAI 與 Google 三家 API 的測試,開發出跨模型擷取方法,並著手掃描公開流出的逐字稿。
  4. 2026 年 8 月 10 日《Stealing Reasoning Traces from Proprietary LLM APIs》上傳至 arXiv,論文描述跨模型擷取方法,以及公開逐字稿掃描的結果。
  5. 2026 年 8 月 11 日Green 在其 5 月的文章上新增更新,指向這篇新論文,形容對方把他自己的發現變成「真正可行的攻擊」。
  6. 2026 年 8 月 12 日The Hacker News 發布自家報導,除證實論文數字外,並補充指出加密機制本身從未被破解——此攻擊依賴的是完整區塊被供應商接受並處理。
  7. 2026 年 8 月據論文自述,三家供應商在收到揭露後皆部署了緩解措施,其核心擷取結果自此無法重現。
  8. 2026 年 9 月現行文件顯示三家供應商尚未採取一致做法:Google 仍描述由後端管理的跨模型相容性,OpenAI 則已將推理重用限制在同系列模型內,並自動省略其餘部分。

問題從來不在加密演算法本身,而在它周圍缺乏的邊界 以下論述均具名歸功於論文本身及 Green 本人的說法。

Panfilov 等人所指出的是一項架構選擇,而非遭破解的加密演算法:為避免將每筆推理都儲存在自家伺服器上,Anthropic、OpenAI 與 Google 都選擇把它包裝成加密區塊,交由用戶端保管並在下一輪對話時送回。他們的測試顯示,各供應商是以單一金鑰為旗下所有此類區塊加密並驗證,而非替個別工作階段、個別使用者或個別模型各配一把金鑰。加密演算法本身完全不需要被破解——區塊上根本沒有標記自己來自何處、屬於誰。

Green 在 5 月的文章正是這項發現的起點,論文本身也直接如此承認。他發現擷取到的區塊,能跨工作階段、跨帳號重放,OpenAI 甚至能跨模型重放,且被重放的區塊「具語意作用」,並非單純遭忽略。他也曾以自己刻意植入的資料證明,推理區塊的長度與產生時間,可能洩漏出模型被要求絕不明說的一個秘密位元。但據其自述,他並未能把這兩項發現,轉化成從他人工作階段中穩定取出真實秘密的方法。論文真正補上的正是這一步:把擷取到的推理,導向同一供應商旗下較小、防護較鬆的同門模型,令其在被要求時解碼並轉錄——完全不需要要求產生這段推理、能力更強的模型直接洩露它。

這一步之所以奏效,源自論文明確點出的安全落差:頂尖模型經過大量訓練,會拒絕透露自身思維鏈,但同一系列中較便宜、較快速、專為成本與速度而生、並非旗艦產品的同門模型,卻未受到同等要求。攻擊者根本無需對能力較強的模型進行越獄;它只需要一個願意配合解碼的相容同門模型即可。

論文刻意運用的這種可攜性,第三方也可能無心地加以利用。開發者為求可重現實驗,時常公開發布代理工作階段的原始紀錄,連同其推理區塊一併附上;只要第三方擁有任何相容模型讀取這些區塊,就能取回模型當初推理過的一切內容,無論它是否曾出現在可見文字中。論文同時點出另一項後果——惡意指令可以完全藏於推理區塊之中,日後被重放進毫不相關的任務裡,任何只看得到可見對話的人都察覺不到——並指出不透明性其實是雙面刃:它既能隱藏模型悄悄推理過、卻未說出口的有害內容,也同樣可能隱藏使用者或監控者原本該看見的東西。

論文由此設計上的張力,得出自己的結論:只要某個模型必須解密並運用先前的推理,才能延續對話,那麼一個加密的推理區塊「終究只能是半隱藏」,無論傳輸層的加密演算法看起來多麼堅固——內容始終能透過任何隱含持有金鑰的模型觸及。這正是「加密,而非隱藏」的精確含意:推理原是為了防範使用者直接讀取、防範對手大量爬取而加密;但它從未、也不可能,對同系列中被好好請求、願意複誦出來的模型保持隱藏。

一個月後,三家供應商走出三種不同立場 以下內容均直接查閱自各供應商目前的開發者文件。

  • Google

    相容性依然存在,交由後端統一管理

    Gemini API 文件,「Thought signatures」

    • 其文件仍稱思維簽章為「模型內部推理的加密表示」,是維持多輪對話連貫性所必需。
    • 當工作階段中切換模型時,官方指引仍要求持續重送前一個模型的思考區塊——「相容性由後端負責管理」。
  • OpenAI

    自論文測試期間之後,出現了一道邊界

    OpenAI 平台文件,推理模型指南

    • 在無狀態回應中,仍會回傳 encrypted_content 推理項目,供用戶端保留並回傳。
    • 但持久化的推理「只能在同一模型系列內重用」,API 現在也會自動省略不相容的推理——這比論文於 2026 年 7 月測得的行為更窄,當時推理能通用於所有測試過的舊版 GPT。
  • Anthropic

    一項未見於 Anthropic 自家現行文件中的說法

    The Hacker News,引述 Anthropic 文件

    • The Hacker News 報導稱,Anthropic 的文件已將思考區塊與其產生模型綁定,並建議在切換時將其移除,因為其他模型會忽略該區塊。
    • 截至 2026 年 9 月,Anthropic 自家公開的「Extended Thinking」文件並未見上述文字,通篇也完全沒有出現「signature」一詞。

揭露紀錄與緩解建議還補上了什麼 取自論文自身的討論章節,以及 Green 本人的建議。

論文自身提出的修補方案,從激進到漸進都有:一種是把推理儲存徹底移回供應商自家伺服器,只交給用戶端一個不透明的查詢識別碼,如此能完全移除可被重放的資產,代價則是實際的基礎設施成本;退而求其次,論文建議把每個加密信封都綁定到特定使用者與特定對話,並拒絕接受脫離原本情境送回的區塊。Green 早在 5 月就對供應商提出的建議則較為侷限,且時間更早:改善金鑰管理,別再因為側通道攻擊速度慢,就認定它不值得安全團隊留意。

加密守住了錯的那條邊界 獻給任何公開代理逐字稿、保存工作階段狀態,或依供應商文件規劃系統的人。

  • 在公開任何工作階段紀錄或代理逐字稿之前,只要該工作階段曾接觸過任何敏感資訊,就先移除推理或思考區塊——只清理可見文字,並無法清除留在加密區塊裡、模型曾推理過的內容。
  • 別因為一個看似不透明、無法閱讀的區塊「沒有金鑰就讀不了」,就認為交給第三方是安全的——結果證明,能讀取它的並非金鑰,而是一個相容的模型。
  • 查閱正在使用的供應商 API 對應的推理連續性指引,而非假設同一套政策放諸四海皆準——截至目前的紀錄,三家供應商各自採取不同立場。
  • 任何代替使用者儲存或轉發對話狀態的工具,都不應把推理區塊保留超過該次對話所需的時間。
  • 應預期跨模型的邊界仍會持續調整:自論文測試期間至今,已有一家供應商將其收窄過一次;任何對 API 現行行為的描述,都不應被當作能長久不變。

哪些地方該保留餘地

所示攻擊已失效的說法,僅出自論文自述的後續測試,並非 Anthropic、OpenAI 或 Google 的公開聲明。所復原的機密數量計算的是「格式完整的機密」:論文依值的形態判定,並明言即使聲稱已撤銷、過期或「僅供測試」者仍計入,因此那並非逐一驗證仍可使用的金鑰數。修補前已被抓取並公開的推理區塊今日是否仍可解碼,截至 2026 年 9 月仍無定論。

重點結論

為推理區塊加密,能防止使用者讀取自家模型的內心話,也能防止對手大量爬取;但它從未、也不可能從結構上防止一個被要求讀出內容的相容模型辦到這件事——因為總得有某個模型能讀。正是「加密」與「隱藏」之間的這道落差,而非加密演算法遭到破解,讓被擷取的推理得以四處流傳。

資料來源:Alexander Panfilov、David Schmotz、Ilia Shumailov、Luca Beurer-Kellner、Joachim Schaeffer、Ameya Prabhu、Jonas Geiping 與 Maksym Andriushchenko,《Stealing Reasoning Traces from Proprietary LLM APIs》,arXiv:2608.09867v1,2026 年 8 月 10 日。Matthew Green,〈Let’s talk about encrypted reasoning〉,《A Few Thoughts on Cryptographic Engineering》,2026 年 5 月 29 日。Swati Khandelwal,〈OpenAI, Anthropic, Google API Flaw Let Weaker AI Models Decode Stronger Models’ Reasoning〉,《The Hacker News》,2026 年 8 月 12 日。Google,〈Gemini thinking: thought signatures〉,Gemini API 文件。OpenAI,推理模型指南,OpenAI Platform 文件。Anthropic,〈Extended thinking〉,Claude Platform Docs。

版本

本文內容需要更動時即改寫為新版本,每個版本都保留在自己的網址。

  1. v0001 目前

目前版本也位於 latest/。