English

AI 資安 · 研究簡報arXiv:2608.09867 · 2026 年 8 月 10 日

執行摘要 · 單頁綜覽

加密的推理只是半隱藏

OpenAI、Anthropic 與 Google 以相同方式隱藏思維鏈:加密後交回用戶端,下一次呼叫時再收回。密碼學本身沒有失守,綁定卻不存在 — 這些加密區塊可跨工作階段、跨使用者、並跨同一家族中的不同模型互換。攻擊者因此毋須攻破強模型:擷取它的密文,交給拒絕能力較薄弱的廉價同門,請它朗讀,供應商便會照常解密。八位研究者隨後將此手法對準開發者早已公開的日誌,讀出了作者從不知道藏在其中的秘密。

關鍵數據 一次公開日誌掃描

  • 315,320自公開儲存庫解出的推理區塊
  • 6,708為此掃描的公開代理軌跡
  • 704來自真實使用者工作階段的隱私資料
  • 64其中完全不見於可見對話

攻擊如何進行 強模型自始未被碰觸

  1. 01提問向強模型
  2. 02擷取取得密文
  3. 03重播送入同門
  4. 04解密供應商照辦
  5. 05轉錄拒絕力薄弱
  6. 06明文逐字軌跡

全文結構 起 · 承 · 轉 · 合

段落內容
起 破題2推理為何轉為不可見,封套又為何被推給用戶端。
承 發展2三層相容性、各供應商的載體,以及此發現如何成熟。
轉 轉折3同一架構缺陷衍生的四種濫用。
合 結論3供應商修補了什麼,以及修補已無法觸及之處。

總結

密碼學從來不是弱點。給人一個上鎖的盒子,再配上一位只要客氣詢問就會開鎖的持鑰者,這不是機密性 — 而是多繞幾步的混淆。AEAD 本身無誤,缺的只是綁定。

重新定位

安全防護逐一模型施行,金鑰卻整個家族共用。此一錯位即是漏洞全貌;凡能力分層共用基礎設施之處,它都會再度出現。

Panfilov、Schmotz、Shumailov、Beurer-Kellner、Schaeffer、Prabhu、Geiping 與 Andriushchenko · arXiv:2608.09867(2026 年 8 月 10 日)· The Hacker News(8 月 12 日)· M. Green, Cryptography Engineering(5 月 29 日)

起 — 推理為何轉為不可見 兩個動機、一條捷徑

  • 動機 · 智財與外洩

    隱藏思維鏈

    官方理由

    • 原始推理是可訓練素材 — 隱藏它可延緩競爭者的蒸餾。
    • 一段軌跡外洩的資訊,遠多於它最終產出的答案。
    • 三家供應商各自獨立,走向同一個決定。
    • 三家皆未公開自己所選用的密碼學機制。
    • 截至 2026 年 7 月,該設計在公開領域仍無說明。
  • 捷徑 · 無狀態

    交還給用戶端

    加密,而非留存

    • 伺服器端留存需付出狀態成本;讓密文留在用戶端則毫無成本。
    • 一個 AEAD 封套 — 標頭、nonce、驗證標籤、密文。
    • 用戶端在後續每次呼叫中原封奉還,從未讀取其內容。
    • 簽章以關聯資料形式雜湊進 MAC 之中。
    • 封套之中,未載明任何工作階段、使用者或模型。

承 — 三層相容性 寬鬆程度遞增

這套分類法才是論文真正的貢獻。區塊可在同一及跨工作階段重播;進而跨使用者,讓某個帳號能餵入自他人擷取的軌跡;最終跨模型,於同一家族之內流通。第三層即是槓桿:強模型從未被越獄,只是被引述給拒絕訓練較薄弱的廉價同門,而該同門會將軌跡逐字讀出。由於無供應商公開其機制,作者僅能由行為推斷系統使用單一全域金鑰。原文用語是 appear to be(看似如此),這個保留語氣在任何轉述中都不該被省略。

  • 1 key每家一把 — 由行為推斷,從未公開
  • 跨模型使重播升級為萃取的那一層
供應商用戶端載體論文中的描述
OpenAIsignature於無狀態歷史管理下,回傳供手動重播的加密推理項目。
AnthropicthinkingSignature思考區塊挾帶不透明的 base64 簽章,並附摘要。
GooglethoughtSignature思維簽章,見於 Gemini API 之文件。
  1. 2026-05-29Matthew Green 確立跨階段、跨帳號、跨模型的重播與時間側通道 — 但無法穩定還原明文,且坦白指出這一點。
  2. 2026 年 7 月初Panfilov 等人向三家供應商揭露可穩定、可規模化的萃取手法。
  3. 2026-08-10論文發表;已自公開儲存庫解出 315,320 個區塊。
  4. 2026-08-11Green 更新其 5 月貼文,指向這項完成了他當初未竟之工的研究成果。
  5. 2026 年 8 月攻擊已無法重現。供應商確認收到通報 — 但無公開聲明,亦無 CVE 編號。

機制、分類與載體欄位依 arXiv:2608.09867 §2 · 先前重播發現依 M. Green, Cryptography Engineering(2026-05-29,8 月 11 日更新)

轉 — 同一缺陷的四種濫用 一根槓桿 · 四種後果

手法取得什麼為何棘手
模型蒸餾三家供應商的專有推理,經實證可逐字取得它擊破的,正是整套設計存在的唯一理由
資料萃取取自真實工作階段的 62 組 API 金鑰、33 組密碼、24 組存取權杖、7 把私鑰取自擁有者自願公開、且自認早已清理過的日誌
隱藏危害模型可見回覆已明確拒絕提供的內容輸出層的拒絕,不等於其前置推理中的拒絕
隱形注入完全寄生於不透明區塊、由無辜軌跡挾帶的酬載閱讀逐字稿者無從察覺 — 共享軌跡就此成為投遞載具

掃描的實際發現 公開儲存庫,2026 年 8 月

  • 1,028含隱私外洩的已解碼區塊
  • 0.3%佔已解碼區塊比例 — 罕見,但不無害
  • 328受影響工作階段,佔軌跡 4.9%
  • 912併計基準測試軌跡後的資料件數

其中一項數字的份量超越其餘。在自真實使用者工作階段還原的 704 件資料中,有 64 件完全不見於可見對話紀錄 — 該秘密僅存在於推理之內。任何在發布前認真清理過逐字稿的人,都會漏掉這 64 件,因為可讀部分根本已無可清理之物。這正是它有別於一般憑證外洩事件之處:發布前先讀過一遍這個標準補救,對一個你讀不到的欄位並不管用。至於基準測試軌跡之所以被分開計算,作者給了一個平實的理由 — ClawBench 之類的推演會直接餵給模型一整套合成人物設定供其推理,若不分開,將使研究中所有個資件數虛胖。

  • 64清理可見文字永遠攔不到的資料件數
  • 基準測試分開計算 — 合成人物設定會使總數虛胖

合 — 最終落點 向前修補,無法回溯

  • 綁定封套 — 將使用者與對話識別碼納入 AEAD 酬載,使重播的區塊直接遭拒。
  • 跨模型隔離 — 拒絕任何由當前查詢模型以外版本所產生的封套。
  • 改存伺服器端 — 僅回傳不透明的隨機識別碼;正是原設計刻意迴避的解法。
  • 建立撤銷機制 — 追蹤已發出的簽章,使遭洩軌跡得以失效。
  • 發布前先剝除 — 移除任何離開本機之逐字稿中的所有不透明推理欄位。
  • 輪換已外流者 — 伺服器端修補只能阻止新的讀取,永遠無法收回舊的外洩。
  • 強化拒絕訓練 — 教導模型拒絕要求轉錄隱藏推理的提示;但須留意,這是在已然失守的那一層設防。
  • 將不透明欄位視為內容 — 讀不到的欄位是無法清理,而非空無一物,絕不應預設其無害。

修補所及

三家供應商在數週內關上了門,概念驗證已無法執行。然而315,320 個區塊早已公開,其中每一組憑證都已形同作廢。發表後才到來的修補無法收回任何已公開之物 — 唯一剩下的補救是輪換,而該做的人多半尚不知情。

真正的改變

共享的代理軌跡如今成為供應鏈攻擊面;作者自身劃下的結構性界線亦依然成立:除非模型能完全抵禦萃取型提示,否則加密推理永遠只能是半隱藏。三家供應商各自獨立採用了同一種設計,也各自獨立地忘記了:能把那份狀態交回來的,並不只有用戶端一方。