摘要 · Summary
AI 資安 · 研究簡報arXiv:2608.09867 · 2026 年 8 月 10 日
執行摘要 · 單頁綜覽
加密的推理只是半隱藏
OpenAI、Anthropic 與 Google 以相同方式隱藏思維鏈:加密後交回用戶端,下一次呼叫時再收回。密碼學本身沒有失守,綁定卻不存在 — 這些加密區塊可跨工作階段、跨使用者、並跨同一家族中的不同模型互換。攻擊者因此毋須攻破強模型:擷取它的密文,交給拒絕能力較薄弱的廉價同門,請它朗讀,供應商便會照常解密。八位研究者隨後將此手法對準開發者早已公開的日誌,讀出了作者從不知道藏在其中的秘密。
關鍵數據 一次公開日誌掃描
- 315,320自公開儲存庫解出的推理區塊
- 6,708為此掃描的公開代理軌跡
- 704來自真實使用者工作階段的隱私資料
- 64其中完全不見於可見對話
攻擊如何進行 強模型自始未被碰觸
- 01提問向強模型
- 02擷取取得密文
- 03重播送入同門
- 04解密供應商照辦
- 05轉錄拒絕力薄弱
- 06明文逐字軌跡
全文結構 起 · 承 · 轉 · 合
| 段落 | 頁 | 內容 |
|---|---|---|
| 起 破題 | 2 | 推理為何轉為不可見,封套又為何被推給用戶端。 |
| 承 發展 | 2 | 三層相容性、各供應商的載體,以及此發現如何成熟。 |
| 轉 轉折 | 3 | 同一架構缺陷衍生的四種濫用。 |
| 合 結論 | 3 | 供應商修補了什麼,以及修補已無法觸及之處。 |
總結
密碼學從來不是弱點。給人一個上鎖的盒子,再配上一位只要客氣詢問就會開鎖的持鑰者,這不是機密性 — 而是多繞幾步的混淆。AEAD 本身無誤,缺的只是綁定。
重新定位
安全防護逐一模型施行,金鑰卻整個家族共用。此一錯位即是漏洞全貌;凡能力分層共用基礎設施之處,它都會再度出現。
起承 · 脈絡 · 內容 1 / 2
起 — 推理為何轉為不可見 兩個動機、一條捷徑
動機 · 智財與外洩
隱藏思維鏈
- 原始推理是可訓練素材 — 隱藏它可延緩競爭者的蒸餾。
- 一段軌跡外洩的資訊,遠多於它最終產出的答案。
- 三家供應商各自獨立,走向同一個決定。
- 三家皆未公開自己所選用的密碼學機制。
- 截至 2026 年 7 月,該設計在公開領域仍無說明。
捷徑 · 無狀態
交還給用戶端
- 伺服器端留存需付出狀態成本;讓密文留在用戶端則毫無成本。
- 一個 AEAD 封套 — 標頭、nonce、驗證標籤、密文。
- 用戶端在後續每次呼叫中原封奉還,從未讀取其內容。
- 簽章以關聯資料形式雜湊進 MAC 之中。
- 封套之中,未載明任何工作階段、使用者或模型。
承 — 三層相容性 寬鬆程度遞增
這套分類法才是論文真正的貢獻。區塊可在同一及跨工作階段重播;進而跨使用者,讓某個帳號能餵入自他人擷取的軌跡;最終跨模型,於同一家族之內流通。第三層即是槓桿:強模型從未被越獄,只是被引述給拒絕訓練較薄弱的廉價同門,而該同門會將軌跡逐字讀出。由於無供應商公開其機制,作者僅能由行為推斷系統使用單一全域金鑰。原文用語是 appear to be(看似如此),這個保留語氣在任何轉述中都不該被省略。
- 1 key每家一把 — 由行為推斷,從未公開
- 跨模型使重播升級為萃取的那一層
| 供應商 | 用戶端載體 | 論文中的描述 |
|---|---|---|
| OpenAI | signature | 於無狀態歷史管理下,回傳供手動重播的加密推理項目。 |
| Anthropic | thinkingSignature | 思考區塊挾帶不透明的 base64 簽章,並附摘要。 |
| thoughtSignature | 思維簽章,見於 Gemini API 之文件。 |
- 2026-05-29Matthew Green 確立跨階段、跨帳號、跨模型的重播與時間側通道 — 但無法穩定還原明文,且坦白指出這一點。
- 2026 年 7 月初Panfilov 等人向三家供應商揭露可穩定、可規模化的萃取手法。
- 2026-08-10論文發表;已自公開儲存庫解出 315,320 個區塊。
- 2026-08-11Green 更新其 5 月貼文,指向這項完成了他當初未竟之工的研究成果。
- 2026 年 8 月攻擊已無法重現。供應商確認收到通報 — 但無公開聲明,亦無 CVE 編號。
轉合 · 轉折與結論 · 內容 2 / 2
轉 — 同一缺陷的四種濫用 一根槓桿 · 四種後果
| 手法 | 取得什麼 | 為何棘手 |
|---|---|---|
| 模型蒸餾 | 三家供應商的專有推理,經實證可逐字取得 | 它擊破的,正是整套設計存在的唯一理由 |
| 資料萃取 | 取自真實工作階段的 62 組 API 金鑰、33 組密碼、24 組存取權杖、7 把私鑰 | 取自擁有者自願公開、且自認早已清理過的日誌 |
| 隱藏危害 | 模型可見回覆已明確拒絕提供的內容 | 輸出層的拒絕,不等於其前置推理中的拒絕 |
| 隱形注入 | 完全寄生於不透明區塊、由無辜軌跡挾帶的酬載 | 閱讀逐字稿者無從察覺 — 共享軌跡就此成為投遞載具 |
掃描的實際發現 公開儲存庫,2026 年 8 月
- 1,028含隱私外洩的已解碼區塊
- 0.3%佔已解碼區塊比例 — 罕見,但不無害
- 328受影響工作階段,佔軌跡 4.9%
- 912併計基準測試軌跡後的資料件數
其中一項數字的份量超越其餘。在自真實使用者工作階段還原的 704 件資料中,有 64 件完全不見於可見對話紀錄 — 該秘密僅存在於推理之內。任何在發布前認真清理過逐字稿的人,都會漏掉這 64 件,因為可讀部分根本已無可清理之物。這正是它有別於一般憑證外洩事件之處:發布前先讀過一遍這個標準補救,對一個你讀不到的欄位並不管用。至於基準測試軌跡之所以被分開計算,作者給了一個平實的理由 — ClawBench 之類的推演會直接餵給模型一整套合成人物設定供其推理,若不分開,將使研究中所有個資件數虛胖。
- 64清理可見文字永遠攔不到的資料件數
- 基準測試分開計算 — 合成人物設定會使總數虛胖
合 — 最終落點 向前修補,無法回溯
- 綁定封套 — 將使用者與對話識別碼納入 AEAD 酬載,使重播的區塊直接遭拒。
- 跨模型隔離 — 拒絕任何由當前查詢模型以外版本所產生的封套。
- 改存伺服器端 — 僅回傳不透明的隨機識別碼;正是原設計刻意迴避的解法。
- 建立撤銷機制 — 追蹤已發出的簽章,使遭洩軌跡得以失效。
- 發布前先剝除 — 移除任何離開本機之逐字稿中的所有不透明推理欄位。
- 輪換已外流者 — 伺服器端修補只能阻止新的讀取,永遠無法收回舊的外洩。
- 強化拒絕訓練 — 教導模型拒絕要求轉錄隱藏推理的提示;但須留意,這是在已然失守的那一層設防。
- 將不透明欄位視為內容 — 讀不到的欄位是無法清理,而非空無一物,絕不應預設其無害。
修補所及
三家供應商在數週內關上了門,概念驗證已無法執行。然而315,320 個區塊早已公開,其中每一組憑證都已形同作廢。發表後才到來的修補無法收回任何已公開之物 — 唯一剩下的補救是輪換,而該做的人多半尚不知情。
真正的改變
共享的代理軌跡如今成為供應鏈攻擊面;作者自身劃下的結構性界線亦依然成立:除非模型能完全抵禦萃取型提示,否則加密推理永遠只能是半隱藏。三家供應商各自獨立採用了同一種設計,也各自獨立地忘記了:能把那份狀態交回來的,並不只有用戶端一方。