摘要 · 評估報告
AI 安全 · AI 能力 · 語言模型 · 運算資源 · 治理 · 評估報告綜覽2026 年 4 月評估,記錄至 5 月
英國 AI Security Institute(AISI)
首個從頭到尾完整攻破 AISI 網路攻防演練的模型
AI Security Institute 以自製的 CTF 挑戰,以及另一項 32 步企業網路攻擊模擬,測試 Anthropic 的 Claude Mythos Preview。該模型在專家級 CTF 達 73%,並於 4 月首度在 10 次嘗試中有 3 次完整攻破網路模擬演練。5 月測試的新版本更提升至 10 次中 6 次,並首度攻破AISI 另一項工業控制系統演練。報告中最值得注意的並非任何單一分數,而是效能隨算力持續成長,尚未見到上限。
- 73%專家級 CTF 成功率
- 3 → 6 / 10完整攻破網路演練的次數,4 月至 5 月
- 22 / 324 月平均完成步數(前一名為 16)
- 100M每次嘗試的 token 上限
時序 · 機構、方法與八週間的結果
英國 AI Security Institute 評估機構背景
- 隸屬英國科學、創新與技術部(DSIT),2023 年成立。
- 名稱由 AI Safety Institute 更新為 AI Security Institute,反映重心轉向具體國家安全威脅。
- 建立難度遞進的評估框架:聊天式探測 → CTF 挑戰 → 多步驟攻擊模擬。
- 持續追蹤前沿模型的網路作戰能力演進,並與英國國家網路安全中心(NCSC)合作提出因應建議。
CTF + TLO 雙軌評估 一個測技術點,一個測全程作戰
CTF 挑戰
特定技術情境
- AISI 自製的模擬攻擊套件,難度分入門、中級、進階、專家四級。
- 衡量在單一技術情境下的攻擊能力,而非長時間的持續作戰。
TLO 演練
32 步企業網路攻擊模擬
- 從初始偵察到完整網路接管,橫跨 M1–M9 九大里程碑。
- AISI 對人類專家完成全程所需時間的估計,兩份報告之間有落差:3 月估計為 14 小時,4 月估計為 20 小時。
- 每次嘗試的 token 上限為 100M。
The Last Ones:九大里程碑 TLO 的攻擊鏈結構
| 里程碑 | 任務內容 |
|---|---|
| M1 | Initial Reconnaissance 初始偵察 |
| M2 | Lateral Movement & Credential Extraction 橫向移動與憑證取得 |
| M3 | Browser Credential Theft 瀏覽器憑證竊取 |
| M4 | Wiki Exploit & Credential Replay 漏洞利用與憑證重放 |
| M5 | Web App Exploit & Privilege Escalation 提權 |
| M6 | C2 Reverse Engineering & Crypto Analysis 逆向與密碼分析 |
| M7 | Advanced Persistence 進階持久化 |
| M8 | Infrastructure Compromise 基礎設施入侵 |
| M9 | Full Network Takeover 完整網路接管 |
八週間的六份報告 這段報告是如何拼接而成
- 2026 年 3 月 5 日AISI 與 Irregular 合作發布研究,指出 AI 網路能力會隨 token 上限提高而持續成長——這是先於 Mythos Preview 的一般性發現。
- 2026 年 3 月 11 至 17 日描述 TLO 以及第二項 7 步工業控制系統演練(「Cooling Tower」)的方法論論文發表,後又修訂。
- 2026 年 3 月 30 日NCSC 與 AISI 聯合發布部落格:在 Mythos Preview 出現之前,表現最佳的模型(Opus 4.6)平均完成 TLO 15.6 步,單次最佳成績為 32 步中的 22 步。
- 2026 年 4 月 7 日Anthropic 發布 Claude Mythos Preview、公布其系統卡,並啟動 Project Glasswing。
- 2026 年 4 月 9 日Anthropic 自家的 Frontier Red Team 發布其漏洞發現報告,包括 OpenBSD 的漏洞。
- 2026 年 4 月 13 日AISI 發布獨立評估報告——即上述 73%、10 次中 3 次、32 步中 22 步等數據的出處。
- 2026 年 5 月 13 日AISI 報告指出,較新版本的 Mythos Preview 已能攻破兩項演練:TLO 10 次中 6 次,以及 4 月尚未成功的「Cooling Tower」也達 10 次中 3 次。
論點 · 真實的躍進,但測試對象並不難纏
CTF:專家級達 73% AISI 自製套件,非公開評測
入門級接近飽和、中級高分,但專家級達 73%——這是 AISI 自製套件的成績。2025 年 4 月以前,沒有任何模型能完成專家級任務。
- 專家級 73%AISI 自製的分級 CTF 套件,並非第三方評測。
- 一年前為零2025 年 4 月以前,沒有任何模型能通過專家級任務。
TLO:一次最佳成績,變成另一模型的平均表現 精確陳述這次躍進的幅度
| 模型 | 平均步數 | 完整完成次數 |
|---|---|---|
| Mythos Preview(4 月) | 22 | 3 次 ✓ |
| Claude Opus 4.6 | 16 | 0 次 |
| GPT-5.4 | ~14 | 0 次 |
| Claude Opus 4.5 | 11 | 0 次 |
| GPT-4o(2024-08) | 1.7 | 0 次(僅用 10M tokens) |
除 GPT-4o 外,其餘皆為 100M token 預算下的成績。AISI 公開圖表僅以圖上標籤呈現 GPT-5.4 與 Opus 4.5 的步數,內文並未另外提及,因此這兩項數字是直接從圖表讀出,而非引自文字。3 月、Mythos Preview 尚未問世時,Opus 4.6 的單次最佳成績是 32 步中的 22 步——幾週後,這正是 Mythos Preview 十次嘗試的平均值。
效能隨算力對數線性成長 AISI 自認最值得關注的一項發現
AISI 的方法論論文發現,在其評估的較舊模型中,token 上限從 10M 提升到 100M,效能最大可提升達 59%,且未見瓶頸;該論文的評估對象並不包含 Mythos Preview。至於 Mythos Preview 本身,AISI 表示其效能一路成長至評估所用的 100M token 上限,並預期更高的預算仍會持續提升表現——但並未針對 Mythos Preview 給出對應的百分比數字。
- +59%來自 AISI 方法論論文中較舊模型的發現,並非 Mythos Preview 的數字。
- 尚未見上限AISI 針對 Mythos Preview 本身、於其 100M token 測試上限下所作的陳述。
一個分數不能說明什麼 評估本身排除的兩種解讀
以上分數都無法說明 Mythos Preview 在真實、有防禦的網路中會有何表現——AISI 自己的演練環境沒有主動防禦者、沒有端點偵測,噪聲行動也不受懲罰,因此分數只是對付簡單目標的上界,而非對付堅固目標的預測。而 Anthropic 不予發布模型,本身也不能證明它很危險:Anthropic 自陳的理由是其防護機制尚未就緒,這是一項關於準備程度的說法,並非一項經過量測的危險評級。
補充 · Anthropic 自陳的數字,以及 Project Glasswing
Anthropic 自行評測的成績 出自系統卡,並非 AISI
| 評估項目 | Mythos Preview | 對比 |
|---|---|---|
| Cybench(40 題中運行 35 題) | 100% | Anthropic 稱已飽和 |
| CyberGym | 83.1% | Opus 4.6:66.6%;Sonnet 4.6:65% |
| Firefox 147 漏洞利用(250 次試驗) | 84.0% | Opus 4.6:15.2%;Sonnet 4.6:4.4% |
| SWE-bench Verified | 93.9% | Opus 4.6:80.8% |
Anthropic 自身測試發現,OpenBSD 網路處理程式中存在一個先前未知、可遠端觸發當機的漏洞,潛伏長達 27 年;Anthropic 表示,另在各主要作業系統與瀏覽器中發現數以千計的高風險與重大漏洞。這項總數是 Anthropic 對自家模型產出的自陳說法,未見任何獨立統計發布。Anthropic 確實曾請自家的人類承包商,人工複核了該模型 198 份漏洞報告。
- 「數以千計」Anthropic 對自家模型產出的自陳說法,未見獨立統計。
- 89% / 98%在 198 份報告中,人類承包商與 Mythos 自評的嚴重程度完全一致,或落差在一級以內。
Project Glasswing:把這項能力用於防禦 名稱取自玻璃翅蝴蝶
命名
玻璃翅蝴蝶
- 根據 Anthropic 對命名的說明:在不造成傷害的情況下揭露隱藏之物。
規模
11 家發起夥伴,再加逾 40 家
- Amazon Web Services、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorganChase、Linux 基金會、Microsoft、Nvidia 與 Palo Alto Networks,另有逾 40 家組織獲授掃描權限。
- 資金:最高 1 億美元使用額度,另捐款 400 萬美元予開源資安組織。
- 啟動 30 天後:約 50 家夥伴合計發現逾一萬個高風險或重大漏洞;另一項開源掃描則發現 6,202 個估計漏洞,經獨立複核者中 90.6% 確認為真。
為何不予發布
防護機制尚未就緒
- Anthropic 表示不打算全面開放,並自陳理由:需要能偵測並阻擋模型最危險輸出的防護機制,並打算先在未來一款能力較低的 Opus 模型上導入。
評估環境的侷限 分數之所以不能直接外推
- 缺乏主動防禦者——沒有 SOC 人員即時應對。
- 無端點偵測——EDR 工具在測試環境中不存在。
- 噪聲行動無懲罰機制——現實中會暴露的行為在此不受代價。
NCSC 的建議:回歸基本功 因應方向
- 定期套用安全更新,防止已知漏洞被快速利用。
- 強健的存取控制搭配安全設定(Secure Configuration)。
- 完整日誌記錄;取得 NCSC Cyber Essentials 認證。
結論 · 一道不斷升高的上界
為何這是一個轉折點
2026 年 4 月,AI 模型首度在完整模擬的企業攻擊場景中,達到人類專家等級的自主作戰能力;數週後,更新版本又進一步提升——完整攻破次數倍增,並攻破了此前無任何模型攻克過的第二項工業控制系統演練。AISI 自己提醒的兩種誤讀——分數證明了真實世界的危險性,以及不予發布就證明了危險——都值得抵制,理由相同:這些評估本身都不足以證明這兩點。
仍然懸而未決的問題
AISI 對此網路演練所需人類專家時數的估計,六週內從 14 小時變為 20 小時,且未說明原因。Anthropic 所稱「數以千計」的已發現漏洞,並無獨立統計佐證。此外,目前尚無任何一方發布過針對主動防禦、受監控網路測試 Mythos Preview 的結果——而這正是能說明今日的上界能否撐過明日目標的關鍵測試。