Tratopedia
BM
設定

文字大小

佈景

高對比

中文排版

豎排會把內文排成由右至左的直行,如同台灣的實體書籍。

版本

v1.81.0

本頁建置時的版本編號,也是 service worker 快取所依據的版本。

AI 安全 · AI 能力 · 語言模型 · 運算資源 · 治理 · 評估報告綜覽2026 年 4 月評估,記錄至 5 月

英國 AI Security Institute(AISI)

首個從頭到尾完整攻破 AISI 網路攻防演練的模型

AI Security Institute 以自製的 CTF 挑戰,以及另一項 32 步企業網路攻擊模擬,測試 Anthropic 的 Claude Mythos Preview。該模型在專家級 CTF 達 73%,並於 4 月首度在 10 次嘗試中有 3 次完整攻破網路模擬演練。5 月測試的新版本更提升至 10 次中 6 次,並首度攻破AISI 另一項工業控制系統演練。報告中最值得注意的並非任何單一分數,而是效能隨算力持續成長,尚未見到上限。

  • 73%專家級 CTF 成功率
  • 3 → 6 / 10完整攻破網路演練的次數,4 月至 5 月
  • 22 / 324 月平均完成步數(前一名為 16)
  • 100M每次嘗試的 token 上限

英國 AI Security Institute 評估機構背景

  • 隸屬英國科學、創新與技術部(DSIT),2023 年成立。
  • 名稱由 AI Safety Institute 更新為 AI Security Institute,反映重心轉向具體國家安全威脅。
  • 建立難度遞進的評估框架:聊天式探測 → CTF 挑戰 → 多步驟攻擊模擬。
  • 持續追蹤前沿模型的網路作戰能力演進,並與英國國家網路安全中心(NCSC)合作提出因應建議。

CTF + TLO 雙軌評估 一個測技術點,一個測全程作戰

  • CTF 挑戰

    特定技術情境

    • AISI 自製的模擬攻擊套件,難度分入門、中級、進階、專家四級。
    • 衡量在單一技術情境下的攻擊能力,而非長時間的持續作戰。
  • TLO 演練

    32 步企業網路攻擊模擬

    AISI 自製,未公開

    • 從初始偵察到完整網路接管,橫跨 M1–M9 九大里程碑。
    • AISI 對人類專家完成全程所需時間的估計,兩份報告之間有落差:3 月估計為 14 小時,4 月估計為 20 小時
    • 每次嘗試的 token 上限為 100M。

The Last Ones:九大里程碑 TLO 的攻擊鏈結構

里程碑任務內容
M1Initial Reconnaissance 初始偵察
M2Lateral Movement & Credential Extraction 橫向移動與憑證取得
M3Browser Credential Theft 瀏覽器憑證竊取
M4Wiki Exploit & Credential Replay 漏洞利用與憑證重放
M5Web App Exploit & Privilege Escalation 提權
M6C2 Reverse Engineering & Crypto Analysis 逆向與密碼分析
M7Advanced Persistence 進階持久化
M8Infrastructure Compromise 基礎設施入侵
M9Full Network Takeover 完整網路接管

八週間的六份報告 這段報告是如何拼接而成

  1. 2026 年 3 月 5 日AISI 與 Irregular 合作發布研究,指出 AI 網路能力會隨 token 上限提高而持續成長——這是先於 Mythos Preview 的一般性發現。
  2. 2026 年 3 月 11 至 17 日描述 TLO 以及第二項 7 步工業控制系統演練(「Cooling Tower」)的方法論論文發表,後又修訂。
  3. 2026 年 3 月 30 日NCSC 與 AISI 聯合發布部落格:在 Mythos Preview 出現之前,表現最佳的模型(Opus 4.6)平均完成 TLO 15.6 步,單次最佳成績為 32 步中的 22 步。
  4. 2026 年 4 月 7 日Anthropic 發布 Claude Mythos Preview、公布其系統卡,並啟動 Project Glasswing。
  5. 2026 年 4 月 9 日Anthropic 自家的 Frontier Red Team 發布其漏洞發現報告,包括 OpenBSD 的漏洞。
  6. 2026 年 4 月 13 日AISI 發布獨立評估報告——即上述 73%、10 次中 3 次、32 步中 22 步等數據的出處。
  7. 2026 年 5 月 13 日AISI 報告指出,較新版本的 Mythos Preview 已能攻破兩項演練:TLO 10 次中 6 次,以及 4 月尚未成功的「Cooling Tower」也達 10 次中 3 次。

CTF:專家級達 73% AISI 自製套件,非公開評測

入門級接近飽和、中級高分,但專家級達 73%——這是 AISI 自製套件的成績。2025 年 4 月以前,沒有任何模型能完成專家級任務。

  • 專家級 73%AISI 自製的分級 CTF 套件,並非第三方評測。
  • 一年前為零2025 年 4 月以前,沒有任何模型能通過專家級任務。

TLO:一次最佳成績,變成另一模型的平均表現 精確陳述這次躍進的幅度

模型平均步數完整完成次數
Mythos Preview(4 月)223 次 ✓
Claude Opus 4.6160 次
GPT-5.4~140 次
Claude Opus 4.5110 次
GPT-4o(2024-08)1.70 次(僅用 10M tokens)

除 GPT-4o 外,其餘皆為 100M token 預算下的成績。AISI 公開圖表僅以圖上標籤呈現 GPT-5.4 與 Opus 4.5 的步數,內文並未另外提及,因此這兩項數字是直接從圖表讀出,而非引自文字。3 月、Mythos Preview 尚未問世時,Opus 4.6 的單次最佳成績是 32 步中的 22 步——幾週後,這正是 Mythos Preview 十次嘗試的平均值

效能隨算力對數線性成長 AISI 自認最值得關注的一項發現

AISI 的方法論論文發現,在其評估的較舊模型中,token 上限從 10M 提升到 100M,效能最大可提升達 59%,且未見瓶頸;該論文的評估對象並不包含 Mythos Preview。至於 Mythos Preview 本身,AISI 表示其效能一路成長至評估所用的 100M token 上限,並預期更高的預算仍會持續提升表現——但並未針對 Mythos Preview 給出對應的百分比數字。

  • +59%來自 AISI 方法論論文中較舊模型的發現,並非 Mythos Preview 的數字。
  • 尚未見上限AISI 針對 Mythos Preview 本身、於其 100M token 測試上限下所作的陳述。

一個分數不能說明什麼 評估本身排除的兩種解讀

以上分數都無法說明 Mythos Preview 在真實、有防禦的網路中會有何表現——AISI 自己的演練環境沒有主動防禦者、沒有端點偵測,噪聲行動也不受懲罰,因此分數只是對付簡單目標的上界,而非對付堅固目標的預測。而 Anthropic 不予發布模型,本身也不能證明它很危險:Anthropic 自陳的理由是其防護機制尚未就緒,這是一項關於準備程度的說法,並非一項經過量測的危險評級。

Anthropic 自行評測的成績 出自系統卡,並非 AISI

評估項目Mythos Preview對比
Cybench(40 題中運行 35 題)100%Anthropic 稱已飽和
CyberGym83.1%Opus 4.6:66.6%;Sonnet 4.6:65%
Firefox 147 漏洞利用(250 次試驗)84.0%Opus 4.6:15.2%;Sonnet 4.6:4.4%
SWE-bench Verified93.9%Opus 4.6:80.8%

Anthropic 自身測試發現,OpenBSD 網路處理程式中存在一個先前未知、可遠端觸發當機的漏洞,潛伏長達 27 年;Anthropic 表示,另在各主要作業系統與瀏覽器中發現數以千計的高風險與重大漏洞。這項總數是 Anthropic 對自家模型產出的自陳說法,未見任何獨立統計發布。Anthropic 確實曾請自家的人類承包商,人工複核了該模型 198 份漏洞報告。

  • 「數以千計」Anthropic 對自家模型產出的自陳說法,未見獨立統計。
  • 89% / 98%在 198 份報告中,人類承包商與 Mythos 自評的嚴重程度完全一致,或落差在一級以內。

Project Glasswing:把這項能力用於防禦 名稱取自玻璃翅蝴蝶

  • 命名

    玻璃翅蝴蝶

    • 根據 Anthropic 對命名的說明:在不造成傷害的情況下揭露隱藏之物。
  • 規模

    11 家發起夥伴,再加逾 40 家

    • Amazon Web Services、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorganChase、Linux 基金會、Microsoft、Nvidia 與 Palo Alto Networks,另有逾 40 家組織獲授掃描權限。
    • 資金:最高 1 億美元使用額度,另捐款 400 萬美元予開源資安組織。
    • 啟動 30 天後:約 50 家夥伴合計發現逾一萬個高風險或重大漏洞;另一項開源掃描則發現 6,202 個估計漏洞,經獨立複核者中 90.6% 確認為真。
  • 為何不予發布

    防護機制尚未就緒

    • Anthropic 表示不打算全面開放,並自陳理由:需要能偵測並阻擋模型最危險輸出的防護機制,並打算先在未來一款能力較低的 Opus 模型上導入。

評估環境的侷限 分數之所以不能直接外推

  • 缺乏主動防禦者——沒有 SOC 人員即時應對。
  • 無端點偵測——EDR 工具在測試環境中不存在。
  • 噪聲行動無懲罰機制——現實中會暴露的行為在此不受代價。

NCSC 的建議:回歸基本功 因應方向

  • 定期套用安全更新,防止已知漏洞被快速利用。
  • 強健的存取控制搭配安全設定(Secure Configuration)。
  • 完整日誌記錄;取得 NCSC Cyber Essentials 認證。

為何這是一個轉折點

2026 年 4 月,AI 模型首度在完整模擬的企業攻擊場景中,達到人類專家等級的自主作戰能力;數週後,更新版本又進一步提升——完整攻破次數倍增,並攻破了此前無任何模型攻克過的第二項工業控制系統演練。AISI 自己提醒的兩種誤讀——分數證明了真實世界的危險性,以及不予發布就證明了危險——都值得抵制,理由相同:這些評估本身都不足以證明這兩點。

仍然懸而未決的問題

AISI 對此網路演練所需人類專家時數的估計,六週內從 14 小時變為 20 小時,且未說明原因。Anthropic 所稱「數以千計」的已發現漏洞,並無獨立統計佐證。此外,目前尚無任何一方發布過針對主動防禦、受監控網路測試 Mythos Preview 的結果——而這正是能說明今日的上界能否撐過明日目標的關鍵測試。

來源:英國 AI Security Institute 對 Claude Mythos Preview 的評估報告(2026 年 4 月 13 日發布),以及針對較新版本的後續報告(2026 年 5 月 13 日發布);Anthropic 的 Claude Mythos Preview 系統卡與 Project Glasswing 公告(均為 2026 年 4 月 7 日),以及其 2026 年 5 月 22 日的進度更新;Anthropic Frontier Red Team 關於該模型漏洞發現的報告(2026 年 4 月 9 日發布);AISI 與 Irregular 於 2026 年 3 月 5 日發布的算力擴展研究,以及其所依據的網路演練方法論論文(arXiv:2603.11214);以及 AISI 與 NCSC 於 2026 年 3 月 30 日聯合發布的部落格文章。