Ringkasan · Penilaian Itu
Keselamatan AI · Keupayaan AI · Model bahasa · Pengkomputeran · Tadbir urus · Taklimat penilaianPenilaian April 2026, rekod sehingga Mei
Institut Keselamatan AI UK
Model Pertama Yang Menamatkan Latihan Rangkaian AISI
Institut Keselamatan AI menguji Claude Mythos Preview daripada Anthropic pada set cabaran capture-the-flag miliknya sendiri, dan pada simulasi berasingan 32 langkah bagi serangan ke atas rangkaian korporat. Model itu mencapai 73% pada tugas CTF peringkat pakar, dan pada April menjadi model pertama menamatkan simulasi rangkaian itu — dalam tiga daripada sepuluh percubaan. Versi lebih baharu, diuji pada Mei, mencapai enam daripada sepuluh, dan menjadi yang pertama turut menamatkan latihan sistem kawalan perindustrian berasingan milik AISI. Penemuan paling ketara bukanlah mana-mana markah tunggal: ia ialah keupayaan yang terus meningkat dengan kuasa pengkomputeran, tanpa siling ditemui lagi.
- 73%kadar kejayaan pada CTF peringkat pakar
- 3 → 6 / 10latihan rangkaian ditamatkan sepenuhnya, April hingga Mei
- 22 / 32purata langkah diselesaikan pada April; yang terbaik sebelum ini ialah 16
- 100Mperuntukan token bagi setiap percubaan
Turutan · Institut, Kaedah dan Lapan Minggu Keputusan
Institut Keselamatan AI UK siapa yang menjalankan penilaian itu
- Sebahagian daripada Jabatan Sains, Inovasi dan Teknologi UK, ditubuhkan pada 2023.
- Dinamakan semula daripada AI Safety Institute kepada AI Security Institute, mencerminkan peralihan ke arah ancaman keselamatan negara yang konkrit.
- Ia telah membina rangka kerja berperingkat: penyiasatan melalui perbualan, kemudian cabaran CTF, kemudian simulasi serangan berbilang langkah.
- Ia menjejaki keupayaan siber ofensif model termaju dari semasa ke semasa, dan bekerjasama dengan National Cyber Security Centre (NCSC) bagi nasihat yang berikut.
Dua Landasan: CTF dan TLO satu menguji teknik, satu lagi keseluruhan kempen
Cabaran CTF
Satu situasi teknikal tunggal
- Set cabaran simulasi milik AISI sendiri, digredkan merentasi empat peringkat dari permulaan hingga pakar.
- Ia mengukur keupayaan ofensif dalam satu senario teknikal, bukan kempen berterusan.
Latihan TLO
Serangan rangkaian korporat 32 langkah
- Dari peninjauan awal hingga pengambilalihan rangkaian sepenuhnya, merentasi sembilan pencapaian, M1 hingga M9.
- Anggaran AISI bagi pakar manusia telah berubah antara laporan: 14 jam pada Mac, 20 jam pada April.
- Setiap percubaan dihadkan kepada 100 juta token.
Yang Terakhir: Sembilan Pencapaian rantaian serangan latihan itu
| Pencapaian | Tugas |
|---|---|
| M1 | Peninjauan awal |
| M2 | Pergerakan sisi dan pengekstrakan bukti kelayakan |
| M3 | Kecurian bukti kelayakan pelayar |
| M4 | Eksploitasi wiki dan main semula bukti kelayakan |
| M5 | Eksploitasi aplikasi web dan peningkatan keistimewaan |
| M6 | Kejuruteraan balikan perintah-dan-kawalan serta kriptanalisis |
| M7 | Kegigihan lanjutan |
| M8 | Pencerobohan infrastruktur |
| M9 | Pengambilalihan rangkaian sepenuhnya |
Lapan Minggu, Enam Penerbitan bagaimana kisah ini disusun
- 5 Mac 2026AISI, bersama Irregular, menerbitkan bukti bahawa prestasi siber AI terus meningkat dengan peruntukan token yang lebih besar — penemuan umum, mendahului Mythos Preview.
- 11–17 Mac 2026Kertas metodologi yang menerangkan TLO dan satu lagi latihan sistem kawalan perindustrian 7 langkah ("Cooling Tower") diserahkan, kemudian disemak semula.
- 30 Mac 2026NCSC dan AISI menerbitkan blog bersama: sebelum Mythos Preview wujud, model terbaik (Opus 4.6) mencatat purata 15.6 langkah TLO, dengan percubaan terbaik tunggal 22 daripada 32.
- 7 April 2026Anthropic mengumumkan Claude Mythos Preview, menerbitkan kad sistemnya, dan melancarkan Projek Glasswing.
- 9 April 2026Frontier Red Team milik Anthropic sendiri menerbitkan laporan penemuan kerentanannya, termasuk pepijat OpenBSD.
- 13 April 2026AISI menerbitkan penilaian bebasnya sendiri — sumber angka 73%, 3 daripada 10 dan 22 daripada 32 di atas.
- 13 Mei 2026AISI melaporkan bahawa versi Mythos Preview yang lebih baharu menamatkan kedua-dua latihan: TLO dalam 6 daripada 10 percubaan, dan "Cooling Tower" — yang tidak berjaya pada April — dalam 3 daripada 10.
Hujah · Lonjakan Sebenar, Diukur Terhadap Sasaran Mudah
CTF: 73% pada Peringkat Pakar set milik AISI sendiri, bukan penanda aras awam
Peringkat permulaan hampir tepu dan markah pertengahan tinggi, tetapi peringkat pakar mencapai 73% pada set bergred milik AISI sendiri. Sebelum April 2025, tiada model yang mampu menyelesaikan tugas peringkat pakar langsung.
- Pakar 73%Set CTF bergred milik AISI sendiri, bukan penanda aras pihak ketiga.
- Sifar, setahun lebih awalTiada model mampu lulus tugas peringkat pakar langsung sebelum April 2025.
TLO: Percubaan Terbaik Satu Model, Kemudian Purata Satu Lagi saiz lonjakan itu, dinyatakan dengan tepat
| Model | Purata langkah | Penyelesaian penuh |
|---|---|---|
| Mythos Preview (April) | 22 | 3 ✓ |
| Claude Opus 4.6 | 16 | 0 |
| GPT-5.4 | ~14 | 0 |
| Claude Opus 4.5 | 11 | 0 |
| GPT-4o (Ogos 2024) | 1.7 | 0, pada peruntukan 10 juta token |
Semua pada peruntukan 100 juta token kecuali GPT-4o. Carta rasmi AISI hanya memberikan bilangan langkah GPT-5.4 dan Opus 4.5 sebagai label pada carta, bukan dalam teksnya, jadi kedua-dua angka ini dibaca terus daripada carta, bukan petikan teks. Pada Mac, sebelum Mythos Preview wujud, percubaan terbaik tunggal Opus 4.6 mencapai 22 daripada 32 langkah — angka yang sama dengan purata sepuluh percubaan Mythos Preview beberapa minggu kemudian.
Keupayaan Berskala Log-Linear dengan Kuasa Pengkomputeran penemuan yang AISI sendiri anggap paling penting
Kertas metodologi AISI sendiri mendapati, merentasi model lebih lama yang dinilainya, peralihan daripada 10 juta kepada 100 juta token menaikkan prestasi sehingga 59%, tanpa mencapai takat mendatar. Kertas itu mendahului Mythos Preview. Bagi Mythos Preview sendiri, AISI menyatakan prestasinya terus meningkat sehingga siling 100 juta token yang digunakan penilaiannya, dan menjangkakan peruntukan lebih tinggi akan terus memperbaik keputusan — tanpa memberikan angka peratusan tersendiri bagi Mythos Preview.
- +59%Penemuan model lebih lama daripada kertas metodologi AISI sendiri, bukan angka Mythos Preview.
- Tiada siling ditemuiKenyataan AISI sendiri khusus tentang Mythos Preview, pada siling ujian 100 juta token.
Apa Yang Tidak Dimaksudkan oleh Sesuatu Markah dua tafsiran yang dinafikan oleh penilaian itu sendiri
Tiada satu pun markah di atas menunjukkan kebolehan sebenar Mythos Preview terhadap rangkaian sebenar yang dipertahankan — latihan milik AISI sendiri tiada pembela aktif, tiada pengesanan titik akhir, dan tiada penalti bagi tindakan yang bising, jadi markah itu hanyalah had atas terhadap sasaran mudah, bukan ramalan terhadap sasaran yang kukuh. Dan keengganan Anthropic melepaskan model itu, dengan sendirinya, bukan bukti ia berbahaya: sebab yang dinyatakan Anthropic sendiri ialah perlindungannya belum bersedia lagi, satu dakwaan tentang kesediaan, bukan penilaian bahaya yang diukur.
Apa yang Lain Tambah · Angka Anthropic Sendiri, dan Projek Glasswing
Penanda Aras Anthropic Sendiri daripada kad sistem, bukan AISI
| Penanda aras | Mythos Preview | Perbandingan |
|---|---|---|
| Cybench (35 daripada 40 tugas dijalankan) | 100% | tepu, menurut Anthropic |
| CyberGym | 83.1% | Opus 4.6: 66.6%; Sonnet 4.6: 65% |
| Eksploitasi Firefox 147 (250 percubaan) | 84.0% | Opus 4.6: 15.2%; Sonnet 4.6: 4.4% |
| SWE-bench Verified | 93.9% | Opus 4.6: 80.8% |
Ujian Anthropic sendiri menemui pepijat yang boleh dicetuskan dari jauh dan sebelum ini tidak diketahui dalam pengendalian rangkaian OpenBSD, terpendam selama 27 tahun, antara apa yang digambarkan Anthropic sebagai beribu-ribu lagi kerentanan keterukan tinggi dan kritikal merentasi setiap sistem pengendalian dan pelayar utama. Jumlah itu ialah dakwaan Anthropic sendiri tentang output modelnya sendiri, tanpa sebarang kiraan bebas yang diterbitkan. Anthropic memang menugaskan kontraktor manusianya sendiri menyemak 198 laporan kerentanan model itu secara manual.
- “Beribu-ribu”Dakwaan Anthropic sendiri tentang output modelnya; tiada kiraan bebas ditemui.
- 89% / 98%Daripada 198 laporan, kontraktor manusia bersetuju tepat dengan penilaian keterukan Mythos sendiri, atau dalam lingkungan satu tahap.
Projek Glasswing: Menggunakan Keupayaan Ini untuk Pertahanan dinamakan sempena rama-rama glasswing
Namanya
Rama-rama glasswing
- Mendedahkan apa yang tersembunyi tanpa menyebabkan kemudaratan, menurut penjelasan Anthropic sendiri tentang nama itu.
Skala
11 rakan kongsi pelancaran, kemudian 40+ lagi
- Amazon Web Services, Apple, Broadcom, Cisco, CrowdStrike, Google, JPMorganChase, Linux Foundation, Microsoft, Nvidia dan Palo Alto Networks, ditambah lebih 40 organisasi lain yang diberi akses mengimbas.
- Pembiayaan: sehingga AS$100 juta dalam kredit penggunaan, ditambah AS$4 juta sumbangan terus kepada organisasi keselamatan sumber terbuka.
- 30 hari kemudian: kira-kira 50 rakan kongsi bersama-sama menemui lebih sepuluh ribu kerentanan keterukan tinggi atau kritikal, dan imbasan sumber terbuka berasingan mendedahkan 6,202 penemuan anggaran, 90.6% disahkan benar apabila disemak secara bebas.
Sebab Tidak Dilepaskan
Perlindungan Belum Bersedia
- Anthropic menyatakan ia tidak merancang ketersediaan umum, dan memberikan sebabnya sendiri: ia memerlukan perlindungan yang boleh mengesan dan menyekat output paling berbahaya model itu, dan merancang memperkenalkannya dahulu pada model Opus masa depan yang kurang berupaya.
Apa Yang Ditinggalkan oleh Persekitaran Ujian Itu mengapa markah itu tidak berpindah terus
- Tiada pembela aktif — tiada kakitangan operasi keselamatan yang bertindak balas dalam masa nyata.
- Tiada pengesanan titik akhir — perkakas EDR tidak wujud dalam persekitaran itu.
- Tiada penalti bagi kelakuan yang bising — tindakan yang akan mendedahkan penyerang dalam realiti tidak membawa sebarang kos di sini.
Nasihat NCSC: Kembali kepada Asas apa yang perlu dilakukan mengenainya
- Pasang kemas kini keselamatan dengan segera, supaya kerentanan yang diketahui tidak boleh dieksploitasi dengan cepat.
- Kawalan akses yang kukuh berserta konfigurasi yang selamat.
- Pengelogan yang menyeluruh, dan perakuan NCSC Cyber Essentials.
Kesimpulan · Had Atas yang Terus Meningkat
Mengapa Ini Titik Perubahan
Buat pertama kali pada April, sebuah model AI mencapai keupayaan autonomi setaraf pakar manusia merentasi keseluruhan serangan korporat yang disimulasikan sepenuhnya, dan versi lebih baharu memperbaikinya dalam masa beberapa minggu — menggandakan kadar penyelesaian penuhnya dan menamatkan latihan kedua, sistem kawalan perindustrian, yang tidak pernah dicapai mana-mana model sebelum ini. Dua tafsiran yang diberi amaran oleh AISI sendiri — bahawa markah membuktikan bahaya sebenar, dan bahawa keengganan melepaskan model membuktikan ia berbahaya — wajar ditolak atas sebab yang sama: bukan itu yang sebenarnya ditunjukkan oleh penilaian ini.
Apa Yang Masih Benar-Benar Terbuka
Anggaran masa pakar manusia AISI sendiri bagi latihan rangkaian itu berubah daripada 14 jam kepada 20 jam dalam masa enam minggu, tanpa sebab dinyatakan. "Beribu-ribu" kerentanan yang ditemui Anthropic tiada kiraan bebas di sebaliknya. Dan tiada sesiapa menerbitkan ujian Mythos Preview terhadap rangkaian yang dipertahankan dan dipantau secara aktif — iaitu ujian yang sebenarnya akan menunjukkan sama ada had atas hari ini bertahan terhadap sasaran esok.