Tratopedia
ES
Tetapan

Saiz teks

Tema

Kontras tinggi

Versi

v1.81.0

Keluaran yang menjadi asas halaman ini dibina. Itulah versi yang disimpan oleh service worker.

Keselamatan AI · Keupayaan AI · Model bahasa · Pengkomputeran · Tadbir urus · Taklimat penilaianPenilaian April 2026, rekod sehingga Mei

Institut Keselamatan AI UK

Model Pertama Yang Menamatkan Latihan Rangkaian AISI

Institut Keselamatan AI menguji Claude Mythos Preview daripada Anthropic pada set cabaran capture-the-flag miliknya sendiri, dan pada simulasi berasingan 32 langkah bagi serangan ke atas rangkaian korporat. Model itu mencapai 73% pada tugas CTF peringkat pakar, dan pada April menjadi model pertama menamatkan simulasi rangkaian itu — dalam tiga daripada sepuluh percubaan. Versi lebih baharu, diuji pada Mei, mencapai enam daripada sepuluh, dan menjadi yang pertama turut menamatkan latihan sistem kawalan perindustrian berasingan milik AISI. Penemuan paling ketara bukanlah mana-mana markah tunggal: ia ialah keupayaan yang terus meningkat dengan kuasa pengkomputeran, tanpa siling ditemui lagi.

  • 73%kadar kejayaan pada CTF peringkat pakar
  • 3 → 6 / 10latihan rangkaian ditamatkan sepenuhnya, April hingga Mei
  • 22 / 32purata langkah diselesaikan pada April; yang terbaik sebelum ini ialah 16
  • 100Mperuntukan token bagi setiap percubaan

Institut Keselamatan AI UK siapa yang menjalankan penilaian itu

  • Sebahagian daripada Jabatan Sains, Inovasi dan Teknologi UK, ditubuhkan pada 2023.
  • Dinamakan semula daripada AI Safety Institute kepada AI Security Institute, mencerminkan peralihan ke arah ancaman keselamatan negara yang konkrit.
  • Ia telah membina rangka kerja berperingkat: penyiasatan melalui perbualan, kemudian cabaran CTF, kemudian simulasi serangan berbilang langkah.
  • Ia menjejaki keupayaan siber ofensif model termaju dari semasa ke semasa, dan bekerjasama dengan National Cyber Security Centre (NCSC) bagi nasihat yang berikut.

Dua Landasan: CTF dan TLO satu menguji teknik, satu lagi keseluruhan kempen

  • Cabaran CTF

    Satu situasi teknikal tunggal

    • Set cabaran simulasi milik AISI sendiri, digredkan merentasi empat peringkat dari permulaan hingga pakar.
    • Ia mengukur keupayaan ofensif dalam satu senario teknikal, bukan kempen berterusan.
  • Latihan TLO

    Serangan rangkaian korporat 32 langkah

    dibina oleh AISI, bukan awam

    • Dari peninjauan awal hingga pengambilalihan rangkaian sepenuhnya, merentasi sembilan pencapaian, M1 hingga M9.
    • Anggaran AISI bagi pakar manusia telah berubah antara laporan: 14 jam pada Mac, 20 jam pada April.
    • Setiap percubaan dihadkan kepada 100 juta token.

Yang Terakhir: Sembilan Pencapaian rantaian serangan latihan itu

PencapaianTugas
M1Peninjauan awal
M2Pergerakan sisi dan pengekstrakan bukti kelayakan
M3Kecurian bukti kelayakan pelayar
M4Eksploitasi wiki dan main semula bukti kelayakan
M5Eksploitasi aplikasi web dan peningkatan keistimewaan
M6Kejuruteraan balikan perintah-dan-kawalan serta kriptanalisis
M7Kegigihan lanjutan
M8Pencerobohan infrastruktur
M9Pengambilalihan rangkaian sepenuhnya

Lapan Minggu, Enam Penerbitan bagaimana kisah ini disusun

  1. 5 Mac 2026AISI, bersama Irregular, menerbitkan bukti bahawa prestasi siber AI terus meningkat dengan peruntukan token yang lebih besar — penemuan umum, mendahului Mythos Preview.
  2. 11–17 Mac 2026Kertas metodologi yang menerangkan TLO dan satu lagi latihan sistem kawalan perindustrian 7 langkah ("Cooling Tower") diserahkan, kemudian disemak semula.
  3. 30 Mac 2026NCSC dan AISI menerbitkan blog bersama: sebelum Mythos Preview wujud, model terbaik (Opus 4.6) mencatat purata 15.6 langkah TLO, dengan percubaan terbaik tunggal 22 daripada 32.
  4. 7 April 2026Anthropic mengumumkan Claude Mythos Preview, menerbitkan kad sistemnya, dan melancarkan Projek Glasswing.
  5. 9 April 2026Frontier Red Team milik Anthropic sendiri menerbitkan laporan penemuan kerentanannya, termasuk pepijat OpenBSD.
  6. 13 April 2026AISI menerbitkan penilaian bebasnya sendiri — sumber angka 73%, 3 daripada 10 dan 22 daripada 32 di atas.
  7. 13 Mei 2026AISI melaporkan bahawa versi Mythos Preview yang lebih baharu menamatkan kedua-dua latihan: TLO dalam 6 daripada 10 percubaan, dan "Cooling Tower" — yang tidak berjaya pada April — dalam 3 daripada 10.

CTF: 73% pada Peringkat Pakar set milik AISI sendiri, bukan penanda aras awam

Peringkat permulaan hampir tepu dan markah pertengahan tinggi, tetapi peringkat pakar mencapai 73% pada set bergred milik AISI sendiri. Sebelum April 2025, tiada model yang mampu menyelesaikan tugas peringkat pakar langsung.

  • Pakar 73%Set CTF bergred milik AISI sendiri, bukan penanda aras pihak ketiga.
  • Sifar, setahun lebih awalTiada model mampu lulus tugas peringkat pakar langsung sebelum April 2025.

TLO: Percubaan Terbaik Satu Model, Kemudian Purata Satu Lagi saiz lonjakan itu, dinyatakan dengan tepat

ModelPurata langkahPenyelesaian penuh
Mythos Preview (April)223 ✓
Claude Opus 4.6160
GPT-5.4~140
Claude Opus 4.5110
GPT-4o (Ogos 2024)1.70, pada peruntukan 10 juta token

Semua pada peruntukan 100 juta token kecuali GPT-4o. Carta rasmi AISI hanya memberikan bilangan langkah GPT-5.4 dan Opus 4.5 sebagai label pada carta, bukan dalam teksnya, jadi kedua-dua angka ini dibaca terus daripada carta, bukan petikan teks. Pada Mac, sebelum Mythos Preview wujud, percubaan terbaik tunggal Opus 4.6 mencapai 22 daripada 32 langkah — angka yang sama dengan purata sepuluh percubaan Mythos Preview beberapa minggu kemudian.

Keupayaan Berskala Log-Linear dengan Kuasa Pengkomputeran penemuan yang AISI sendiri anggap paling penting

Kertas metodologi AISI sendiri mendapati, merentasi model lebih lama yang dinilainya, peralihan daripada 10 juta kepada 100 juta token menaikkan prestasi sehingga 59%, tanpa mencapai takat mendatar. Kertas itu mendahului Mythos Preview. Bagi Mythos Preview sendiri, AISI menyatakan prestasinya terus meningkat sehingga siling 100 juta token yang digunakan penilaiannya, dan menjangkakan peruntukan lebih tinggi akan terus memperbaik keputusan — tanpa memberikan angka peratusan tersendiri bagi Mythos Preview.

  • +59%Penemuan model lebih lama daripada kertas metodologi AISI sendiri, bukan angka Mythos Preview.
  • Tiada siling ditemuiKenyataan AISI sendiri khusus tentang Mythos Preview, pada siling ujian 100 juta token.

Apa Yang Tidak Dimaksudkan oleh Sesuatu Markah dua tafsiran yang dinafikan oleh penilaian itu sendiri

Tiada satu pun markah di atas menunjukkan kebolehan sebenar Mythos Preview terhadap rangkaian sebenar yang dipertahankan — latihan milik AISI sendiri tiada pembela aktif, tiada pengesanan titik akhir, dan tiada penalti bagi tindakan yang bising, jadi markah itu hanyalah had atas terhadap sasaran mudah, bukan ramalan terhadap sasaran yang kukuh. Dan keengganan Anthropic melepaskan model itu, dengan sendirinya, bukan bukti ia berbahaya: sebab yang dinyatakan Anthropic sendiri ialah perlindungannya belum bersedia lagi, satu dakwaan tentang kesediaan, bukan penilaian bahaya yang diukur.

Penanda Aras Anthropic Sendiri daripada kad sistem, bukan AISI

Penanda arasMythos PreviewPerbandingan
Cybench (35 daripada 40 tugas dijalankan)100%tepu, menurut Anthropic
CyberGym83.1%Opus 4.6: 66.6%; Sonnet 4.6: 65%
Eksploitasi Firefox 147 (250 percubaan)84.0%Opus 4.6: 15.2%; Sonnet 4.6: 4.4%
SWE-bench Verified93.9%Opus 4.6: 80.8%

Ujian Anthropic sendiri menemui pepijat yang boleh dicetuskan dari jauh dan sebelum ini tidak diketahui dalam pengendalian rangkaian OpenBSD, terpendam selama 27 tahun, antara apa yang digambarkan Anthropic sebagai beribu-ribu lagi kerentanan keterukan tinggi dan kritikal merentasi setiap sistem pengendalian dan pelayar utama. Jumlah itu ialah dakwaan Anthropic sendiri tentang output modelnya sendiri, tanpa sebarang kiraan bebas yang diterbitkan. Anthropic memang menugaskan kontraktor manusianya sendiri menyemak 198 laporan kerentanan model itu secara manual.

  • “Beribu-ribu”Dakwaan Anthropic sendiri tentang output modelnya; tiada kiraan bebas ditemui.
  • 89% / 98%Daripada 198 laporan, kontraktor manusia bersetuju tepat dengan penilaian keterukan Mythos sendiri, atau dalam lingkungan satu tahap.

Projek Glasswing: Menggunakan Keupayaan Ini untuk Pertahanan dinamakan sempena rama-rama glasswing

  • Namanya

    Rama-rama glasswing

    • Mendedahkan apa yang tersembunyi tanpa menyebabkan kemudaratan, menurut penjelasan Anthropic sendiri tentang nama itu.
  • Skala

    11 rakan kongsi pelancaran, kemudian 40+ lagi

    • Amazon Web Services, Apple, Broadcom, Cisco, CrowdStrike, Google, JPMorganChase, Linux Foundation, Microsoft, Nvidia dan Palo Alto Networks, ditambah lebih 40 organisasi lain yang diberi akses mengimbas.
    • Pembiayaan: sehingga AS$100 juta dalam kredit penggunaan, ditambah AS$4 juta sumbangan terus kepada organisasi keselamatan sumber terbuka.
    • 30 hari kemudian: kira-kira 50 rakan kongsi bersama-sama menemui lebih sepuluh ribu kerentanan keterukan tinggi atau kritikal, dan imbasan sumber terbuka berasingan mendedahkan 6,202 penemuan anggaran, 90.6% disahkan benar apabila disemak secara bebas.
  • Sebab Tidak Dilepaskan

    Perlindungan Belum Bersedia

    • Anthropic menyatakan ia tidak merancang ketersediaan umum, dan memberikan sebabnya sendiri: ia memerlukan perlindungan yang boleh mengesan dan menyekat output paling berbahaya model itu, dan merancang memperkenalkannya dahulu pada model Opus masa depan yang kurang berupaya.

Apa Yang Ditinggalkan oleh Persekitaran Ujian Itu mengapa markah itu tidak berpindah terus

  • Tiada pembela aktif — tiada kakitangan operasi keselamatan yang bertindak balas dalam masa nyata.
  • Tiada pengesanan titik akhir — perkakas EDR tidak wujud dalam persekitaran itu.
  • Tiada penalti bagi kelakuan yang bising — tindakan yang akan mendedahkan penyerang dalam realiti tidak membawa sebarang kos di sini.

Nasihat NCSC: Kembali kepada Asas apa yang perlu dilakukan mengenainya

  • Pasang kemas kini keselamatan dengan segera, supaya kerentanan yang diketahui tidak boleh dieksploitasi dengan cepat.
  • Kawalan akses yang kukuh berserta konfigurasi yang selamat.
  • Pengelogan yang menyeluruh, dan perakuan NCSC Cyber Essentials.

Mengapa Ini Titik Perubahan

Buat pertama kali pada April, sebuah model AI mencapai keupayaan autonomi setaraf pakar manusia merentasi keseluruhan serangan korporat yang disimulasikan sepenuhnya, dan versi lebih baharu memperbaikinya dalam masa beberapa minggu — menggandakan kadar penyelesaian penuhnya dan menamatkan latihan kedua, sistem kawalan perindustrian, yang tidak pernah dicapai mana-mana model sebelum ini. Dua tafsiran yang diberi amaran oleh AISI sendiri — bahawa markah membuktikan bahaya sebenar, dan bahawa keengganan melepaskan model membuktikan ia berbahaya — wajar ditolak atas sebab yang sama: bukan itu yang sebenarnya ditunjukkan oleh penilaian ini.

Apa Yang Masih Benar-Benar Terbuka

Anggaran masa pakar manusia AISI sendiri bagi latihan rangkaian itu berubah daripada 14 jam kepada 20 jam dalam masa enam minggu, tanpa sebab dinyatakan. "Beribu-ribu" kerentanan yang ditemui Anthropic tiada kiraan bebas di sebaliknya. Dan tiada sesiapa menerbitkan ujian Mythos Preview terhadap rangkaian yang dipertahankan dan dipantau secara aktif — iaitu ujian yang sebenarnya akan menunjukkan sama ada had atas hari ini bertahan terhadap sasaran esok.

Sumber: penilaian Institut Keselamatan AI UK terhadap Claude Mythos Preview, diterbitkan 13 April 2026, dan susulannya tentang versi lebih baharu, diterbitkan 13 Mei 2026; kad sistem Claude Mythos Preview dan pengumuman Projek Glasswing oleh Anthropic, kedua-duanya 7 April 2026, serta kemas kini kemajuannya pada 22 Mei 2026; laporan Frontier Red Team Anthropic tentang penemuan kerentanan model itu, diterbitkan 9 April 2026; kajian penskalaan inferens AISI/Irregular bertarikh 5 Mac 2026 dan kertas metodologi latihan siber yang mendasarinya (arXiv:2603.11214); serta blog bersama AISI/NCSC bertarikh 30 Mac 2026.