Ringkasan
Keselamatan AI · Kriptografi · Ejen AI · Ringkasan PenyelidikanarXiv:2608.09867 · 10 Ogos 2026
Ringkasan eksekutif · taklimat satu muka surat
Penaakulan Disulitkan Hanya Separa Tersembunyi
OpenAI, Anthropic dan Google menyembunyikan rantaian pemikiran dengan cara yang sama: sulitkannya, serahkannya semula kepada klien, dan terimanya semula pada panggilan berikutnya. Kriptografinya bertahan. Pengikatannya tidak — blok tersulit itu ternyata boleh ditukar ganti merentas sesi, merentas pengguna, dan merentas model dalam keluarga yang sama. Jadi penyerang tidak perlu memecahkan model yang kuat itu langsung. Tangkap teksnya yang tersulit, serahkan kepada adik-beradik yang lebih murah dan penolakannya lebih nipis, minta adik-beradik itu membacanya kuat-kuat — dan penyedia pun menyahsulit atas permintaan. Lapan penyelidik kemudian menghalakan teknik itu kepada log yang telah pun diterbitkan oleh pembangun, lalu membacakan rahsia yang penulisnya tidak pernah tahu ada di dalamnya.
Dalam Angka satu sapuan log awam
- 315,320blok penaakulan dinyahkod daripada repositori awam
- 6,708trajektori ejen awam yang disapu untuk mencarinya
- 704artifak privasi daripada sesi pengguna tulen
- 64daripadanya tidak muncul di mana-mana dalam sembang yang kelihatan
Bagaimana Serangan Berjalan model kuat itu tidak pernah disentuh
- 01Tanyamodel yang kuat
- 02Tangkapteks tersulitnya
- 03Main semulake dalam adik-beradik
- 04Nyahsulitpenyedia menurut
- 05Transkripsipenolakan yang lemah
- 06Teks biasajejak kata demi kata
Apa yang Menyusul Permulaan · Perkembangan · Peralihan · Penyelesaian
| Babak | Halaman | Apa yang dirangkumi |
|---|---|---|
| 起 Persediaan | 2 | Mengapa penaakulan menjadi gelap, dan mengapa sampul itu ditolak kepada klien. |
| 承 Perkembangan | 2 | Tiga darjah keserasian, pembawa bagi setiap penyedia, dan bagaimana penemuan itu matang. |
| 轉 Peralihan | 3 | Empat penyalahgunaan berbeza terhadap satu kecacatan seni bina. |
| 合 Penyelesaian | 3 | Apa yang telah dibaiki oleh vendor, dan apa yang tidak lagi mampu dicapai oleh pembaikan. |
Intipatinya
Kriptografi tidak pernah menjadi bahagian yang lemah. Menyerahkan sebuah kotak berkunci kepada seseorang, berserta pemegang kunci yang membukanya untuk sesiapa sahaja yang meminta dengan sopan, bukanlah kerahsiaan — ia pengaburan dengan langkah tambahan. AEAD itu kukuh; pengikatannya sekadar tiada.
Rangka semula
Keselamatan dikuatkuasakan bagi setiap model sementara kunci dikongsi bagi setiap keluarga. Ketidakpadanan itulah keseluruhan kerentanan tersebut, dan ia akan berulang di mana-mana sahaja peringkat keupayaan berkongsi infrastruktur.
Konteks · Kandungan 1 / 2
Mengapa Pemikiran Menjadi Gelap dua motif, satu jalan pintas
Motif · harta intelek dan kebocoran
Sembunyikan Rantaian Pemikiran
- Penaakulan mentah ialah bahan yang boleh dilatih — menyembunyikannya memperlahankan penyulingan oleh pesaing.
- Satu jejak membocorkan jauh lebih banyak daripada jawapan yang dihasilkannya.
- Ketiga-tiga vendor bertemu pada keputusan yang sama, secara berasingan.
- Tiada satu pun mendokumenkan skema kriptografi yang dipilihnya.
- Sehingga Julai 2026 reka bentuk itu masih tidak diperihalkan secara umum.
Jalan pintas · ketiadaan keadaan
Serahkan kepada Klien
- Penyimpanan di pihak pelayan memakan keadaan; teks tersulit di tangan klien tidak memakan apa-apa.
- Sebuah sampul AEAD — pengepala, nonce, tag pengesahan, teks tersulit.
- Klien memulangkannya pada setiap panggilan berikutnya, tanpa dibaca.
- Tandatangan itu dicincang ke dalam MAC sebagai data bersekutu.
- Tiada apa-apa dalam sampul itu menamakan sesi, pengguna, atau model.
Tiga Darjah Keserasian semakin permisif
Taksonomi itulah sumbangan sebenar kertas kerja ini. Blok dimainkan semula dalam dan merentas sesi; kemudian merentas pengguna, sehingga satu akaun boleh menyuap jejak yang ditangkap daripada akaun lain; kemudian merentas model dalam keluarga yang sama. Darjah ketiga itulah tuasnya. Model yang kuat tidak pernah dijailbreak — ia sekadar dipetik kepada adik-beradik yang lebih murah yang latihan penolakannya lebih nipis, dan adik-beradik itu membacakan jejak tersebut kata demi kata. Oleh sebab tiada vendor mendokumenkan skema itu, para penulis membuat inferens daripada tingkah laku bahawa satu kunci global tunggal sedang digunakan. Kata-kata tepat mereka ialah nampaknya, dan kelonggaran itu wajar ada dalam setiap penceritaan semula penemuan ini.
- 1 keybagi setiap penyedia — disimpulkan daripada tingkah laku, tidak pernah didedahkan
- merentas modeldarjah yang menukar main semula menjadi pengekstrakan
| Penyedia | Pembawa di pihak klien | Sebagaimana diperihalkan oleh kertas kerja itu |
|---|---|---|
| OpenAI | signature | Item penaakulan tersulit yang dipulangkan untuk main semula secara manual di bawah pengurusan sejarah tanpa keadaan. |
| Anthropic | thinkingSignature | Blok pemikiran yang membawa tandatangan legap berkod base64 bersama-sama ringkasan. |
| thoughtSignature | Tandatangan pemikiran, sebagaimana didokumenkan untuk API Gemini. |
- 29 Mei 2026Matthew Green membuktikan main semula merentas sesi, akaun dan model, serta satu saluran sisi pemasaan — tetapi tidak dapat memulihkan teks biasa dengan boleh dipercayai, dan menyatakannya dengan terus terang.
- Awal Jul 2026Panfilov et al. mendedahkan pengekstrakan yang boleh dipercayai dan berskala kepada ketiga-tiga penyedia.
- 10 Ogos 2026Kertas kerja diterbitkan; 315,320 blok sudah dinyahkod daripada repositori awam.
- 11 Ogos 2026Green mengemas kini catatannya pada Mei untuk menunjukkan hasil yang menyelesaikan kerja yang dimulakannya.
- Ogos 2026Serangan tidak lagi dapat dihasilkan semula. Penerimaan telah diakui — tetapi tiada kenyataan awam daripada vendor, dan tiada CVE.
Peralihan & Penyelesaian · Kandungan 2 / 2
Empat Penyalahgunaan Satu Kecacatan satu tuas · empat hasil
| Vektor | Apa yang dihasilkannya | Mengapa ia memedihkan |
|---|---|---|
| Penyulingan | penaakulan proprietari, kata demi kata, ditunjukkan pada ketiga-tiga vendor | ia mengalahkan tepat penyembunyian yang menjadi sebab kewujudan seluruh reka bentuk itu |
| Pengekstrakan data | 62 kunci API, 33 kata laluan, 24 token akses dan 7 kunci persendirian, daripada sesi sebenar | dituai daripada log yang pemiliknya memilih untuk menerbitkannya, percaya ia sudah dibersihkan |
| Bahaya tersembunyi | kandungan yang jawapan model itu sendiri yang kelihatan telah pun enggan berikan | penolakan pada lapisan output bukanlah penolakan di dalam penaakulan yang mendahuluinya |
| Suntikan tidak kelihatan | muatan yang hidup sepenuhnya di dalam blok legap itu, dibawa oleh jejak yang tidak bersalah | tiada pembaca transkrip dapat melihatnya — jejak yang dikongsi menjadi kenderaan penghantaran |
Apa yang Sebenarnya Ditemui oleh Sapuan Itu repositori awam, Ogos 2026
- 1,028blok dinyahkod yang membawa pelanggaran privasi
- 0.3%daripada semua blok yang dinyahkod — jarang, bukan tidak berbahaya
- 328sesi terjejas, atau 4.9% daripada trajektori
- 912artifak apabila jejak penanda aras turut dikira
Satu angka mengatasi selebihnya. Daripada 704 artifak yang dipulihkan daripada sesi pengguna tulen, 64 tidak muncul di mana-mana dalam sejarah sembang yang kelihatan — rahsia itu wujud hanya di dalam penaakulan. Sesiapa yang membersihkan transkripnya dengan tekun sebelum menerbitkannya akan tetap terlepas setiap satu daripadanya, kerana tiada apa-apa lagi yang tinggal untuk dibersihkan pada bahagian yang boleh dibaca. Itulah yang membezakan hal ini daripada kisah kebocoran kelayakan yang biasa: penawar lazimnya, bacalah sebelum anda menerbitkannya, tidak berkesan pada medan yang anda tidak boleh baca. Jejak penanda aras dikira secara berasingan atas sebab yang biasa sahaja, yang para penulis berhati-hati menyatakannya — pelancaran seperti ClawBench menyerahkan kepada model satu persona sintetik yang lengkap untuk ditaakul, yang jika tidak akan menggelembungkan setiap kiraan data peribadi dalam kajian itu.
- 64artifak yang tidak mungkin dapat ditangkap dengan membersihkan teks yang kelihatan
- penanda arasdikira berasingan — persona sintetik akan menggelembungkan jumlahnya
Di Mana Ia Berakhir dibaiki ke hadapan, bukan ke belakang
- Ikat sampul itu — bawa pengecam pengguna dan perbualan di dalam muatan AEAD supaya blok yang dimainkan semula ditolak terus.
- Asingkan merentas model — tolak mana-mana sampul yang dijana oleh versi model selain daripada yang sedang ditanya.
- Simpan di pihak pelayan — pulangkan hanya pengecam rawak yang legap; jawapan yang memang cuba dielakkan oleh reka bentuk itu.
- Tambah pembatalan — jejaki tandatangan yang dikeluarkan supaya jejak yang terjejas boleh dibatalkan.
- Buang sebelum menerbitkan — keluarkan setiap medan penaakulan legap daripada mana-mana transkrip yang meninggalkan mesin anda.
- Putarkan apa yang sudah keluar — pembaikan di pihak pelayan menghentikan bacaan baharu, bukan kebocoran lama.
- Latih penolakan itu — ajar model menolak gesaan yang meminta mereka mentranskripsikan penaakulan tersembunyi; perhatikan bahawa ini bertahan pada lapisan yang sudah pun gagal sekali.
- Anggap medan legap sebagai kandungan — medan yang anda tidak boleh baca itu mustahil dibersihkan, bukan kosong, dan tidak sekali-kali boleh dianggap tidak berbahaya.
Apa yang dicapai oleh pembaikan
Ketiga-tiga penyedia menutup pintu itu dalam beberapa minggu, dan bukti konsepnya tidak lagi berjalan. Tetapi 315,320 blok sudah pun terbuka kepada umum, dan setiap kelayakan di dalamnya sudah pun hangus. Pembaikan yang tiba selepas penerbitan tidak menyahterbitkan apa-apa — satu-satunya penawar yang tinggal ialah penggiliran, oleh orang yang belum tahu bahawa mereka memerlukannya.
Perubahan yang kekal
Jejak ejen yang dikongsi kini menjadi permukaan rantaian bekalan, dan had struktur yang dinyatakan sendiri oleh para penulis tetap berdiri: melainkan model itu benar-benar teguh terhadap gesaan pengekstrakan, penaakulan tersulit tidak akan pernah lebih daripada separa tersembunyi. Setiap vendor mencapai bentuk yang sama secara berasingan, dan setiap seorang daripada mereka terlupa bahawa klien bukanlah satu-satunya pihak yang boleh memulangkan keadaan itu.