Keselamatan AI · Kriptografi · Keselamatan maklumat · Ejen AI · Ringkasan PenyelidikanarXiv:2608.09867, 10 Ogos 2026 · rekod terkini setakat September 2026
Satu kunci, setiap model
Jejak Penaakulan AI: Disulitkan, Bukan Disembunyikan
Anthropic, OpenAI dan Google kini menghantar penaakulan langkah demi langkah setiap model semula kepada klien sebagai blok yang disulitkan dan bukannya teks biasa, bagi melindunginya daripada pesaing dan mengelakkan pengguna membacanya secara terus. Satu kertas kerja yang diterbitkan pada Ogos 2026 menunjukkan penyulitan itu tidak diikat kepada sesi, pengguna atau model yang menghasilkannya: satu blok yang ditangkap boleh dimainkan semula ke model adik yang lebih kecil dan kurang dijaga, yang akan menyahkod dan mengulanginya kata demi kata.
Apa yang Berlaku
Sepuluh minggu memisahkan projek santai daripada serangan yang berfungsi Angka utama, sebelum penggredan.
- 315,320blok penaakulan dinyahkod daripada 6,708 jejak ejen awam yang dikikis
- 704artifak privasi yang dipulihkan hanya daripada sesi tulen (bukan penanda aras)
- 64daripadanya, ditemui hanya di dalam penaakulan yang disulitkan, tidak pernah dalam sembang yang kelihatan
- $720anggaran kos menyahkod sepuluh ribu jejak penaakulan menggunakan model termurah sesuatu penyedia
Apa yang mantap, dan sekukuh mana Disusun mengikut kekukuhan; gred tidak dicampur dalam satu baris.
| Kekukuhan | Apa yang ditunjukkan rekod | Sumber |
|---|---|---|
| Disahkan | Penyelidik menunjukkan serangan pengekstrakan ini terhadap API Anthropic, OpenAI dan Google: satu blok penaakulan yang ditangkap daripada model yang dijaga rapi dimainkan semula ke model adik yang lebih lemah dan kurang dijaga daripada penyedia yang sama, yang menyalin semula kata demi kata. | Panfilov et al., Ogos 2026 |
| Disahkan | Menyahkod 315,320 blok penaakulan yang dikikis daripada 6,708 jejak ejen awam memulihkan beratus-ratus bukti kelayakan dan data peribadi daripada sesi tulen sahaja, termasuk 62 kunci API, 33 kata laluan, 24 token akses dan 7 kunci peribadi. | Panfilov et al., Ogos 2026 |
| Disahkan | Penulis kertas kerja mendedahkan kelemahan ini kepada penyedia yang terjejas, Microsoft dan Hugging Face sebelum penerbitan; semua mengesahkan penerimaan. Matthew Green, yang catatan awalnya menjadi asas kertas kerja ini, turut melaporkan tingkah laku main semula tersebut secara berasingan kepada OpenAI dan Anthropic pada Mei 2026. | Panfilov et al.; M. Green |
| Disahkan tetapi tidak dapat disahkan di sini | Kertas kerja itu sendiri menyatakan bahawa, setakat Ogos 2026, hasil pengekstrakan utamanya tidak lagi dapat dihasilkan semula terhadap API penyedia, berikutan langkah mitigasi yang dilaksanakan penyedia selepas pendedahan. | Panfilov et al., Ogos 2026 (laporan sendiri) |
| Disahkan tetapi tidak dapat disahkan di sini | The Hacker News melaporkan bahawa dokumentasi semasa Anthropic mengikat blok pemikiran kepada model yang menghasilkannya dan menasihatkan agar ia dibuang apabila menukar model, kerana model lain mengabaikannya. | The Hacker News, 12 Ogos 2026 |
| Disahkan tetapi tidak dapat disahkan di sini | Setakat tarikh penerbitannya sendiri, The Hacker News tidak menemui sebarang pengakuan awam daripada Anthropic, OpenAI atau Google yang menamakan kertas kerja khusus ini. | The Hacker News, 12 Ogos 2026 |
| Tidak disahkan | Sama ada blok penaakulan yang sudah diterbitkan dalam talian sebelum pembetulan penyedia masih boleh dinyahkod hari ini — soalan yang berbeza daripada sama ada percubaan pengekstrakan baharu masih berjaya — belum ditetapkan sama ada satu cara pun. | The Hacker News, 12 Ogos 2026 |
| Tidak diketahui umum | Setakat tempoh ujian kertas kerja itu sendiri, tiada penyedia menerbitkan penerangan terperinci tentang mekanisme kriptografi yang melindungi blok penaakulan mereka. | Panfilov et al., Ogos 2026 |
Garis Masa
Daripada eksperimen hujung minggu kepada kaedah pengekstrakan berskala Bertarikh seperti yang dinyatakan oleh setiap sumber.
- 2026Matthew Green, ahli kriptografi di Universiti Johns Hopkins, menerbitkan catatan eksperimen santai yang mendapati blok penaakulan disulitkan daripada API OpenAI, Anthropic dan Google boleh dimainkan semula merentasi sesi, merentasi akaun, dan — bagi OpenAI — merentasi model, tanpa kunci nyahsulit yang sah.
- 29 Mei 2026Green melaporkan tingkah laku main semula ini kepada OpenAI dan Anthropic melalui program ganjaran pepijat masing-masing. Menurut catatannya sendiri, OpenAI menyifatkan laporan itu tidak dapat dihasilkan semula, manakala Anthropic berkata ia tidak melihat sebarang implikasi keselamatan dalam tingkah laku main semula atau saluran sisi.
- Jul 2026Penulis kertas kerja menjalankan penilaian API mereka merentasi Anthropic, OpenAI dan Google, membangunkan kaedah pengekstrakan merentasi model dan imbasan jejak awam.
- 10 Ogos 2026“Stealing Reasoning Traces from Proprietary LLM APIs” dihantar ke arXiv, menerangkan kaedah pengekstrakan merentasi model dan penemuan imbasan jejak awam.
- 11 Ogos 2026Green menambah kemas kini pada catatannya bulan Mei, merujuk pembaca kepada kertas kerja baharu itu, menggambarkannya sebagai mengubah penemuannya sendiri menjadi “serangan sebenar yang berfungsi”.
- 12 Ogos 2026The Hacker News menerbitkan liputannya sendiri, mengesahkan angka kertas kerja itu dan menambah bahawa penyulitan itu sendiri tidak pernah dipecahkan — serangan ini bergantung pada blok utuh yang diterima dan diproses oleh penyedia.
- Ogos 2026Menurut kertas kerja itu sendiri, ketiga-tiga penyedia melaksanakan langkah mitigasi berikutan pendedahan, dan hasil pengekstrakan utamanya berhenti dapat dihasilkan semula.
- Sep 2026Dokumentasi semasa menunjukkan ketiga-tiga penyedia belum bersepakat pada satu pendirian: Google masih menggambarkan keserasian merentasi model yang diuruskan oleh bahagian belakang, manakala OpenAI kini menyekat penggunaan semula penaakulan kepada model dalam keluarga yang sama dan secara automatik mengabaikan selebihnya.
Hujah
Kriptografi itu sendiri bukan titik lemah — sempadan di sekelilingnya yang lemah Dikaitkan, mengikut nama, kepada kertas kerja dan catatan Green sendiri.
Panfilov dan rakan-rakannya menerangkan satu pilihan seni bina, bukan sifer yang dipecahkan: bagi mengelak menyimpan setiap jejak penaakulan pada pelayan sendiri, Anthropic, OpenAI dan Google masing-masing membungkusnya sebagai blok yang disulitkan dan menyerahkannya kepada klien untuk disimpan serta dipulangkan pada giliran seterusnya. Ujian mereka menunjukkan setiap penyedia mengesahkan dan menyulitkan semua blok sedemikian dengan satu kunci yang sama merentasi keseluruhan penyedia, bukannya kunci yang terikat kepada satu sesi, satu pengguna atau satu model. Kriptografi itu sendiri langsung tidak perlu dipecahkan — blok itu semata-mata tidak membawa sebarang penanda tentang di mana ia dihasilkan atau milik siapa.
Catatan Green pada bulan Mei ialah asal pemerhatian itu, dan kertas kerja itu sendiri mengakuinya secara langsung. Beliau mendapati blok yang ditangkap boleh dimainkan semula merentasi sesi, merentasi akaun dan, bagi OpenAI, merentasi model yang berbeza, dan blok yang dimainkan semula “aktif dari segi semantik” dan bukan sekadar diabaikan. Beliau turut menunjukkan, menggunakan data yang beliau tanam sendiri, bahawa panjang dan masa satu blok penaakulan boleh membocorkan satu bit rahsia yang diarahkan supaya model tidak sekali-kali nyatakan secara terus. Apa yang tidak berjaya beliau lakukan, menurut catatannya sendiri, ialah mengubah mana-mana penemuan itu menjadi cara yang boleh dipercayai untuk mengeluarkan rahsia sebenar daripada sesi orang lain. Sumbangan kertas kerja itu sendiri ialah langkah yang tertinggal: menghalakan jejak yang ditangkap melalui model adik yang lebih kecil dan kurang dijaga daripada penyedia yang sama, yang menyahkod dan menyalin semula apabila diminta — tanpa sekali-kali meminta model yang lebih berupaya yang menghasilkan penaakulan itu mendedahkannya secara terus.
Langkah penghalaan itu berjaya kerana kepincangan keselamatan yang dinamakan secara langsung oleh kertas kerja itu: model paling canggih dilatih secara mendalam untuk menolak permintaan mendedahkan rantaian pemikirannya sendiri, tetapi model adiknya yang lebih murah dan pantas — dibina demi kos dan kelajuan, bukan sebagai produk unggulan — tidak dikenakan piawaian yang sama. Penyerang langsung tidak perlu melakukan jailbreak terhadap model yang berupaya itu; ia hanya memerlukan model adik yang serasi dan sudi menyahkod apa yang diserahkan kepadanya.
Kebolehalihan yang dieksploitasi secara sengaja oleh kertas kerja itu, boleh dieksploitasi secara tidak sengaja oleh pihak ketiga. Pembangun sering menerbitkan log sesi ejen yang mentah demi kebolehulangan, membawa sekali blok penaakulan bersama transkrip yang kelihatan; mana-mana pihak ketiga yang dapat membaca blok itu dengan mana-mana model serasi akan memperoleh semula apa jua yang ditaakulkan oleh model itu, sama ada ia pernah muncul dalam teks yang kelihatan ataupun tidak. Kertas kerja itu turut mengemukakan satu lagi akibat — bahawa arahan berniat jahat boleh ditanam sepenuhnya di dalam satu blok penaakulan dan kemudiannya dimainkan semula ke dalam tugasan yang tidak berkaitan, tidak kelihatan kepada sesiapa yang hanya membaca perbualan yang kelihatan — sebagai sebab mengapa sifat legap ini memotong ke dua-dua arah: ia boleh menyembunyikan kandungan berbahaya yang ditaakulkan oleh model tanpa dinyatakan, dan sama mudahnya ia boleh menyembunyikan sesuatu yang sepatutnya dilihat oleh pengguna atau pemantau.
Kertas kerja itu membuat kesimpulannya sendiri daripada ketegangan reka bentuk ini: selagi sesuatu model perlu menyahsulit dan bertindak atas penaakulan terdahulu untuk meneruskan perbualan, satu blok penaakulan yang disulitkan “tidak akan pernah lebih daripada separuh tersembunyi”, tidak kira macam mana rupa kriptografi pada peringkat pengangkutan — kandungannya tetap boleh dicapai melalui mana-mana model yang secara tersirat memegang kuncinya. Itulah maksud tepat “disulitkan, bukan disembunyikan”: penaakulan itu disulitkan daripada pengguna yang cuba membacanya dan daripada pesaing yang mengikisnya secara pukal; ia tidak pernah, dan tidak boleh, tersembunyi daripada model dalam keluarga yang sama yang diminta dengan cukup baik untuk menyebutnya semula.
Apa yang Ditambah oleh Sumber Lain
Tiga penyedia, tiga pendirian berbeza sebulan kemudian Dibaca terus daripada dokumentasi pembangun semasa setiap penyedia.
Google
Keserasian dikekalkan, diuruskan oleh bahagian belakang
- Dokumentasinya masih menyebut tandatangan pemikiran sebagai “representasi disulitkan bagi penaakulan dalaman model”, yang diperlukan untuk keselanjaran merentasi giliran.
- Apabila menukar model dalam satu sesi, panduannya ialah terus menghantar semula blok pemikiran model sebelumnya — “bahagian belakang menguruskan keserasian”.
OpenAI
Satu sempadan telah muncul sejak tempoh ujian kertas kerja itu
- Respons tanpa keadaan masih memulangkan item penaakulan
encrypted_contentuntuk disimpan dan dihantar semula oleh klien. - Tetapi penaakulan yang berterusan “hanya boleh digunakan semula dalam keluarga model yang sama”, dan API kini secara automatik mengabaikan penaakulan yang tidak serasi — lebih sempit berbanding tingkah laku Julai 2026 yang diukur kertas kerja itu, apabila penaakulan boleh dibawa merentasi setiap generasi GPT terdahulu yang diuji.
- Respons tanpa keadaan masih memulangkan item penaakulan
Anthropic
Satu dakwaan yang tidak terdapat dalam dokumentasi semasa Anthropic sendiri
- The Hacker News melaporkan bahawa dokumentasi Anthropic mengikat blok pemikiran kepada model yang menghasilkannya dan menasihatkan ia dibuang apabila bertukar, kerana model lain mengabaikannya.
- Dokumentasi awam Anthropic sendiri tentang Extended Thinking, setakat September 2026, tidak mengandungi bahasa itu dan langsung tidak menggunakan perkataan “signature”.
Apa yang ditambah oleh rekod pendedahan dan cadangan mitigasi Daripada bahagian perbincangan kertas kerja itu sendiri dan cadangan Green sendiri.
Senarai pembetulan kertas kerja itu sendiri terentang daripada yang drastik hingga yang berperingkat: memindahkan semula storan penaakulan ke pelayan penyedia sendiri dan hanya menyerahkan pengecam carian legap kepada klien akan menghapuskan sepenuhnya aset yang boleh dimainkan semula, dengan kos infrastruktur yang nyata; jika tidak sejauh itu, ia mencadangkan mengikat setiap sampul yang disulitkan kepada pengguna dan perbualan tertentu, dan menolak blok yang dikemukakan di luar konteks yang menghasilkannya. Cadangan Green sendiri dari bulan Mei, yang ditujukan terus kepada penyedia, lebih sempit dan tiba lebih awal: perbaiki pengurusan kunci, dan berhenti menganggap saluran sisi tidak layak mendapat perhatian pasukan keselamatan hanya kerana ia perlahan.
Kesimpulan
Penyulitan melindungi sempadan yang salah Untuk sesiapa yang menerbitkan jejak ejen, menyimpan keadaan sesi, atau membaca dokumentasi penyedia untuk merancang berdasarkannya.
- Buang blok penaakulan atau pemikiran daripada mana-mana log sesi atau jejak ejen sebelum menerbitkannya, apabila sesi itu pernah menyentuh sesuatu yang sensitif — membersihkan teks yang kelihatan sahaja meninggalkan apa jua yang ditaakulkan oleh model tetap berada dalam blok yang disulitkan.
- Jangan anggap selamat menyerahkan blok yang legap dan kelihatan tidak boleh dibaca kepada pihak lain hanya kerana ia tidak boleh dibaca tanpa kunci — model yang serasi, bukan kunci, yang didapati mampu membacanya.
- Semak panduan keselanjaran penaakulan khusus bagi API penyedia yang digunakan, bukannya menganggap satu dasar terpakai di mana-mana — setakat September 2026, ketiga-tiga penyedia yang dinamakan menggambarkan tiga pendirian yang berbeza.
- Bagi mana-mana alat yang menyimpan atau menghantar keadaan perbualan bagi pihak pengguna, elakkan menyimpan blok penaakulan lebih lama daripada yang diperlukan oleh perbualan itu sendiri.
- Jangkakan sempadan merentasi model terus berubah: ia sudah menyempit sekali, bagi satu penyedia, sejak tempoh ujian kertas kerja itu sendiri, dan tiada penerangan tentang tingkah laku sesuatu API patut dipercayai kekal lama.
Apa yang perlu dipegang longgar
Dakwaan bahawa serangan yang ditunjukkan tidak lagi berkesan bersandar pada catatan kertas kerja itu sendiri tentang ujian susulannya, bukan pada pernyataan awam daripada Anthropic, OpenAI atau Google. Jumlah rahsia yang dipulihkan ialah kiraan rahsia yang berbentuk sah: kertas kerja itu menilai satu nilai berdasarkan bentuknya dan menyatakan dengan jelas bahawa nilai yang didakwa telah dibatalkan, luput atau “untuk ujian sahaja” tetap dikira, jadi ia bukan kiraan kunci yang disemak masih berfungsi. Sama ada blok penaakulan yang telah dikikis dan diterbitkan sebelum pembetulan masih boleh dinyahsulit hari ini kekal sebagai soalan terbuka setakat September 2026.
Intipati
Menyulitkan blok penaakulan menghalang pengguna daripada membaca fikiran model mereka sendiri, dan menghalang pesaing daripada mengikisnya secara pukal. Ia tidak pernah, dan secara struktural tidak boleh, menghalang model serasi yang diminta membacakannya semula — kerana sentiasa ada satu model yang perlu berbuat demikian. Jurang antara disulitkan dan disembunyikan itulah, bukan sifer yang dipecahkan, yang membenarkan jejak yang ditangkap itu merantau.