Apa Yang Berlaku
Kejuruteraan LLM · Model bahasa · Kejuruteraan perisian · Ejen AI · Laporan Pasca Insiden KejuruteraanBlog Kejuruteraan Anthropic, April 2026 · rekod hingga Mei 2026
Diselesaikan dalam v2.1.116 · API itu sendiri tidak terjejas
Tiga Perubahan Yang Tidak Berkaitan Yang Kelihatan Seperti Satu Regresi
Daya pemikiran lalai yang direndahkan; pepijat cache yang terus-menerus mengosongkan sejarah pemikiran; peraturan gesaan sistem yang mengehadkan panjang keluaran. Ketiga-tiganya menyentuh kepingan trafik yang berbeza pada masa yang berbeza, dan bersama-sama ia kelihatan sebagai kejatuhan kualiti yang luas dan tidak konsisten. Claude Code, Agent SDK dan Cowork terjejas; API itu sendiri tidak. Audit data seorang jurutera AMD sendiri mencapai kesimpulan yang serupa tiga minggu sebelum Anthropic berkata apa-apa secara terbuka.
- 3masalah berasingan, semuanya dibaiki menjelang 20 April
- 34hari bagi yang paling lama berlarutan
- −3%penurunan pada satu penilaian yang mengesan masalah ketiga
- v2.1.116keluaran yang menyelesaikan ketiga-tiganya
| Taraf | Peristiwa | Butiran |
|---|---|---|
| Disahkan | Tiga perubahan produk tidak berkaitan, 4 Mac – 20 April | Lalai daya pemikiran yang direndahkan, pepijat cache yang mengosongkan sejarah pemikiran, dan gesaan sistem yang mengehadkan panjang keluaran — setiap satu menyentuh kepingan trafik yang berbeza pada jadualnya sendiri. Ketiga-tiganya diselesaikan dalam v2.1.116; had penggunaan ditetapkan semula bagi semua pelanggan pada 23 April. |
| Disahkan | Audit data awam seorang jurutera AMD, 3 April | Stella Laurenzo, pengarah kumpulan AI AMD, menganalisis 6,852 sesi Claude Code dan memfailkan isu GitHub — tiga minggu sebelum kenyataan Anthropic sendiri. |
| Disahkan tetapi tidak dapat disahkan di sini | Teori punca yang dikemukakan audit itu sendiri | Data Laurenzo mengaitkan kemerosotan itu dengan tetapan pertengahan Februari yang menyembunyikan pemikiran daripada antara muka. Kenyataan tiga punca Anthropic tidak menamakan tetapan ini, dan respons awam pertama Anthropic (7 April) berkata ia langsung tidak mengurangkan pemikiran. |
| Tidak disahkan | Bahawa punca sebenar ialah catuan pengkomputeran, bukan pertukaran yang dinyatakan | Dibangkitkan oleh sesetengah pengguna dan, secara berasingan, oleh seorang eksekutif saingan. Laporan pasca insiden Anthropic langsung tidak menyentuh pengkomputeran, walaupun kenyataan berasingan kepada Fortune mengakui permintaan telah menegangkan infrastruktur. |
Garis Masa
Garis Masa tiga belas peristiwa bertarikh sepanjang tiga bulan
- 02Opus 4.6 dilancarkan dalam Claude Code dengan daya pemikiran lalai pada
high. - 02-12Tetapan bernama
redact-thinking-2026-02-12menyembunyikan pemikiran daripada antara muka. Satu audit luar kemudian menamakannya sebagai punca yang mungkin; kenyataan Anthropic sendiri tidak pernah berbuat demikian. - 03-04Daya pemikiran lalai turun kepada
medium(masalah satu bermula). - 03-26Pepijat cache dilepaskan (masalah dua bermula).
- 04-03Stella Laurenzo, pengarah AI AMD, memfailkan isu GitHub yang menganalisis 6,852 sesi.
- 04-06The Register melaporkan isu itu.
- 04-07Masalah satu dibaiki; lalai kembali kepada
high(xhighbagi Opus 4.7). Boris Cherny dari Anthropic mempertikaikan teori Laurenzo secara terbuka. - 04-10Masalah dua dibaiki (v2.1.101).
- 04-16Gesaan sistem yang mengehadkan verbositi dilancarkan bersama Opus 4.7 (masalah tiga bermula).
- 04-20Masalah tiga dibaiki; ketiga-tiganya selesai (v2.1.116).
- 04-23Anthropic menerbitkan laporan pasca insiden dan menetapkan semula had penggunaan bagi semua pelanggan; Boris Cherny menghuraikan mekanisme cache di Hacker News pada hari yang sama.
- 04-24Fortune melaporkan tentangan pengguna, pembatalan langganan, dan kenyataan Anthropic yang menyebut ketegangan infrastruktur.
- 05-14InfoQ menerbitkan sintesis yang turut merangkumi kebimbangan yang dilaporkan di Reddit dan tidak disentuh oleh laporan pasca insiden itu.
Hujah
Satu Penjelasan, Dua Kenyataan dikaitkan dengan nama, dan dibiarkan terbuka apabila berbeza pendapat
Diagnosis Anthropic sendiri: setiap satu daripada tiga perubahan itu lulus semakannya sendiri secara berasingan — semakan manusia, ujian automatik, penilaian. Kegagalan itu terletak di antaranya: tiada proses yang bertanggungjawab bertanya apa kesan beberapa perubahan serentak apabila digabungkan, dan setiap satu menyentuh kepingan trafik yang berbeza pada jadual yang berbeza, jadi secara agregat ia kelihatan sebagai satu kemerosotan yang luas dan tidak konsisten, bukan tiga punca berasingan.
Apa yang merumitkannya: satu aduan bebas berasaskan data sampai ke pengetahuan umum tiga minggu sebelum kenyataan Anthropic sendiri, dan menamakan perubahan berbeza sebagai kaitan — satu yang tidak disebut dalam kenyataan tiga punca Anthropic, dan yang telah dibantah lebih awal oleh respons awam pertama Anthropic sendiri.
- 3 AprilStella Laurenzo memfailkan aduan berasaskan data yang menamakan perubahan pertengahan Februari.
- 23 AprilLaporan pasca insiden Anthropic sendiri menamakan tiga perubahan berbeza, tiada satu pun dari Februari.
| Sumber | Apa yang dinamakan sebagai punca |
|---|---|
| Anthropic, laporan pasca insiden 23 April | Tiga perubahan lapisan produk: lalai daya pemikiran direndahkan, pepijat cache, gesaan yang mengehadkan panjang keluaran — tiada sebutan pengkomputeran atau tetapan pertengahan Februari. |
| Anthropic, kenyataan kepada Fortune | Infrastruktur “tertekan” oleh pertumbuhan permintaan, secara umum — tidak dikaitkan dengan mana-mana satu daripada tiga pepijat yang dinamakan. |
| Stella Laurenzo, audit GitHub (3 Apr) | Tetapan redact-thinking-2026-02-12, yang menyembunyikan pemikiran daripada antara muka, berkait dengan peralihan terukur ke arah tingkah laku lebih cetek, sunting-dahulu. Dua laporan tentang audit itu berbeza tentang bila tetapan itu sampai ke Claude Code: TechRadar mengikut tarikh pada nama tetapan itu sendiri, The Register pula pada penggunaan awal Mac dengan v2.1.69. |
| Anthropic, respons awam pertama (7 Apr) | Tetapan yang sama hanya menyembunyikan pemikiran daripada UI dan tidak mengurangkan pemikiran; sebaliknya mengaitkannya dengan pemikiran adaptif Opus 4.6. |
Apa Yang Ditambah Orang Lain
Apa Yang Ditambah Orang Lain kedalaman daripada luar kenyataan Anthropic sendiri
- Di Hacker News, Boris Cherny dari pasukan Claude Code menghuraikan mekanisme yang hanya diringkaskan oleh blog Anthropic: biasanya semua mesej dalam satu perbualan kecuali yang terkini akan mengena cache gesaan, tetapi selepas terbiar sejam, mesej seterusnya menjadi kegagalan cache sepenuhnya, dan dalam kes melampau, sesi 900,000 token yang terbiar sejam boleh menulis lebih 900,000 token ke cache serentak — “peratusan ketara had penggunaan anda, terutamanya bagi pengguna Pro”. Menghapuskan pemikiran lama selepas tempoh terbiar adalah pembetulan yang dicuba Anthropic bagi kos itu, dan pelaksanaannya itulah yang memperkenalkan masalah dua.
- Respons awam pertama Anthropic terhadap audit AMD, dilaporkan oleh TechRadar pada 7 April, mempertikaikan puncanya dan bukan mengesahkannya: Boris Cherny berkata tetapan pertengahan Februari itu hanya menahan pemikiran daripada antara muka dan tidak menguranginya, serta menunjukkan pemikiran adaptif Opus 4.6 sebagai penambahbaikan berasingan. Laporan pasca insiden Anthropic pada 23 April tidak kembali kepada pertukaran ini atau menamakan tetapan pertengahan Februari itu langsung.
- Fortune melaporkan bahawa sesetengah pengguna menggambarkan diri mereka berasa “digaslight” oleh komunikasi Anthropic pada minggu-minggu sebelum 23 April, yang mereka tafsirkan sebagai penafian bahawa sebarang masalah wujud, dan sesetengah berkata mereka telah membatalkan langganan. Dalam kenyataan kepada Fortune, Anthropic menyebut permintaan telah “menegangkan” infrastrukturnya “terutamanya pada waktu puncak” — daftar penjelasan yang berbeza daripada tiga pepijat khusus dalam blog, menjawab soalan yang langsung tidak dibangkitkan oleh laporan pasca insiden itu sendiri.
- Dalam memo dalaman yang mula-mula dilaporkan CNBC dan dipetik oleh Fortune, ketua hasil OpenAI menggelar kegagalan Anthropic mendapatkan pengkomputeran yang mencukupi sebagai “kesilapan strategik”. Itu gambaran pesaing dalam memo bocor, bukan penemuan, dan laporan pasca insiden Anthropic sendiri tidak mengaitkan mana-mana satu daripada tiga pepijat yang dinamakan dengan pengkomputeran langsung.
- Liputan InfoQ menyampaikan kebimbangan daripada Reddit yang tidak disentuh oleh laporan pasca insiden itu: Claude Code boleh mewakilkan kerja kepada model Haiku yang lebih murah tanpa menjadikannya kelihatan kecuali dalam log terperinci — risiko yang menurut InfoQ paling sukar dikesan dalam saluran paip tanpa pengawasan, di mana kemerosotan kualiti hanya terserlah beberapa langkah kemudian, bukan pada saat ia berlaku.
Kesimpulan
Apa Yang Berubah Sekarang lima langkah susulan, daripada kenyataan Anthropic sendiri
- Menjadikan lebih ramai kakitangan dalaman menjalankan binaan awam Claude Code yang sama persis, bukan binaan ujian berasingan.
- Menjalankan suite penilaian meluas bagi setiap model pada setiap perubahan gesaan sistem, meneruskan analisis ablasi yang akhirnya menangkap masalah tiga.
- Membina perkakas yang memudahkan perubahan gesaan sistem disemak dan diaudit, dan menambah panduan dalam
CLAUDE.mdsupaya perubahan khusus model dikawal kepada model yang disasarkan sahaja. - Memberi sebarang perubahan yang mungkin mengorbankan kecerdasan satu tempoh rendaman, suite penilaian yang lebih luas dan pelancaran beransur-ansur, supaya isu dapat dikesan lebih awal.
- Meluaskan konteks repositori bagi perkakas Code Review-nya — perubahan yang membolehkan Opus 4.7 mengesan pull request bermasalah bagi masalah dua, sesuatu yang Opus 4.6 gagal lakukan — dan menggunakan @ClaudeDevs di X serta satu utas GitHub berpusat untuk menerangkan keputusan produk sebaik ia dibuat.
Pengajaran di sebaliknya, dan apa yang masih terbuka
Kenyataan Anthropic sendiri tentang kegagalan ini bersifat struktural: setiap perubahan lulus semakannya sendiri, dan tiada apa-apa yang bertanggungjawab menguji kesan beberapa perubahan serentak — dan itulah tepatnya yang disasarkan oleh langkah susulan yang paling bermakna. Dua perkara yang tidak diselesaikan oleh laporan pasca insiden itu: sama ada perubahan pertengahan Februari yang ditunjukkan oleh audit luar benar-benar memainkan peranan dalam kemerosotan itu, dan sama ada pewakilan senyap Claude Code kepada model yang lebih kecil merupakan risiko yang setanding. Kedua-duanya dikaitkan dengan sumber bernama dan dibiarkan terbuka di sini, tidak digabungkan ke dalam tiga punca yang dinamakan Anthropic.