Apa Itu
Istilah · Pengesahan sumber · Kejuruteraan LLM · Model bahasa · AI · PeneranganTratopedia · 15 Ogos 2026
Ketiga daripada lima · lapisan paling luar
Dicipta untuk sebuah fail teks. Sebulan kemudian ia bermaksud segalanya.
Pada 5 Februari 2026 Mitchell Hashimoto memerlukan satu nama bagi sebuah tabiat — membetulkan persekitaran ejen setiap kali ia tersilap — dan, kerana tidak menemui satu pun, dia menamakannya kejuruteraan harness. Apa yang dimaksudkannya ialah sebuah fail arahan dan beberapa skrip. Tiga puluh tiga hari kemudian, Vivek Trivedy melekatkan frasa yang sama kepada segala yang bukan model: sistem fail, sandbox, lapisan orkestrasi, hooks. Itulah maksud yang dibawa oleh ensiklopedia hari ini. Dua orang lelaki membuat dua sumbangan yang berbeza — seorang namanya, seorang lagi takrifnya — dan sejak itu kesusasteraan bidang ini berbalah tentang siapa antara mereka yang menciptanya. Sementara itu, amalannya sendiri sudah pun diterbitkan sepenuhnya berbulan-bulan sebelum kedua-duanya.
Penciptaan istilah itu, dan takrif semula yang menelannya Berselang tiga puluh tiga hari. Segala yang selepas yang kedua itu hanya mengulanginya.
- 33hari dari frasa itu dicipta untuk sebuah tabiat sehingga ia bermaksud segala yang mengelilingi model
- 2sumbangan berasingan — satu namanya, satu lagi takrifnya — disalah anggap sebagai satu pertikaian tentang kredit
- 1perbandingan ditemui yang mengekalkan model dan hanya menukar harness
- 0sumber yang mendamaikan satu-satunya perselisihan yang tinggal: sama ada ini mengandungi kejuruteraan konteks atau berada di dalamnya
Mitchell Hashimoto · 5 Feb 2026
“Saya semakin memanggilnya kejuruteraan harness”
- Keseluruhannya: setiap kali anda mendapati seorang ejen melakukan kesilapan, anda mengambil masa untuk merekayasa satu penyelesaian supaya ejen itu tidak akan melakukan kesilapan itu lagi.
- Ia hadir dalam dua bentuk, dan itulah keseluruhan skopnya: sebuah
AGENTS.mdyang setiap barisnya berdasarkan satu kelakuan buruk ejen, dan “alatan sebenar yang diprogramkan” — skrip untuk tangkapan skrin dan ujian yang ditapis. Tiada sandbox, tiada orkestrasi, tiada substrat masa jalan. - Dia keberatan tentangnya: saya tidak perlu mencipta apa-apa istilah baharu di sini; jika ada yang lain, saya akan ikut sahaja. Tiada siapa memberitahunya bahawa satu akan tiba dalam lima minggu dan membawa perkataan itu bersamanya.
Vivek Trivedy · LangChain · 10 Mac 2026
Ejen = Model + Harness
- Huraiannya: jika anda bukan model, anda ialah harness. Setiap kepingan kod, konfigurasi dan logik pelaksanaan yang bukan model itu sendiri — sistem fail, sandbox, pelayar, orkestrasi, hooks.
- Dia berhati-hati menyatakan bahawa ini satu pilihan, bukan satu fakta: ada banyak cara yang bersepah untuk membahagikan sempadannya… tetapi pada pendapat saya inilah yang paling kemas.
- Setiap takrif selepas yang ini mengulanginya, dan tiada satu pun mengulangi takrif Hashimoto. Seluruh peralihan itu berlaku dalam 33 hari tersebut.
Wikipedia · suntingan terakhir 13 Ogos 2026
“Infrastruktur perisian yang mengelilingi sesebuah model”
- Selengkapnya: apa yang “menguruskan penggunaan alatan, ingatan, kekekalan keadaan, persekitaran pelaksanaan dan gelung maklum balas, berbanding penaakulan model itu sendiri.”
- Kejuruteraan konteks, yang lebih setahun lebih tua, masih tiada artikelnya sendiri — ia hanyalah satu perenggan di dalam entri lain.
- Ia juga tersalah tarikh salah satu sumbernya sendiri sebanyak setahun. Lihat bahagian tiga.
Zhong & Zhu · arXiv · 13 Mei 2026
“Sebuah substrat masa jalan”
- Langkah pembuka mereka: penjelasan yang dominan meletakkan jurang ini pada keupayaan model. Kami mencadangkan satu lokus yang berbeza.
- Sebelas tanggungjawab komponen dan satu tangga empat aras, H0 hingga H3. Tiga daripada sebelas itu — penentuan punca kegagalan, pengauditan entropi, perakaman campur tangan — wujud untuk menilai sesuatu larian selepas ia berlaku, bukan untuk membuatnya berjaya.
- Hanya abstraknya sahaja dibaca di sini, jadi tiada apa-apa di halaman ini melaporkan sebarang keputusan daripada kertas itu.
Sekukuh mana setiap satu daripadanya? Apa yang dibaca, apa yang masih tiada, dan apa yang tersilap pada halaman ini kali pertama.
| Sekukuh mana | Apa | Berdasarkan apa |
|---|---|---|
| Dibaca di sumbernya | Ejen = Model + Harness, dan “jika anda bukan model, anda ialah harness” | Vivek Trivedy, LangChain, 10 Mac 2026, diambil di sumbernya |
| Dibaca di sumbernya | Opus 4.6 dalam Claude Code memperoleh markah jauh lebih rendah daripada Opus 4.6 dalam harness lain pada Terminal Bench 2.0 | Catatan yang sama. Papan pendahulunya sendiri tidak dibaca, dan “jauh lebih rendah” bukan satu angka |
| Dibekalkan, bukan diambil | Amalan itu sepenuhnya — ejen pemula dan ejen pengekodan, satu JSON dengan lebih 200 ciri, satu fail kemajuan, init.sh — diterbitkan pada 26 Nov 2025 | Anthropic, ditulis oleh Justin Young. PDF dibekalkan oleh djTratoh; anthropic.com memulangkan 403 kepada sesi ini |
| Dibekalkan, bukan diambil | “Harness Codex” digunakan sebagai kata nama yang mantap dan tanpa huraian pada 4 Feb 2026 | OpenAI, Celia Chen. PDF dibekalkan oleh djTratoh; openai.com memulangkan 403 |
| Dibaca di sumbernya | Panduan dan penderia; komputasi dan inferens; harness dalaman dan luaran — dan bahawa harness pengguna ialah satu bentuk kejuruteraan konteks | Birgitta Böckeler, Thoughtworks, martinfowler.com, 2 Apr 2026 |
| Dibekalkan, bukan diambil | Hashimoto mencipta frasa itu pada 5 Februari 2026, sambil menyatakan bahawa dia tidak tahu adanya istilah yang diterima umum — 33 hari sebelum takrif yang digunakan semua orang kini | “My AI Adoption Journey”, mitchellh.com. PDF dibekalkan oleh djTratoh. Kredit mutlak Osmani kepada Trivedy tersasar pada tarikhnya |
| Dibetulkan | Halaman ini sebelum ini menyatakan bahawa catatan Trivedy memulangkan 404 dan membuat kesimpulan daripadanya. Ia tidak pernah berbuat demikian. | URL yang dicuba itu diteka oleh projek ini, bukan diambil daripada mana-mana sumber. Catatan itu berada di langchain.com/blog/… sepanjang masa |
| Dibetulkan | Dua baris telah dikreditkan di sini kepada Addy Osmani. “Jika anda bukan model, anda ialah harness” ialah milik Trivedy; peraturan ratchet itu milik Hashimoto | Osmani memperkenalkan yang pertama sebagai “ayat sebaris Viv” dan yang kedua dengan “Secara kasarnya:”. Tulisannya ialah satu rumusan, dan projek ini membacanya sebagai satu sumber |
| Bacaan halaman ini | Bahawa kerja itu diterbitkan sebelum perkataannya, dan perkataan itu sebelum ensiklopedianya, kesemuanya dalam tempoh sembilan bulan | Disusun daripada dokumen yang bertarikh. Tiada sumber yang dirujuk menyatakan hal ini |
Garis Masa
Amalannya dahulu, kemudian perkataannya, kemudian ensiklopedianya Sembilan bulan daripada satu kaedah lengkap yang diterbitkan kepada satu entri Wikipedia.
- Okt 2022Gelung itu, sebagai satu kertas. Yao dan rakan-rakannya menerbitkan ReAct, yang membuatkan sesebuah model berselang-seli antara menaakul dan bertindak. Setiap harness sejak itu menjalankan kitaran tersebut: model menaakul, harness bertindak dan merakam apa yang berlaku, model membaca hasilnya.
- Feb 2023Alatan, sebagai satu kertas. Toolformer menunjukkan bahawa sesebuah model boleh mengajar dirinya sendiri memanggil alatan luaran. Wikipedia menamakannya, bersama ReAct, sebagai mekanisme yang wujud sebelum istilah itu.
- Dis 2024Ideanya, tanpa perkataannya. Anthropic berhujah bahawa antara muka ejen–komputer berhak mendapat pelaburan sebanyak antara muka manusia–komputer, dan bahawa takrifan sesuatu alat patut dibentuk supaya model tidak mudah menggunakannya dengan salah.
- 26 Nov 2025Keseluruhan amalan itu, diterbitkan. Justin Young dari Anthropic menulis tentang harness ejen jangka panjang: satu ejen pemula yang meletakkan
init.sh, satu fail kemajuan dan satu commit pertama; satu ejen pengekodan yang menyiapkan satu ciri setiap sesi dan meninggalkan repositori dalam keadaan bersih. Senarai cirinya dalam JSON dan bukan Markdown kerana model kurang berkemungkinan menulis gantinya. Perkataan “harness” muncul di seluruh tulisan itu sebagai kata nama biasa. Belum ada sesiapa menamakan disiplin ini. - 23 Jan 2026Kata nama itu sudah pun biasa di sebuah makmal kedua — dan ia tidak memerlukan pembelaan. Michael Bolin dari OpenAI, ketika menulis tentang cara gelung ejen Codex berfungsi, menawarkan perkataan itu secara sambil lalu: kami berharap catatan ini memberikan anda gambaran yang baik tentang peranan yang dimainkan oleh ejen kami (atau “harness”) dalam menggunakan sesebuah LLM. Satu kurungan, sebagai nama yang lebih bersahaja antara dua nama bagi perkara yang sama — dua minggu sebelum sesiapa pun menamakan disiplin ini.
- 4 Feb 2026Dan menjelang kini, tiada huraian langsung. Celia Chen dari OpenAI menulis bahawa aplikasi web, CLI, sambungan IDE dan aplikasi macOS itu “kesemuanya dikuasakan oleh harness Codex yang sama—gelung dan logik ejen yang mendasari semua pengalaman Codex.” Kurungan itu sudah tiada. Ia sekadar perkataan bagi benda itu.
- 5 Feb 2026Frasa itu dicipta, sehari kemudian, oleh seseorang yang tidak mahu menciptanya. Mitchell Hashimoto, ketika menulis tentang penerimaannya sendiri terhadap perkakas AI, sampai ke langkah kelima — Engineer the Harness — dan memerlukan satu perkataan: saya tidak tahu sama ada sudah ada istilah yang diterima luas oleh industri untuk perkara ini, tetapi saya semakin memanggilnya “kejuruteraan harness”. Dia menambah: saya tidak perlu mencipta apa-apa istilah baharu di sini; jika ada yang lain, saya akan ikut sahaja. Apa yang dimaksudkannya ialah sebuah
AGENTS.mddan beberapa skrip — setiap baris dalam fail itu diperoleh daripada satu kelakuan buruk ejen yang benar-benar pernah dilihatnya. - 10 Mac 2026Perkataan itu diambil, dan dibesarkan sehingga sangat luas. Vivek Trivedy dari LangChain menerbitkan The Anatomy of an Agent Harness, mentakrifkan Ejen = Model + Harness, dan menerbitkan setiap komponen secara terbalik daripada satu kelakuan: sistem fail untuk keadaan yang kekal, bash untuk autonomi tanpa alatan siap bina, sandbox untuk tempat yang selamat bagi bertindak. Tiga puluh tiga hari selepas penciptaan istilah itu, frasa yang sama kini merangkumi segala yang bukan model. Inilah catatan yang dipetik oleh setiap sumber terkemudian, dan takrif yang tidak diubah oleh mana-mana daripadanya.
- 2 Apr 2026Pihak pengguna mendapat bentuknya. Birgitta Böckeler dari Thoughtworks membahagikan harness kepada panduan yang mengemudi sebelum ejen bertindak dan penderia yang memerhati selepasnya, setiap satu sama ada komputasi atau inferens. Dalam satu ruangan tepi, dia menulis ayat yang meletakkannya bertentangan dengan orang lain: harness pengguna ialah satu bentuk khusus kejuruteraan konteks.
- 13 Mei 2026Ia menjadi satu program penyelidikan. Hailin Zhong dan Shengxin Zhu menyiarkan satu pemformalan enam belas halaman ke arXiv: sebelas tanggungjawab komponen, satu tangga empat aras daripada H0 hingga H3, dan satu cadangan untuk menilai larian seorang ejen berdasarkan bukti yang ditinggalkannya dan bukan berdasarkan sama ada satu tampung muncul.
- 15 Mei 2026Amalan itu mendapat peraturan sebarisnya. Addy Osmani, di O'Reilly Radar: setiap kali anda mendapati seorang ejen melakukan kesilapan, anda mengambil masa untuk merekayasa satu penyelesaian supaya ejen itu tidak akan melakukan kesilapan itu lagi. Dia mengkreditkan penciptaan istilah itu kepada Trivedy.
- 17 Jun 2026Sebuah vendor melukis sempadannya. Databricks menerbitkan satu penerangan dengan lapan blok binaan, tujuh mod kegagalan, dan satu jadual yang meletakkan ketiga-tiga disiplin itu dalam satu hierarki: kejuruteraan prompt dan kejuruteraan konteks kedua-duanya berada di dalam kejuruteraan harness.
- 13 Ogos 2026Ensiklopedia itu mengejar ketinggalan — lima bulan selepas penamaannya. Artikel Agent harness di Wikipedia disunting kali terakhir, dengan satu bahagian yang mengakui bahawa tiada sesiapa pasti siapa yang menamakannya, dan satu petikan yang memberikan tarikh 2026 kepada catatan Anthropic pada November 2025.
Hujah
Siapa yang menamakannya, dan satu perselisihan yang masih terbuka Persoalan kredit itu ada jawapannya. Persoalan sempadan itu tidak.
Perkara pertama yang perlu dinyatakan ialah apa yang tidak dipertikaikan, kerana ia luar biasa bagi siri ini. Takrif Trivedy pada bulan Mac digunakan tanpa perubahan oleh Wikipedia, oleh Databricks, oleh awesome list itu, dan oleh Osmani. Tiga senarai komponen yang disusun secara bebas — lapan butiran, sebelas, dua belas — berbeza pada halusnya potongan masing-masing dan tidak bercanggah antara satu sama lain di mana-mana. Selepas dua artikel tentang perkataan yang bermaksud perkara berbeza kepada orang berbeza, yang ini stabil.
Yang dipertikaikan ialah sempadannya. Databricks menyatakannya secara terang-terangan: kejuruteraan prompt dan kejuruteraan konteks kedua-duanya berada di dalam kejuruteraan harness. Harness ialah sistem di sekeliling model; prompt dan konteks ialah sebahagian daripada sistem itu. Wikipedia bersetuju, dengan menyatakan bahawa harness “mereka bentuk keseluruhan persekitaran operasi dan mengandungi dua yang lain sebagai bahagiannya”. Böckeler, dalam satu ruangan tepi yang berkepalakan persoalan ini juga, menyatakan yang sebaliknya: merekayasa harness pengguna bagi sebuah ejen pengekodan ialah satu bentuk khusus kejuruteraan konteks. Dua perkataan yang sama, susunan bersarang yang bertentangan.
Ini bukan kes satu sumber yang terlepas pandang sumber lain. Wikipedia memetik Böckeler sebanyak enam kali — dialah rujukan yang paling banyak digunakannya — dan ia tetap menyatakan susunan bersarang yang ditolak olehnya. Ada satu pendamaian yang munasabah: dia menulis secara khusus tentang ejen pengekodan, di mana harness dalaman datang bersama alat itu dan satu-satunya harness yang dibina oleh seorang pengguna disusun daripada fail arahan dan konteks. Menurut bacaan itu, kedua-duanya memerihalkan skop yang berbeza dan kedua-duanya betul. Tetapi tiada sumber yang menyatakannya, dan halaman ini tidak akan mencipta kata sepakat yang tidak diterbitkan sesiapa.
Perkara kedua yang wajar dinyatakan ialah tentang jejak dokumen itu sendiri. Petikan Wikipedia bagi catatan Anthropic tentang harness memberikan tarikh 2026 kepadanya. Dokumen itu menyatakan 26 November 2025. Itu bukan tersasar sedikit: seluruh minat terhadap catatan itu terletak pada hakikat bahawa ia mendahului penamaan tersebut, dan satu petikan yang meletakkannya pada 2026 memadamkan tepat-tepat fakta yang menjadikannya berbaloi dibaca.
Halaman ini melakukan kesilapan yang lebih teruk pada arah yang sama, dan ia dibetulkan di atas dan bukannya digugurkan secara senyap. Versi pertama melaporkan bahawa catatan Trivedy — dokumen pengasas itu — memulangkan 404, dan membuat kesimpulan daripadanya: bahawa sebuah disiplin yang berteraskan persekitaran yang terpelihara telah membiarkan rekodnya sendiri reput. Ia satu ayat yang bagus dan ia palsu. URL yang memulangkan 404 itu telah diteka oleh projek ini dan bukannya diambil daripada mana-mana sumber; catatan itu berada di tempat ia sentiasa berada. Keputusan negatif tentang satu URL yang anda bina sendiri ialah keputusan tentang tekaan anda, bukan tentang dunia. Tabiat yang sama — membaca rumusan sebelum sumbernya — ialah sebabnya ayat Trivedy yang paling terkenal dikreditkan di sini kepada orang yang memetiknya.
Tentang siapa yang menamakannya, jawapannya ternyata jelas sebaik sahaja anda membaca kedua-dua catatan itu. Wikipedia menyebut kreditnya sebagai dipertikaikan dan Osmani memberikannya kepada Trivedy secara terus, tetapi catatan Hashimoto bertarikh 5 Februari 2026 dan menyatakan, dengan kata-katanya sendiri, saya tidak tahu sama ada sudah ada istilah yang diterima luas oleh industri untuk perkara ini, tetapi saya semakin memanggilnya “kejuruteraan harness”. Itu satu penciptaan istilah, dan satu yang berat hati — dia menambah bahawa dia lebih rela menerima pakai perkataan sedia ada jika ada yang muncul. Catatan Trivedy pula 10 Mac, tiga puluh tiga hari kemudian.
Jadi kedua-dua lelaki itu membuat dua sumbangan yang berbeza, dan kesusasteraan bidang ini meruntuhkannya menjadi satu pertikaian tentang kredit. Hashimoto memberikan namanya. Trivedy memberikan takrifnya — dan alangkah takrifnya: satu perkataan yang dicipta untuk mengemaskan sebuah fail arahan kini merangkumi sistem fail, sandbox, lapisan orkestrasi dan hooks. Setiap sumber terkemudian menggunakan maksud Trivedy. Tiada satu pun menggunakan maksud Hashimoto, yang bertahan sebagai satu butiran baris tunggal di dalam benda yang mengambil namanya.
Apa Yang Ditambah Orang Lain
Apa yang sebenarnya anda bina Böckeler memberikan bentuknya; Anthropic memberikan contoh terkerjanya.
- 1Letakkan panduan di hadapan ejenKawalan suap depan: fail arahan, skills, ubah suai kod, satu skrip permulaan. Ia menjangka kelakuan yang anda tidak mahukan dan mengemudi sebelum ejen bertindak. Sebuah harness yang hanya mempunyai ini tidak pernah mengetahui sama ada peraturannya berkesan.
- 2Letakkan penderia di belakangnyaKawalan maklum balas: ujian, linter, penyemak jenis, satu ejen penyemak. Hujah Böckeler yang paling tajam ialah bahawa sesuatu penderia patut menulis untuk pembacanya — mesej linter yang memberitahu model cara membetulkan sesuatu ialah satu bentuk suntikan prompt yang positif. Sebuah harness yang hanya mempunyai ini akan mengulangi kesilapannya.
- 3Ketahui yang mana antara dua jenis itu sedang anda gunakanKawalan komputasi bersifat deterministik dan pantas — ujian, linter, analisis struktur, milisaat hingga saat, boleh dipercayai. Kawalan inferens pula bersifat semantik — semakan AI, “LLM sebagai hakim” — lebih perlahan, lebih mahal dan tidak deterministik. Penderia komputasi yang murah boleh dijalankan pada setiap perubahan; yang inferens perlu membuktikan kelayakan tempatnya.
- 4Tuliskan keadaan itu di tempat yang tidak akan dimakan oleh modelContoh terkerja Anthropic ialah nasihat paling konkrit yang ditemui di mana-mana: satu senarai ciri dengan lebih 200 perihal hujung ke hujung, kesemuanya bermula dalam keadaan gagal, yang hanya boleh disunting oleh ejen dengan menukar satu medan
passes. Ia dalam JSON dan bukan Markdown kerana model secara terukur kurang berkemungkinan menulis ganti JSON. Tambahan pula satu fail kemajuan dan satu commit git pada penghujung setiap sesi. - 5Kunci setiap kesilapan menjadi satu peraturanPeraturan Hashimoto — ayat yang menjadi sebab istilah itu dicipta, dan perkara yang paling hampir dengan sebuah kaedah dalam bidang ini: anggap kesilapan sebagai isyarat kekal, bukan larian buruk yang perlu dicuba semula. Setiap satu memperoleh satu baris dalam fail arahan, satu semakan dalam hook pra-commit, satu penanda dalam ejen penyemak. Anda hanya menambah satu kekangan setelah anda melihat satu kegagalan yang sebenar — yang menghalang harness itu daripada menumbuhkan peraturan yang tidak diperlukan sesiapa.
Adakah mana-mana daripadanya berkesan? Buktinya, dinilai Dua daripadanya mengekalkan model itu tidak berubah. Satu tidak.
| Dakwaan | Cara ia diukur | Nilainya |
|---|---|---|
| Terminal Bench 2.0 | Opus 4.6 dalam Claude Code memperoleh markah jauh lebih rendah daripada Opus 4.6 dalam harness lain. Model yang sama, harness yang berbeza | Bentuk yang betul. Pemboleh ubah yang diuji itulah satu-satunya yang berubah, dan papan pendahulu itu bukan milik mana-mana pihak. Dilaporkan oleh LangChain, yang menjual sebuah pustaka harness — tetapi papan itu bukan milik mereka, dan “jauh lebih rendah” bukan satu angka yang dapat disemak oleh halaman ini |
| Top 30 → Top 5 | LangChain menaikkan ejen pengekodannya sendiri pada papan pendahulu yang sama “dengan hanya menukar harness” | Bentuk yang sama, dilaporkan sendiri. Papan pendahulu awam menjadikannya boleh disemak pada dasarnya, dan itu lebih daripada apa yang dicapai oleh kebanyakan dakwaan di sini |
| OfficeQA Pro | 52.63% dengan GPT-5.5 dan harness itu, “naik daripada 36.10% dengan GPT-5.4” | Ia tidak mengasingkan harness — modelnya berubah dalam langkah yang sama. Dan “mengurangkan ralat hampir separuh” tidak menyusul: 63.90% kepada 47.37% ialah kira-kira satu perempat |
Perbandingan pada baris pertama itulah yang penting, dan wajar kita tepat tentang sebabnya. Setiap sumber dalam artikel ini mendakwa bahawa harness itu sama pentingnya dengan model atau lebih; kebanyakannya sedang menjual sesuatu. Dakwaan daripada pihak yang berkepentingan ialah bukti yang lemah. Perbandingan yang mengekalkan model dan hanya mengubah harness bukanlah satu dakwaan langsung — ia ialah eksperimen yang dituntut oleh dakwaan itu, dan Terminal Bench 2.0 ialah papan awam dan bukan papan dalaman. Hakikat bahawa pihak yang melaporkannya turut menjual sebuah pustaka harness tidak menjadikan reka bentuk itu salah; ia bermakna angka itu sepatutnya dibaca daripada papan pendahulu dan bukan daripada blog, dan itu belum dilakukan oleh halaman ini.
Diletakkan di sebelahnya, angka Databricks ialah bentuk bukti dan bukan bukti. Ia menaik taraf model dalam langkah yang sama dengan harness, jadi tiada apa-apa di dalamnya yang memisahkan dua sumbangan itu — dan kesimpulannya sendiri yang dinyatakan melebih-lebihkan angkanya sendiri. Vendor yang paling kuat berhujah bahawa harness itu penting mempunyai pengukuran yang lebih lemah antara kedua-duanya.
Namun perkara yang paling menarik dalam bahan ini ialah satu hujah menentang bidang itu, yang dibuat oleh orang yang mentakrifkannya. Bahagian penutup Trivedy menyatakan dengan terus terang bahawa apabila model menjadi lebih baik dalam perancangan, pengesahan diri dan keterpaduan jangka panjang, kerja yang kini dilakukan oleh harness akan diserap ke dalam model — “itu mencadangkan bahawa harness sepatutnya kurang penting dari semasa ke semasa”. Dia berpendapat disiplin ini bertahan juga, atas alasan yang sama seperti kejuruteraan prompt dahulu. Tetapi dia menyebut bahagian yang biasanya didiamkan, dan tiada satu pun sumber yang mengulangi takrifnya turut mengulanginya.
Dia juga menamakan satu masalah yang cenderung dilangkau oleh keghairahan ini. Ejen pengekodan kini dilatih pasca dengan harness masing-masing berada dalam gelung, jadi model “menjadi lebih berkemampuan di dalam harness tempat ia dilatih” — dan menukar logik sesuatu alat boleh menjadikan model lebih lemah dalam menggunakannya. Dia menamakannya sebagai pemadanan berlebihan, dan dia betul: model yang benar-benar pintar sepatutnya tidak sukar bertukar antara kaedah tampung. Ini bermakna sebahagian daripada apa yang dibeli oleh sebuah harness bukanlah keupayaan umum tetapi kesesuaian dengan satu larian latihan.
Kesimpulan
Apa yang perlu diambil daripada ini Lima perkara, mengikut susunan kepentingannya.
Sesebuah perkataan boleh bertukar saiz lebih cepat daripada ia bertukar makna
Hashimoto mencipta “kejuruteraan harness” pada 5 Februari 2026 bagi sebuah tabiat dengan dua alat: sebuah fail arahan, dan beberapa skrip. Trivedy mengambil frasa yang sama pada 10 Mac dan melekatkannya kepada segala yang bukan model. Tiada sesiapa mempertikaikan mana-mana daripadanya; yang kedua hanya menggantikan yang pertama. Skop kejuruteraan prompt menyempit, skop kejuruteraan konteks terbalik, dan yang ini membengkak — tiga perkataan, tiga cara berbeza untuk tidak lagi bermaksud apa yang dahulunya dimaksudkan.
Satu perbandingan bernilai empat dakwaan
Empat sumber mengatakan harness itu sama pentingnya dengan model; keempat-empatnya ada sesuatu untuk dijual. Satu perbandingan meletakkan model yang sama dalam harness yang berbeza dan mendapati jurang yang besar pada satu papan pendahulu yang bukan milik mana-mana pihak. Perbandingan itulah sebab untuk memandang bidang ini dengan serius, dan ia lebih bernilai daripada kesemua dakwaan itu digabungkan — termasuk penanda aras vendor yang menukar model dalam langkah yang sama dan kemudian melebih-lebihkan aritmetiknya sendiri.
Kerjanya datang dahulu, dengan jarak yang selesa
Anthropic menerbitkan sebuah harness ejen jangka panjang yang lengkap — ejen pemula, senarai ciri, fail kemajuan, disiplin keadaan bersih — pada 26 November 2025, tiga setengah bulan sebelum sesiapa pun menamakan disiplin itu. OpenAI sudah pun menggunakan “harness Codex” sebagai perbendaharaan kata biasa menjelang 4 Februari 2026. Nama itu tidak mencipta amalannya; ia mengejarnya.
Tanya susunan bersarang yang mana dimaksudkan oleh seseorang
Takrifnya sudah muktamad; sempadannya belum. Databricks dan Wikipedia meletakkan kejuruteraan prompt dan kejuruteraan konteks di dalam kejuruteraan harness. Böckeler — yang dipetik oleh Wikipedia lebih daripada mana-mana sumber lain — mengatakan bahawa harness pengguna ialah satu bentuk kejuruteraan konteks. Kedua-dua bacaan itu tersiar, tiada satu pun didamaikan, dan sesuatu dakwaan tentang skop bermaksud perkara yang berbeza di bawah setiap satunya.
Baca sumbernya, bukan rumusan tentangnya
Empat perkara di halaman ini telah dibetulkan, dan tiga daripadanya berpunca daripada satu sebab: satu rumusan yang tersusun baik dibaca sebelum dokumen yang dirumuskannya, dan petikan di dalamnya disangka sebagai dakwaannya sendiri. Itu menghasilkan dua ayat yang tersalah kredit dan satu kredit berulang yang bercanggah dengan tarikhnya. Wikipedia pula tersalah tarikh pendahulu terpenting bidang ini sebanyak setahun. Setiap satu daripadanya ialah jenis kesilapan yang akan ditangkap serta-merta oleh pembaca yang membuka satu sumber primer sahaja.