事實
AI 人工智慧 · LLM 工程 · 主題Tratopedia · v0002 · 2026 年 8 月 23 日
常設主題 · 五個名詞、一條不斷外移的界線,以及一次真的量到數字的事故
LLM 工程
LLM 工程指的是在語言模型外圍把系統做出來,而不是把模型訓練出來。它有五個名字。提示工程在 2023 年就已經是辭典詞條;其餘四個 —— 情境工程、機具工程、迴圈工程、圖結構工程 —— 全部出現在 2025 年 6 月到 2026 年 7 月之間,前後 380 天。業界把它們講成一座階梯,每一層包住前一層。本站為這五個詞各做了一次獨立查證,結果並不支持這個說法。這五個詞沒有任何兩個是往同一個方向走的:一個縮小,一個反轉,一個膨脹,一個從頭到尾沒有收斂,還有一個在相隔兩週之內被兩批彼此似乎並不知情的人各命名了一次。而在本專案能夠查到日期的每一個案例裡 —— 四比四 —— 做法都比名字先出現,早了 71 到 182 天。這四次命名沒有一次發生在經同儕審查的場合。更沒有任何一份材料量測過:哪一層真的比下面那一層好用。在這五場關於名字的爭執底下,真正有共識的是做法本身 —— 而它幾乎沒有動過。有一次線上事故確實留下了數字,而那些數字並不是階梯模型預測的那種:2026 年 3 月到 4 月的 47 天裡,一個推理預設值、一個清除脈絡的錯誤、一條系統提示規則同時讓同一個產品變差 —— 而每一項都各自通過了審查,沒有任何一道流程負責問「這三件事加在一起會怎樣」。
五個詞,以及它們各自往哪裡去 每一個都有自己的專文;這裡是把它們並排之後看見的東西
- 5個名詞,而且沒有任何兩個是往同一個方向走的
- 380天 —— 從第一個可考的命名到最後一個
- 4 / 4次「做法先於名字」,四比四
- 0 / 4可考的命名出自經同儕審查的場合
- 3 / 5層 —— 唯一留下量測數字的那次事故牽涉其中三層
- 3%—— 一條系統提示規則的代價,出自消融分析,是唯一量到的數字
提示工程 Prompt Engineering
它一路縮小
- 先是選任務,然後是用例子教,再來是塑造思考過程
- 接著變成一種職稱 —— 然後變成上一層裡面的一個零件
- 消失的是職稱。措辭敏感度從來沒有被解決過
情境工程 Context Engineering
它整個反轉
- 命名時的說法是「提供全部的脈絡」
- 定型時的說法是「盡可能最小的一組 token」
- 從「夠不夠」變成「省不省」,從一件事一次變成一步一次
機具工程 Harness Engineering
它急速膨脹
- 命名時指的是一個習慣:一份指示檔,加上幾支腳本
- 三十三天後:
Agent = Model + Harness - 「你只要不是模型,你就是機具」
迴圈工程 Loop Engineering
它從頭到尾沒有收斂
- 把這個詞帶起來的那兩個人,誰都沒有定義過它
- 六種說法,講的是五種不同的東西 —— 一個人、一個目標、一支程式、兩台機器、一個組織
- 有一家廠商在自家文件裡直接承認:沒有人對「迴圈是什麼」有共識
圖結構工程 Graph Engineering
它被命名了兩次
- 引註嚴謹的長文沒有人看。十二個字的玩笑得到 310 萬次瀏覽
- 1 月的一份綜述早就替這套做法取好名字了:flow engineering
- 它的技術內容是五個詞裡爭議最少的
這些說法各自站得多穩 本頁每一項主張的分級 —— 依可信度排序,不混在一起
| 分級 | 主張內容 | 出處 |
|---|---|---|
| 已確認 | 四次命名的日期:2025 年 6 月 19 日、2026 年 2 月 5 日、2026 年 6 月 2 至 7 日、2026 年 7 月 4 日 | 各自讀自原始出處;兩則 X 貼文的時間戳為本頁重新從貼文 ID 推算 |
| 已確認 | 四段位移:反轉 102 天、膨脹 33 天、分裂 29 天、兩次命名相隔 14 天 | 由本主題查證檔中有日期的文件重新計算,並非自專文抄錄 |
| 已確認 | 2026 年 1 月的一份綜述早已把圖結構這套做法稱為 flow engineering | arXiv:2601.12560 第 5.1 節,全文讀畢。造出「圖結構工程」的那篇文章,引用了同一份論文,但引的是別的內容 |
| 已確認 | 維基百科有 agent harness 的條目,沒有 context engineering 的條目 | 兩者皆於 2026 年 8 月 15 日查核,後者回傳 HTTP 404。迴圈工程與圖結構工程未查核 |
| 已確認,但本站無法核對 | Cherny 那句「我的工作是寫迴圈」—— 最常被當成迴圈工程起點的一句話 | 2026 年 6 月 2 日在一場活動上說出,本專案只透過第三方的整理文章讀到。從未聽過原始出處 |
| 已確認,但本站無法核對 | Anthropic 的兩則定義 —— 增強型 LLM,以及「盡可能最小的一組 token」 | anthropic.com 拒絕本工作階段;文字由 djTratoh 提供,摘要存於 input/summary/ |
| 未確認 | 「提示工程」這個說法最早由誰、在何時說出 | 從未確立。因此它被排除在「四比四」與「380 天」之外,而不是被當成符合 |
| 本站的推論 | 每一個名字出現的時機,都是某一個工作單位不再是人所能掌握的那個單位的時候 | 跨五份紀錄得出的推論。沒有任何來源這樣說,凡出現處皆標示為推論 |
| 本站的推論 | 「做法先於名字」出現四次,構成一個規律而非巧合 | 四個案例,未發現反例。四個並不算多,本頁如實說明 |
| 無法取得 | 那篇宣告迴圈工程已死的 X 文章,其內文 | 鎖在 X Premium 之後。只取得標題、署名與時間戳 —— 本頁不對其內容作任何描述 |
| 已確認 | 同一個產品在 2026 年 3 月 4 日至 4 月 20 日之間同時出現三項退化,以及第三項在消融分析下約 3% 的代價 | 廠商自己發布的事後報告,本站於 2026 年 4 月 24 日報導 |
時序
這套詞彙是怎麼來的 機制屬於 2018 至 2022 年;名字屬於 2025 至 2026 年;中間幾乎是空的
- 2018decaNLP 把十項任務改寫成「對一段脈絡提問」。此時提示詞是用來選任務的
- 2020GPT-3:1750 億參數,少樣本有時可與微調相比。此時提示詞裡帶著範例
- 2022 年 1 月思維鏈:八個範例勝過附驗證器的微調模型。此時提示詞塑造的是過程 —— 比 ChatGPT 早十個月
- 2022 年 10 月ReAct:推理、行動、觀察。內層迴圈以論文形式存在,比「迴圈工程」這個名字早四年
- 2024 年 12 月 19 日Anthropic 發表增強型 LLM —— 檢索、工具、記憶。這就是情境工程,比它有名字早六個月
- 2025 年 6 月 19 日情境工程被命名,在 X 上,說法是「提供全部的脈絡」。距做法發表182 天
- 2025 年 6 月 25 日六天後出現第二個定義:「下一步所需的剛好那些資訊」。範圍已經收窄,而且已經變成每一輪一次
- 2025 年 7 月 14 日Chroma 在 18 個模型上量測脈絡衰退:模型並不平均地使用脈絡,而且脈絡越長越不可靠
- 2025 年 9 月 29 日「盡可能最小的一組高訊號 token。」這個詞在 102 天內完成反轉
- 2025 年 11 月 26 日Anthropic 發表整套機具做法 —— 初始化器、功能清單檔、進度檔。「harness」在文中只是個普通名詞
- 2026 年 1 月 18 日一份綜述替圖結構這套做法命了名:它「常被稱為 flow engineering」。後來的材料裡沒有任何人提到這件事
- 2026 年 1 月 23 日OpenAI 公開拆解內層迴圈,並把自家 agent 稱作「我們的 agent(或說 harness)」—— 這個名詞已經不需要解釋,而距它變成一門學問還有兩週
- 2026 年 2 月 5 日機具工程被命名,在一個個人部落格上,指的是一份指示檔加兩支腳本。作者說他不知道業界有現成的說法
- 2026 年 3 月 4 日某編碼代理的推理強度預設值由高降為中。使用者幾天內就說變差了;這個預設值撐了 34 天
- 2026 年 3 月 10 日
Agent = Model + Harness。三十三天,這個詞現在指的是「模型以外的一切」 - 2026 年 3 月 26 日一項快取變更原本要清掉舊的思考、只留一塊,卻變成每一輪都執行。歷時十五天。這正是情境工程那套公認建議,只是以錯誤的形式出貨
- 2026 年 4 月 13 日一篇論文把迴圈形式化為「就緒集合恆為一」的排程器 —— 並把自己的提案稱為 Structured Graph Harness,比「圖結構工程」這個說法早三個月
- 2026 年 4 月 16 日一條限制輸出長度的系統提示規則,為某一個模型而寫,卻套用到三個模型上。消融分析算出它值大約 3% 的評測分數。上線四天
- 2026 年 4 月 23 日事後報告發布。距離有人說出「迴圈工程」還有 40 天,距離「圖結構工程」被命名還有 72 天 —— 現象都在,名字一個都還沒有
- 2026 年 6 月 2 日「我已經不對 Claude 下提示了。我的工作是寫迴圈。」某人在一場活動上描述自己的做法。距內層迴圈發表 130 天
- 2026 年 6 月 7 日一則 X 貼文把那段描述變成指令 ——「你應該去設計那些對你的 agent 下提示的迴圈」—— 於是它傳開了。兩則貼文都沒有定義迴圈是什麼
- 2026 年 6 月至 7 月 1 日29 天內六種說法,講的是五種不同的東西:一個人的習慣、一個目標、一支程式、兩層巢狀機器、一套分類,以及一個外層迴圈長達數週且包含使用者的組織
- 2026 年 7 月 4 日圖結構工程第一次被認真地命名 —— 七分鐘閱讀、六則引註、三項主張。石沉大海
- 2026 年 7 月 18 日X 上十二個字的玩笑,UTC 00:34 —— 310 萬次瀏覽。四小時三十五分後出現一篇迴圈工程的訃聞,鎖在付費牆後。傳開的是那個玩笑
- 2026 年 7 月 27 至 28 日一家台灣科技媒體畫出五層階梯,替每一層標上年代 —— 而旁邊的內文寫著目前還沒有定論
- 2026 年 8 月 13 日維基百科有了 agent harness 條目,詞源標為有爭議。而情境工程被命名十四個月之後,仍然沒有條目
論點
這個領域對自己的說法:一座階梯 主張它的是措辭最篤定的來源,而不是任何一個命名的人
標準說法是一個堆疊:提示工程在情境工程裡面,兩者都在機具裡面,迴圈在機具之上,圖結構又在迴圈之上。這是個好故事,而且它被畫出來的篤定程度,遠高於它被論證的程度。把這個說法講得最清楚的是一張圖,它替每一層標上年代,也把包含關係定死;而同一家媒體同一天印在那張圖旁邊的內文,白紙黑字寫著這個順序目前還沒有定論 —— 有人認為迴圈在機具之上,也有人根本不談機具。不談機具的那些人裡面,有一位正是造出 graph engineering 的作者:他的階梯只有四階,略過了機具,而他引用最重的那篇論文,提案的名字就叫 Structured Graph Harness。這個規律一致到值得替它取個名字:對這套詞彙的信心,與離發明者的距離成正比。
- 5 vs 4階,端看機具算是一層,還是一個容器
- 4 / 4位命名者都留了餘地:「沒有現成說法」、「我持保留」、「將來應該越來越不重要」,以及一個玩笑
紀錄顯示的其實是另一回事:一條往外移動的界線 這個詮釋是本站的;它底下那些位移不是
照日期讀下來,這五個名字並不疊成一座階梯。每一個出現的時機,都是某一個工作單位不再是人所能掌握的那個單位的時候。當那個單位還是一串字時,這門學問叫提示工程;當它變成一個視窗,叫情境工程;當視窗不再是系統的邊界,模型以外的一切成了單位 —— 機具;接著是重複本身 —— 迴圈;再接著是視窗與視窗之間發生的事 —— 圖結構。這個讀法是推論,也照實標為推論;沒有任何來源這樣說。不是推論的是它的後果:五個詞,五種不同的失敗方式。提示工程一路縮小,最後成了一個零件。情境工程整個反轉。機具工程急速膨脹。迴圈工程碎成六種說法,講的是五種不同的東西。圖結構工程被命名兩次,而贏的那次不是認真的。五個詞,沒有任何一個只是單純地穩定下來、變成一個意思。一套這樣運作的詞彙,不是一座正在被爬上去的階梯。它是一個領域,在替一條它不斷得往外挪的界線命名。
- 182 → 71天 —— 做法與名字之間的落差,隨著節奏加快而縮短
- 41天之隔,同一個人的兩則貼文推動了五個名字裡的兩個。兩則都沒有定義任何東西
唯一一次同時盯著好幾層看 一份廠商事後報告,2026 年 4 月 23 日 —— 現象都在,名字一個都還沒有
上面談的全都是名字。2026 年 4 月那份事後報告是本站材料裡唯一一份把好幾層放在一起、在線上環境觀察、而且留下數字的文件。拿它去對照那套詞彙,有兩點很扎眼。第一,三項故障各自落在有名字的層上 —— 推理預設值是機具替你挑的模型檔次,快取錯誤是脈絡管理,輸出上限是一條提示 —— 但報告一個詞都沒有用,因為在 2026 年 4 月 23 日,其中兩個詞還不存在:距離有人說出「迴圈工程」還有 40 天,距離「圖結構工程」被命名還有 72 天。這就是「做法先於名字」從內部看起來的樣子 —— 發生在同一個月,而不是事後回望。第二,對階梯模型來說更難受的是:那個快取錯誤,本身就是情境工程那套公認的做法,實作正確,卻以缺陷的形式出貨。清掉舊的思考,留下最近一塊,正是該廠商自己的工程部落格在七個月前發表的「盡可能小的高訊號權杖集合」那套建議。問題不在建議錯了。問題在那個清除動作每一輪都跑,而不是只跑一次,而上面那一層完全沒有察覺。一個每層各自審查的堆疊,沒有任何地方可以問「其中兩層加在一起會怎樣」;而這份事後報告最實質的改善措施,剛好就是這件事:把測試從單一變更擴大到整個模型,並加上一段觀察期。
補充
真正有共識的是什麼 由五個詞的材料共同拼出,而且沒有任何一個反對
- 1把指示寫在對的高度具體到足以指引,籠統到足以撐過下一個狀況。不是把遇過的每一種情形都列出來
- 2工具集要小,而且不要互相重疊兩個功能幾乎相同的工具,等於憑空多給模型一個必須做對的判斷,而且沒有任何好處
- 3一個節點只做一件事跨兩個不同的名詞,由三個來源各自得出。「好的節點是無聊的」
- 4驗證要從外面來整套系統存在的意義,就是去反駁模型那句「我做完了」。要模型檢查自己的答案,不叫外部驗證
- 5存檔的是狀態,不是對話紀錄有結構的狀態,每一步都寫下來。如果記憶只是「壓縮後還留著的東西」,第 40 步失敗就等於重來
- 6把預算放進狀態裡三個來源、三個名詞,講的是同一句話:如果你沒辦法在花費上限把系統停下來,那它不是自主,它只是在累積帳單
證據,以及證據到哪裡就沒了 這個題目最弱的一環,而且是這個領域自己說的
| 問題 | 現有的證據 | 分級 |
|---|---|---|
| 改動其中一層,代價量得出來嗎? | 有,一次。消融分析把系統提示裡一條輸出長度規則算成約 3% 的評測分數,橫跨三個模型;另有一個清除脈絡的錯誤讓記憶能力退化 15 天 | 是廠商量自己的退化,不是獨立比較 —— 而且它標的是一次失誤的價錢,不是一層的價值 |
| 機具有沒有差? | 一份實驗設計正確的比較 —— 模型固定,機具變動,在第三方排行榜上。同一個前沿模型在兩套機具下分數相差很大 | 全部材料裡最強的一項,而它只涵蓋五個詞裡的一個 |
| 迴圈有沒有勝過下提示? | 沒有。任何來源裡都找不到有對照的比較 | 是找過之後確認的空缺,不是沒去找 |
| 圖結構有沒有勝過迴圈? | 沒有。唯一一篇嚴謹的論文自述:「並非生產環境實作,也不是實證結果」,並附上明白的公平性聲明 | 已經連續兩個名詞,底下完全沒有量測 |
| 文獻鏈可不可靠? | 還不可靠。一則百科條目把自己的主要來源年份寫錯一年;圖結構那一支所倚賴的唯一綜述,同一份宣稱樣本為 70 的研究,在四個地方分別寫成 42、41、49、68 | 兩者皆已對照原始文件查核。日期與網址請自行核對;這批材料還很新 |
關於這套詞彙從哪裡來,有兩件事比任何一方的主張都更值得注意。第一:本專案能查到日期的四次命名,沒有一次發生在經同儕審查的場合 —— 兩則 X 貼文、一個個人部落格、一個個人網站,加上一場研討會演講。論文是真的,但它們是後來才到,並且採用了這個領域已經選好的字。第二:做出命名的那些人,正是對它最沒把握的人。造出機具工程的人說他不知道有現成的說法,而且沒有堅持。替迴圈工程命名的人,在同一段裡寫下「還很早,我持保留」。那位提出機具定義、後來人人轉述的人,主張機具將來應該越來越不重要。而讓圖結構工程紅起來的那則貼文是個玩笑 —— 四天後一位具名的分析者把話講明了,同時也正確地指出:這個玩笑之所以成立,是因為它指向了某個真實的東西。最後這個區別要記住。命名是雜訊,底下的做法不是。
結論
所以呢 380 天四個名字,該帶走什麼
做法先出現。每一次都是。
四個名詞,四段可考的落差,沒有反例:情境工程 182 天、機具工程 71 天、迴圈工程 130 天、圖結構工程 167 天。而在圖結構這一例,那套做法不只已經有人在做 —— 它在 1 月的一份綜述裡早就被命名過了,叫 flow engineering。下次再出現新名詞,該問的不是它是什麼意思,而是過去半年有什麼東西已經以另一個名字在出貨了。
這是一套詞彙,不是一項技術。
機制屬於 2018 到 2022 年,都已發表且經過同儕審查。名字屬於 2025 到 2026 年,四個可考的命名沒有一個是。中間幾乎是空的。這不代表這些詞沒有價值 —— 一個領域需要字 —— 但它確實意味著:這座階梯上多出一個新名字,是關於那場對話的證據,不是關於那些系統的證據。
命名的人比轉述的人可信。
四位命名者全都留了餘地 ——「我不知道有現成的說法」、「我持保留」、「機具將來應該越來越不重要」,還有一個根本就是玩笑。到了下游,這些餘地全部消失:那座篤定的五層階梯,是由一家自己的內文寫著「目前還沒有定論」的媒體畫出來的。看到關於這套詞彙的篤定說法,先查它離發明那個字的人有多遠。
每層是分開審查的。壞掉是一起壞的。
本站材料裡唯一那次線上事故,既不支持也不反對那座階梯。它是關於一疊層次要怎麼治理的證據:三項變更落在三個有名字的層上,每一項都各自通過了審查,卻在 47 天裡表現成一次籠統的整體衰退,因為沒有人負責問「這三件事加在一起會怎樣」。三項裡有一項,本身就是這個領域自己的脈絡建議,實作正確,卻以缺陷的形式出貨。這套詞彙如果有實用價值,不在於它是一座可以往上爬的階梯,而在於它是一張「變更可能落在哪裡」的清單 —— 以及一個「該測整體、不是只測 diff」的理由。
而真正站得住的那部分。
對的高度、最小工具集、一個節點一件事、外部驗證、有結構的狀態存檔、一個你能據以停機的預算。六條做法,是從五場「這一層該叫什麼」的爭執裡拼出來的,而且沒有任何一場反對它們。這是這個題目裡耐久的部分;就算明天這五個名字全部作廢,它還是值得照做。它同時也是 —— 到目前為止 —— 沒有人量測過的部分。