事實
術語 · LLM 工程 · 語言模型 · 效能評測 · AI 人工智慧 · 名詞解析Tratopedia · 2026 年 8 月 15 日
五篇之一 · 最裡面的那一層
職稱消失了,敏感度沒有
提示工程就是把指令寫好,讓模型做出你真正要的東西。它拿到了字典詞條、成為職稱,然後被寫了訃聞:從這個職位出現到業界宣告它過時,不過兩年。但是,當初讓它成為一門功夫的那些量測結果,沒有任何資料說已經解決了。光是把提示裡的範例重新排序,準確率就曾移動超過四十個百分點;只改格式,曾移動超過七十個。模型變大、範例變多、做過指令微調,這個敏感度依然存在。結束的是一個職業,不是一個現象 —— 而這門功夫與其說停了,不如說換了位置:從「怎麼用模型」的全部,變成更大系統裡的一個零件。
三個定義,以及移動的那個詞 三者對這門功夫的說法一致。只有一個把它稱為職業。
- 40+僅把提示中的範例重新排序,準確率曾移動的百分點
- 76在少樣本設定下,僅改變格式所造成的準確率差距
- 8八個思維鏈範例,就讓 540B 模型在 GSM8K 上達到當時最佳成績
- 2從最熱門的 AI 職稱到業界宣告過時,相隔的年數
牛津英語詞典 · 2025
「……以及與此相關的學科或職業」
- 全文:為人工智慧程式、演算法等制定並修改提示,以最佳化其輸出或達成預期結果的行為或過程;以及與此相關的學科或職業。
- 移動的正是最後那個子句。2023 年,「prompt」是牛津年度詞彙的亞軍。
Anthropic · 2025 年 9 月
「撰寫與組織 LLM 指令的方法」
- 沒有職業,也沒有學科。就只是「寫」這件事。
- 同一篇文章稱情境工程是提示工程的自然演進 —— 而不是取代它。
維基百科 · 擷取時
「建構自然語言輸入,以產生指定的輸出」
- 它把情境工程並列為「相關領域……著重於非提示與提示的脈絡」—— 系統指令、詮釋資料、API 工具、token。
- 兩個立場不同的來源,描述同一個形狀:提示還在,而它周圍的一切另外得到了名字。
每一部分站得多穩 四篇論文讀了原始出處。但人人引用的那些數字沒有。
| 確信程度 | 內容 | 依據 |
|---|---|---|
| 已讀原始出處 | 八個思維鏈範例,讓 540B 參數的模型在 GSM8K 上達到當時最佳準確率,甚至超越了經過微調並加上驗證器的 GPT-3 | Wei 等人,arXiv 2201.11903,2022 年 1 月 28 日投稿。摘要已讀原文 |
| 已讀原始出處 | GPT-3:1,750 億參數,是先前任何非稀疏模型的十倍;少樣本使用「有時甚至可與既有最佳微調方法一較高下」 | Brown 等人,arXiv 2005.14165,2020 年 5 月 28 日投稿。摘要已讀原文 |
| 已讀原始出處 | 十項 NLP 任務改寫為對一段脈絡提問,單一模型,無任務專屬參數 | McCann 等人,arXiv 1806.08730,2018 年 6 月 20 日投稿。摘要已讀原文 |
| 已讀原始出處 | 牛津英語詞典的定義,包含「以及與此相關的學科或職業」 | 維基百科引自牛津大學出版社,2025 年。詞典條目本身未直接查閱 |
| 經維基百科 | 僅重新排序範例即造成逾 40 個百分點的準確率差異;少樣本設定下,僅改變格式即達76 個百分點 | 維基百科引述研究。本站未讀那些研究 —— 引用的是量級,不是任何單一結果 |
| 經維基百科 | 即使模型更大、少樣本範例更多、經過指令微調,這個敏感度依然存在 | 維基百科。整個論點就繫於這句話,而它偏偏是本頁最弱的來源 |
| 經維基百科 | 情境內學習是規模帶來的湧現性質,而且是暫時的 —— 與訓練或微調不同,它不留下任何東西 | 維基百科 |
| 僅見標題 | 這個職位被宣告過時:〈AI 提示工程已死〉(2024 年 3 月);〈2023 年最熱門的 AI 工作已經過時〉(2025 年 4 月) | IEEE Spectrum 與《華爾街日報》。本站只看到標題;兩篇皆未讀,此處僅用以證明這類文章確實存在 |
| 本站推論 | 這個詞的範圍每一步都在縮小,但現象沒有 | 由以上所有資料綜合而成。沒有任何來源提出過這個演進序列 |
時序
每一次移動時,這個詞的意思 這不是事件清單,是語意清單。每個日期都是一份出版品,而不是人們說法改變的時點。
- 2018 年 6 月提示是一個用來挑選任務的問題。decaNLP 把十項 NLP 任務改寫成對一段脈絡提問 ——「情緒是什麼?」「把這句翻成德文」—— 單一模型,沒有任務專屬參數。
- 2019 年提示取代了微調。GPT-2 以零樣本方式執行下游任務,「未做任何參數或架構修改」。指令本身成為全部的規格。
- 2020 年 5 月從發問變成教學。1,750 億參數的 GPT-3 讓少樣本提示可行:提示開始承載範例,提示因此成為情境內學習。
- 2022 年 1 月從答案轉向方法。思維鏈:八個展示推理過程而非結果的範例,讓 540B 模型在 GSM8K 上達到當時最佳。注意日期 —— 這比 ChatGPT 早了十個月。
- 2022 年又縮回一句話。研究發現,只要加上「讓我們一步一步想」,完全不給範例也有效。範圍從一項技術縮成一個句子。
- 2023 年頂點:它成為一種職業。成為牛津英語詞典的詞條,定義結尾是「以及與此相關的學科或職業」。「prompt」是牛津年度詞彙亞軍。企業開始招募提示工程師。
- 2024–25 年職業洩了氣。IEEE Spectrum 在 2024 年 3 月刊出〈AI 提示工程已死〉;《華爾街日報》2025 年 4 月稱這個 2023 年的職位已過時。維基百科指出職稱變得少見 —— 模型寫的提示比人好,而其餘的人都受過訓練了。
- 2025 年 9 月換位置,不是被移除。Anthropic 稱情境工程是提示工程的自然演進。提示還在;而它周圍的一切 —— 工具、記憶、訊息歷程 —— 另外得到了名字,提示則成為其中的一個零件。
論點
它死了嗎? 兩組證據指向相反方向 —— 但它們講的是兩件不同的事。
訃聞這一方的理由是成立的。這個職稱在兩年內出現又消失,而維基百科給了兩個理由而不是一個:現在模型寫的提示比人好,而且一般員工都受過這項訓練,於是專職角色再也沒有專職的餘地。兩個說法都合理,但本站查到的資料裡沒有任何一個做過量化。反方的理由則是:量測結果從來沒有變。如果把同樣的範例重新排序,輸出品質就擺盪四十個百分點;如果只改格式而其他不動,就擺盪七十六個,那麼顯然還有東西可以「工程」—— 而且研究明白指出,模型更大、範例更多、做過指令微調,這個現象依然存在。這是整頁最吃重的一句話,偏偏由最弱的來源承載:維基百科所引述、而本次連線並未讀過的研究。上表已如此標示,讀者也應該保留幾分。這兩組證據其實並不衝突,因為它們講的是不同的事。一組講的是就業,另一組講的是模型。一門功夫可以不再是職涯,卻仍然是必要的 —— 而 Anthropic 與維基百科各從相反的方向,描述的大致就是這件事:它們把提示放進更大的東西裡面,而不是把它丟掉。
- 2 yr從最熱門的 AI 工作到被宣告過時 —— 依業界媒體自己的標題
- 40 pts僅重新排序同樣的範例就造成的差距。沒有任何資料說這個問題已解決
- 2兩個不同的主題:一組證據講就業,另一組講模型
補充
那些技術到底是什麼 這些有名字的方法,以及每一個在前一個之上加了什麼。
| 技術 | 做什麼 | 加了什麼 |
|---|---|---|
| 少樣本 | 在提示裡放入已完成的範例 | 模型能光靠提示學會一項任務。這個能力隨規模湧現,而且是暫時的 —— 與微調不同,事後什麼也沒留下 |
| 思維鏈 | 範例展示的是推理步驟,不只是答案 | 形塑模型的過程。八個範例、540B 模型、GSM8K 當時最佳成績 |
| 零樣本思維鏈 | 加上「讓我們一步一步想」,然後把範例拿掉 | 顯示這個效果根本不需要範例 —— 一句話就達到了 |
| 自洽 | 跑好幾條思維鏈,取最常出現的結論 | 把單次抽樣的答案變成一場投票 |
| 思維樹 | 多條推理路線並行,並可回溯 | 從單趟推進變成搜尋 —— 廣度優先、深度優先或束搜尋 |
以及它去了哪裡 同一門功夫換了名字,在三個地方出現。
- 1進入系統提示Anthropic 的建議是寫在對的高度 —— 介於寫死而脆弱的 if-else 邏輯,與假定彼此心照不宣的空泛指引之間。目標是能完整界定行為的最小集合;但最小不等於最短。
- 2進入工具定義「工具的定義與規格,應該和整體提示得到同等的提示工程關注。」在 SWE-bench 上,Anthropic 表示花在調整工具上的時間多過調整提示。
- 3成為更大系統的一層情境工程接手了周圍的工作 —— 模型在每一步看得到什麼、記得住什麼。提示工程並沒有從中消失;它成為負責撰寫指令的那一部分,從每個任務一次,變成每個步驟一次。
論文裡有個細節值得留著,因為轉述時通常會弄丟。思維鏈是在 2022 年 1 月 28 日投稿的 —— 比 ChatGPT 推出早了十個月。最常被舉為提示工程巔峰的那項技術,其實在觀眾到場之前就已經出現;對一個否則會從聊天視窗說起的故事來說,這是個有用的修正。第二個細節:維基百科把思維鏈的結果描述為「與任務專屬的微調模型表現相當」。但論文自己的摘要寫的是當時最佳,而且超越了經過微調並加上驗證器的 GPT-3。兩句話講的是同一個實驗,只是其中一句比原本的主張弱。本頁採用論文的用字;而這個落差,正是把摘要追回原始出處的一般理由。
- 10 mo思維鏈比 ChatGPT 推出早了十個月
- SOTA論文自己的主張,對照轉述中的「表現相當」
- 175BGPT-3 的參數量 —— 是先前任何非稀疏模型的十倍
結論
該帶走什麼 三件事,第一件是關於怎麼讀那些訃聞。
結束的是一個職稱,這和一門功夫結束不是同一件事
兩則標題宣告這個職位過時。但兩則都不是在談「用字是否仍會影響輸出」—— 而說它會的那些量測,在本站查到的資料裡沒有任何一處說已經解決。把「提示工程已死」讀成一句關於招聘的話,因為它背後的證據只涵蓋這件事。
這個詞的地盤每一步都在縮小
2018 年是任務選擇器,2019 年是微調的替代品,2020 年是以範例教學的方式,2022 年是形塑推理的手段,然後縮成一句話,再膨脹成一種職業,最後成為情境工程裡的一個零件。這個演進序列是本站綜合而成,沒有任何單一來源提出過 —— 但其中每一步都讀過各自的原始出版品。
本頁最強的主張,靠的是最弱的來源
「模型變大、範例變多、經過指令微調之後,這個敏感度依然存在」是讓整個論證成立的關鍵 —— 而它來自維基百科所引述、本次連線並未讀過的研究。表格中已如此標示。如果你只想查證本頁一件事,就查這一件。