事實
LLM 工程 · 語言模型 · 軟體工程 · AI 代理 · 工程事後報告Anthropic 工程部落格,2026 年 4 月 · 記錄至 2026 年 5 月
解決於 v2.1.116 · API 本身未受影響
三項互不相關的變更,看起來像同一次品質下降
預設推理強度被調降、快取機制的錯誤持續清除推理歷史、系統提示詞限制輸出長度——三件事影響不同的流量區段、時間也不同步,合起來卻呈現為廣泛而不一致的品質下降。受影響的是 Claude Code、Agent SDK 與 Cowork;API 本身未受影響。一位 AMD 工程師自行進行的數據稽核,早在 Anthropic 公開表態的三週前,就已得出相似的結論。
- 3獨立問題,均於 4 月 20 日前修復
- 34天,持續最久的一項問題
- −3%揪出問題三的那項評測所測得的下降
- v2.1.116三項問題全數解決的版本
| 查證等級 | 事項 | 內容 |
|---|---|---|
| 確認 | 三項互不相關的產品層變更,3 月 4 日至 4 月 20 日 | 推理強度預設值調降、清除推理歷史的快取錯誤、限制輸出長度的系統提示詞——三者各自影響不同的流量區段,時程也不同步。全數在 v2.1.116 解決;4 月 23 日重置所有訂閱用戶的用量上限。 |
| 確認 | 一位 AMD 工程師公開的數據稽核,4 月 3 日 | AMD AI 部門主管 Stella Laurenzo 分析了 6,852 個 Claude Code 對話 session,並提交了 GitHub issue——比 Anthropic 自己的說法早了三週。 |
| 確認,但本文無法查證 | 稽核自身提出的成因理論 | Laurenzo 的數據將品質下滑與 2 月中旬一項「將推理內容從介面隱藏」的設定相關聯。Anthropic 自己的三因說法並未提及這項設定,其先前(4 月 7 日)的公開回應更表示這項設定完全不會減少推理。 |
| 未確認 | 真正的驅動因素是運算資源管控,而非官方所述的取捨 | 部分用戶提出此說,另有一位競爭對手的高階主管也持類似看法。Anthropic 的事後報告完全未提及運算資源,但另一份向《財星》雜誌發表的聲明,則承認需求成長已使基礎設施吃緊。 |
時序
時序 橫跨三個月的十三項事件
- 02Opus 4.6 於 Claude Code 上線,預設推理強度為
high。 - 02-12名為
redact-thinking-2026-02-12的設定將推理內容從介面隱藏。後來一份外部稽核將其列為可能成因,但 Anthropic 自己的說法始終未提及。 - 03-04預設推理強度改為
medium(問題一開始)。 - 03-26快取錯誤上線(問題二開始)。
- 04-03AMD AI 部門主管 Stella Laurenzo 提交 GitHub issue,分析 6,852 個 session。
- 04-06The Register 報導此 issue。
- 04-07問題一修復,預設值恢復為
high(Opus 4.7 為xhigh)。Anthropic 的 Boris Cherny 公開反駁 Laurenzo 的理論。 - 04-10問題二修復(v2.1.101)。
- 04-16限制輸出冗長度的系統提示詞隨 Opus 4.7 一同上線(問題三開始)。
- 04-20問題三修復,三項問題全數解決(v2.1.116)。
- 04-23Anthropic 發布事後報告,並重置所有訂閱用戶的用量上限;Boris Cherny 同日於 Hacker News 進一步說明快取機制。
- 04-24《財星》報導用戶的反彈與取消訂閱,以及 Anthropic 一份提及基礎設施吃緊的聲明。
- 05-14InfoQ 發布綜合報導,當中包括一項事後報告未觸及、於 Reddit 上被提出的疑慮。
論點
一個解釋,兩種說法 皆具名歸屬,分歧之處保持開放
Anthropic 自己的診斷:三項變更各自都通過了自己的審查——人工審查、自動化測試、評測。問題出在它們「之間」:沒有任何流程負責檢視多項變更同時上線會產生什麼後果,加上三者影響的流量區段各不相同、時程也不同步,合起來便呈現為一次廣泛而不一致的下降,而非三個各自獨立的成因。
使情況更複雜的地方:一項獨立、以數據為本的申訴,早在 Anthropic 自己公開表態的三週前就已見諸公眾,並指出了另一項變更作為相關成因——這項變更不在 Anthropic 三因說法之列,且 Anthropic 稍早的第一次公開回應早已對此表示反對。
- 4 月 3 日Stella Laurenzo 提交以數據為本的申訴,指名一項 2 月中旬的變更。
- 4 月 23 日Anthropic 自己的事後報告則指名三項不同的變更,沒有一項來自 2 月。
| 來源 | 所指出的成因 |
|---|---|
| Anthropic,4 月 23 日事後報告 | 三項產品層變更:推理強度預設值調降、快取錯誤、限制輸出長度的提示詞——未提及運算資源或 2 月中旬的設定。 |
| Anthropic,向《財星》發表的聲明 | 泛稱基礎設施因需求成長而「吃緊」——未與三項具名的錯誤中任何一項相連結。 |
| Stella Laurenzo,GitHub 稽核(4 月 3 日) | 名為 redact-thinking-2026-02-12、將推理內容從介面隱藏的設定,與所測得「轉向較淺層、先編輯後思考」的行為變化相關。兩則報導對該設定何時進入 Claude Code 的說法不一:TechRadar 以設定名稱所載日期為準,The Register 則指是 3 月初隨 v2.1.69 部署。 |
| Anthropic,第一次公開回應(4 月 7 日) | 同一項設定僅將推理內容從介面隱藏,並不會減少推理本身;並將原因歸於 Opus 4.6 的自適應思考機制。 |
補充
補充 來自 Anthropic 自身說法之外的深度補充
- Claude Code 團隊的 Boris Cherny 在 Hacker News 上補充了 Anthropic 部落格文章只是概述帶過的機制:一般情況下,一段對話除了最新一則訊息外,其餘都能命中提示詞快取;但閒置超過一小時後,下一則訊息就會是一次完整的快取未命中,極端情況下,一個閒置一小時的 90 萬 token 對話,可能一次就要把超過 90 萬個 token 寫入快取——「佔掉相當比例的用量上限,尤其是 Pro 用戶」。在閒置後清除舊有的推理內容,正是 Anthropic 為降低這項成本所嘗試的做法,而其實作方式,正是引入問題二的原因。
- TechRadar 於 4 月 7 日報導,Anthropic 對 AMD 稽核的第一次公開回應,並非承認其成因,而是加以反駁:Boris Cherny 表示 2 月中旬的設定只會將推理內容從介面隱藏、並不會減少推理本身,並另外指出 Opus 4.6 的自適應思考才是真正的改善之處。Anthropic 於 4 月 23 日的事後報告,並未回頭談及這次交鋒,也完全沒有提及那項 2 月中旬的設定。
- 《財星》報導,部分用戶形容自己在 4 月 23 日前的數週間,感覺被 Anthropic 的溝通方式「情感操控」,認為對方是在否認問題存在;也有用戶表示已取消訂閱。Anthropic 向《財星》發表的聲明則提到,需求成長「尤其在尖峰時段」已使基礎設施「吃緊」——這是與部落格文章所述三項具體錯誤截然不同的說法層次,回答了事後報告本身從未提出的問題。
- 在一份最早由 CNBC 報導、並經《財星》引述的內部備忘錄中,OpenAI 的營收主管稱 Anthropic 未能取得足夠運算資源是一次「策略失誤」。這是競爭對手在外流備忘錄中的說法,並非查證所得的事實;而 Anthropic 自己的事後報告,也完全沒有把三項具名的錯誤歸咎於運算資源。
- InfoQ 的報導轉述了一項在 Reddit 上提出、事後報告並未觸及的疑慮:Claude Code 可能會將部分工作委派給成本較低的 Haiku 模型,且僅在詳細日誌中才看得出來——InfoQ 指出,這項風險在無人看管的自動化流程中最難察覺,因為品質下降往往要等到後續步驟才會顯現,而非在發生當下。
結論
現在會有什麼改變 五項後續措施,出自 Anthropic 自身的說法
- 讓更大比例的內部員工,使用與公開版本完全相同的 Claude Code 建置,而非另一套測試建置。
- 為每一次系統提示詞的變更,都執行一套涵蓋各模型的完整評測,並持續進行最終找出問題三的 ablation 分析。
- 建立能讓系統提示詞變更更容易被審查與稽核的工具,並在
CLAUDE.md中加入指引,確保針對特定模型的變更只作用於該模型。 - 為任何可能犧牲智能表現的變更,加上浸泡期、更廣泛的評測套件,以及漸進式推出,以便更早發現問題。
- 擴大 Code Review 工具可讀取的儲存庫範圍——正是這項改變,讓 Opus 4.7 抓出了問題二的問題 PR,而 Opus 4.6 當時未能發現——並利用 X 上的 @ClaudeDevs 帳號與 GitHub 上的集中討論串,即時說明產品決策。
這份報告真正的教訓,以及仍未解決之處
Anthropic 自己對這次失誤的說法,本質上是結構性的:三項變更各自都通過了審查,卻沒有任何機制負責檢視多項變更同時上線的後果——而這正是最實質的一項後續措施所要彌補的缺口。事後報告未能定論的,還有兩件事:一是外部稽核所指出的 2 月中旬變更,是否真的在此次下滑中扮演了角色;二是 Claude Code 悄悄委派工作給較小模型的做法,是否構成同等程度的風險。兩者皆有具名來源可查,本文在此保持開放,而非併入 Anthropic 所指出的三項成因之中。