起 · 發生了什麼
開源模型 · 語言模型 · AI 能力 · 地緣政治 · 模型簡報2026 年 7 月 15 日發布 · 記錄至 2026 年 8 月 26 日
執行摘要 · 單頁綜覽
一款開源模型,部分師承它所回應的對手
由前 OpenAI 技術長 Mira Murati 創立的 Thinking Machines Lab,於 2026 年 7 月 15 日發布首款開源權重模型 Inkling:975B/41B 啟用的多模態 MoE、開源權重 1M token 上下文、Apache 2.0 授權,並附思考深度旋鈕。它進入的市場,早已由中國實驗室以數量取勝——獨立統計顯示,截至 2026 年 5 月,中國開源模型約佔 OpenRouter 路由 token 量的 61%,Meta 自家的 Llama 佔比則不到 1%。六週後,獨立評測將 Inkling 列為美國實驗室最領先的開源發布。而 Thinking Machines 官方自述亦明白指出:其後訓練資料部分蒸餾自 Kimi K2.5——正是它被拿來比較的對手模型之一。
關鍵數據 直接對照 Thinking Machines 官方倉庫與網站核實
- 975B/41B多模態 MoE——總參數/啟用參數
- 1M開源權重上下文(Tinker 提供 256K/64K)
- 41Artificial Analysis 智能指數——美國開源模型最高分
- 98.6%StrongREJECT(FORTRESS 對抗性 78.0%/良性 95.9%)
起 · 事實與分級 除另有註明,均已於 Thinking Machines 官方資料確認
| 查證等級 | 事實 | 時間 |
|---|---|---|
| 確認 | Inkling 發布:975B 總參數/41B 啟用 MoE、開源權重 1M token 上下文、Apache 2.0 授權 | 15 Jul 2026 |
| 確認 | 後訓練初期 SFT 使用開源模型合成資料,「包含 Kimi K2.5」 | 訓練期間,官方自述 |
| 確認 | 強化學習超過 3,000 萬次 rollout 後,思維鏈自發壓縮,並非獎勵機制刻意促成 | 強化學習期間 |
| 確認但無法於此獨立查核 | Inkling 在 Cognition 的查核評測中,「呈現明顯的審查不服從模式」 | 官方自述;未見 Cognition 對 Inkling 之獨立評分 |
| 確認 | Inkling-Small 發布並公開完整權重:276B 總參數/12B 啟用 | 30 Jul 2026 |
| 確認,獨立來源 | Inkling 於 Artificial Analysis 智能指數首發即獲 41 分——美國實驗室開源模型最高分 | 15 Jul 2026 |
承 · 時序
時序 2026 年 6 至 8 月,各事件均以原始來源標明日期
- 24 Jun 2026獨立分析(Data Gravity)指出,截至 2026 年 5 月,中國開源模型佔 OpenRouter 路由 token 量約 61%;Meta 的 Llama 佔比不到 1%。
- 30 Jun 2026Bridgewater AIA Labs 與 Thinking Machines 發表 Tinker 微調案例研究——對象為 Qwen3-235B,早於 Inkling 面世兩週。
- 10 Jul 2026Thinking Machines 發表〈值得打造的未來是屬於人的〉,引海耶克論知識分散,警告 AI 發展過度集中於少數實驗室——未點名任何國家。
- 15 Jul 2026Inkling 發布;上線首日即透過 Together AI、Fireworks、Modal、Databricks 與 Baseten 提供 API。Artificial Analysis 同日給出智能指數 41 分。
- 30 Jul 2026Inkling-Small 發布並公開完整權重(276B 總參數/12B 啟用);Artificial Analysis 給出 40 分,以不到三分之一參數量逼近 Inkling。
- 31 Jul 2026Thinking Machines 公開安全流程說明:內部測試、四家具名外部紅隊,以及對兩款模型的對抗性微調檢測。
- 26 Aug 2026Hugging Face 上 Inkling 累計下載 166,108 次、按讚 1,749 次;Inkling-Small 為下載 168,647 次、按讚 379 次。
時序之所以重要,是因為兩起事件極易被混為一談。Bridgewater/Tinker 案例研究——一款微調過的 Qwen3-235B,在金融文件分類任務上勝過前沿模型——發表時間早於 Inkling 面世兩週。它證明了在 Thinking Machines 的 Tinker 平台上微調能做到什麼;但它與 Inkling 本身的表現無關,亦未見任何 Inkling 專屬的部署案例。收錄於此,是因為它是 Inkling 自身微調故事背後的平台經濟學證據,而非關於 Inkling 本身的資料。
轉 · 論點
Thinking Machines 眼中 Inkling 的定位 引自 Thinking Machines 官方資料
Thinking Machines 自己說得直白:Inkling「並非當今可得、無論開源或封閉的最強模型」。它的賭注在於組合:多模態能力、可調且高效的思考深度旋鈕、以及可在 Tinker 上微調——這使它成為「一個適合客製化的優質開源基礎模型」,而非榜單上的競逐者。架構方面:66 層純解碼器 transformer,每個 token 路由至 256 位專家中的 6 位,另加 2 位恆常啟用的共享專家,混合局部/全局注意力,並採無編碼器的多模態設計——影像以區塊編碼,音訊以 dMel 頻譜表示,兩者皆投影至與文字共用的隱藏空間中一併處理。思考深度旋鈕技術上可調範圍為 0 至 0.99;Thinking Machines 官方公布的效能曲線則掃描 0.2 至 0.99 區間,在此範圍內 Inkling 在 Terminal Bench 2.1 上達到同等分數所需 token 數,約為 Nemotron 3 Ultra 的三分之一。
- 0–0.99思考深度旋鈕——技術上可調全範圍
- 30M+RL rollout → 思維鏈自發壓縮
它所進入的市場,以及其中的複雜之處 均具名歸屬,非本站自身判讀
兩項獨立測量勾勒出 Inkling 進場時的處境。Data Gravity 自身的 token 路由分析:截至 2026 年 5 月,中國開源模型佔 OpenRouter 路由 token 量約 61%,「五款最常用模型中有四款是中國模型——而兩年前曾是開源龍頭的 Meta Llama,已完全跌出排行榜」,路由量佔比不到 1%。Artificial Analysis 則在 Inkling 上線同日評論:這是「美國實驗室最領先的開源發布」,比前一名 Nemotron 3 Ultra 高出三分。然而複雜之處在於,Thinking Machines 官方自述的理由並非如此框定。其發布前五天公開的宣言,論點是反對 AI 發展過度集中於少數如「中央計劃」般的實驗室,並引海耶克論知識分散——但通篇未點名中國。「西方回應」的框架,來自上述獨立市場測量,而非 Thinking Machines 自己的說法。而 Inkling 自身的後訓練,又讓任何一種框架都變得複雜:其初期微調使用了開源模型的合成資料,「包含 Kimi K2.5」——正是市佔數據所指的那些中國模型之一。
Tinker 案例:從原始圖表重新核算 並非 Inkling——為 Qwen3-235B 微調,早於 Inkling 上線兩週
| 模型 | 準確率 | 每千件任務成本 |
|---|---|---|
| Bridgewater 訓練之模型(Qwen3-235B 微調版) | 84.7% | $4.72 |
| GPT 5.5 | 78.2% | $65.06 |
| Claude Opus 4.8 | 78.0% | $92.59 |
| Claude Opus 4.6 | 77.2% | $61.52 |
| GPT 5.4 | 75.8% | $28.50 |
| Gemini 3.1 Pro | 74.3% | $31.77 |
Bridgewater 與 Thinking Machines 共同發表的比較,將其微調模型與六款前沿模型並列。在這項任務上表現最強的是 GPT 5.5,平均準確率 78.2%,每千次任務成本 $65.06;Claude Opus 4.8 為 78.0%,成本卻達 $92.59,是全組最貴。微調後的 Qwen3-235B 達 84.66%,成本僅 $4.72——較 GPT 5.5 便宜 13.8 倍,正是該文自述的數字;較 Claude Opus 4.8 則便宜 19.6 倍。惟有兩點須一併考量:此為平台供應商與其客戶的共同發表,未經獨立複現;且所測的是 Qwen3-235B 微調模型,而非 Inkling。
合 · 補充
安全測試 引自〈通往開源權重的安全路徑〉,2026 年 7 月 31 日
內部 · 三大面向
危險知識、濫用、多模態危害
- CBRN 與攻擊性資安知識及操作能力,內部測試。
- 涵蓋 17 種語言及文字、影像、音訊輸入的多模態危害測試。
外部 · 四家具名機構
Scale AI、Handshake AI、FAR.AI、Apollo Research
- 各自負責不同領域:一般濫用、易受傷害使用者危害、CBRN/資安誘出、失控行為。
- 均未發現任何超出現有開源模型既有風險程度的能力。
刻意移除安全防護 對抗性微調測試
由於開源權重可被重新微調以移除拒答訓練,Thinking Machines 特意對 Inkling 與 Inkling-Small 微調出「只求有幫助」的版本——刻意訓練成傾向配合而非拒答——並以相同的雙重用途評測進行測試。其自身結論為:「這些『只求有幫助』版本,在 CBRN 與資安任務上並未展現任何新增能力,其表現與現有開源模型相當。」結合內部與外部測試結果,Thinking Machines 認為發布 Inkling 並未增加超出現有可下載開源模型既有程度的風險。
Inkling-Small:六週後 獨立評測,Artificial Analysis
Artificial Analysis 在 Inkling-Small 上線當日發布的詳細評測顯示:以不到三分之一參數量,它在 Humanity's Last Exam(32% 對 30%)與 GPQA Diamond(89% 對 87%)上略勝 Inkling;但在代理型任務上落後——τ³-Banking 為 15%,遜於 Inkling 的 24%——並在 Artificial Analysis 自家的事實校準指數上呈負值,而 Inkling 為正值,「代表答錯的比例高過答對」。兩款模型在智能指數上的分數十分接近(40 對 41),但這是較粗略的綜合指標,本身無法說明何種任務適合哪一款模型。
結論
結論 已定與未定之事
Inkling 是什麼
一款貨真價實、文件完備的開源模型——975B/41B MoE、開源權重 1M token 上下文、Apache 2.0 授權——六週後獲獨立評測列為美國開源模型之最,而它所進入的市場,早已由中國實驗室以數量取勝。
官方自述補上的一筆
據 Thinking Machines 自述,Inkling 的後訓練是以一輪初期監督式微調啟動的,所用的合成資料來自開源模型,「包含 Kimi K2.5」——正是它被拿來比較的中國模型之一。官方指這段啟動僅佔「一小部分算力」,大宗算力用於大規模強化學習;因此這是起點,而非這款模型的實質內容。
- Bridgewater/Tinker 經濟效益案例真實且文件完整,但它是 Inkling 面世前對 Qwen3-235B 的微調案例。未見任何專屬 Inkling 的企業部署案例——請保留這項空缺,而非把 Tinker 案例當作 Inkling 自身成績的證據。
- Cognition 查核評測的結果,是 Thinking Machines 對自家模型的自述說法。未見 Cognition 針對 Inkling 獨立公開發表的評分——在把此發現當作已獲獨立驗證之前,值得留意這一點。
- 「對中國開源模型的西方回應」,是對獨立測量市佔數據(Data Gravity、Artificial Analysis)的解讀,並非 Thinking Machines 自身論述——其官方說法從未點名中國。這兩者須分開看待。