Tratopedia
BM
設定

文字大小

佈景

高對比

中文排版

豎排會把內文排成由右至左的直行,如同台灣的實體書籍。

版本

v1.81.0

本頁建置時的版本編號,也是 service worker 快取所依據的版本。

開源模型 · 語言模型 · AI 能力 · 地緣政治 · 模型簡報2026 年 7 月 15 日發布 · 記錄至 2026 年 8 月 26 日

執行摘要 · 單頁綜覽

一款開源模型,部分師承它所回應的對手

由前 OpenAI 技術長 Mira Murati 創立的 Thinking Machines Lab,於 2026 年 7 月 15 日發布首款開源權重模型 Inkling975B/41B 啟用的多模態 MoE、開源權重 1M token 上下文、Apache 2.0 授權,並附思考深度旋鈕。它進入的市場,早已由中國實驗室以數量取勝——獨立統計顯示,截至 2026 年 5 月,中國開源模型約佔 OpenRouter 路由 token 量的 61%,Meta 自家的 Llama 佔比則不到 1%。六週後,獨立評測將 Inkling 列為美國實驗室最領先的開源發布。而 Thinking Machines 官方自述亦明白指出:其後訓練資料部分蒸餾自 Kimi K2.5——正是它被拿來比較的對手模型之一。

關鍵數據 直接對照 Thinking Machines 官方倉庫與網站核實

  • 975B/41B多模態 MoE——總參數/啟用參數
  • 1M開源權重上下文(Tinker 提供 256K/64K)
  • 41Artificial Analysis 智能指數——美國開源模型最高分
  • 98.6%StrongREJECT(FORTRESS 對抗性 78.0%/良性 95.9%)

起 · 事實與分級 除另有註明,均已於 Thinking Machines 官方資料確認

查證等級事實時間
確認Inkling 發布:975B 總參數/41B 啟用 MoE、開源權重 1M token 上下文、Apache 2.0 授權15 Jul 2026
確認後訓練初期 SFT 使用開源模型合成資料,「包含 Kimi K2.5訓練期間,官方自述
確認強化學習超過 3,000 萬次 rollout 後,思維鏈自發壓縮,並非獎勵機制刻意促成強化學習期間
確認但無法於此獨立查核Inkling 在 Cognition 的查核評測中,「呈現明顯的審查不服從模式」官方自述;未見 Cognition 對 Inkling 之獨立評分
確認Inkling-Small 發布並公開完整權重276B 總參數/12B 啟用30 Jul 2026
確認,獨立來源Inkling 於 Artificial Analysis 智能指數首發即獲 41 分——美國實驗室開源模型最高分15 Jul 2026

時序 2026 年 6 至 8 月,各事件均以原始來源標明日期

  1. 24 Jun 2026獨立分析(Data Gravity)指出,截至 2026 年 5 月,中國開源模型佔 OpenRouter 路由 token 量約 61%;Meta 的 Llama 佔比不到 1%。
  2. 30 Jun 2026Bridgewater AIA Labs 與 Thinking Machines 發表 Tinker 微調案例研究——對象為 Qwen3-235B,早於 Inkling 面世兩週
  3. 10 Jul 2026Thinking Machines 發表〈值得打造的未來是屬於人的〉,引海耶克論知識分散,警告 AI 發展過度集中於少數實驗室——未點名任何國家。
  4. 15 Jul 2026Inkling 發布;上線首日即透過 Together AI、Fireworks、Modal、Databricks 與 Baseten 提供 API。Artificial Analysis 同日給出智能指數 41 分。
  5. 30 Jul 2026Inkling-Small 發布並公開完整權重(276B 總參數/12B 啟用);Artificial Analysis 給出 40 分,以不到三分之一參數量逼近 Inkling。
  6. 31 Jul 2026Thinking Machines 公開安全流程說明:內部測試、四家具名外部紅隊,以及對兩款模型的對抗性微調檢測。
  7. 26 Aug 2026Hugging Face 上 Inkling 累計下載 166,108 次、按讚 1,749 次;Inkling-Small 為下載 168,647 次、按讚 379 次。

時序之所以重要,是因為兩起事件極易被混為一談。Bridgewater/Tinker 案例研究——一款微調過的 Qwen3-235B,在金融文件分類任務上勝過前沿模型——發表時間早於 Inkling 面世兩週。它證明了在 Thinking Machines 的 Tinker 平台上微調能做到什麼;但它與 Inkling 本身的表現無關,亦未見任何 Inkling 專屬的部署案例。收錄於此,是因為它是 Inkling 自身微調故事背後的平台經濟學證據,而非關於 Inkling 本身的資料。

Thinking Machines 眼中 Inkling 的定位 引自 Thinking Machines 官方資料

Thinking Machines 自己說得直白:Inkling「並非當今可得、無論開源或封閉的最強模型」。它的賭注在於組合:多模態能力、可調且高效的思考深度旋鈕、以及可在 Tinker 上微調——這使它成為「一個適合客製化的優質開源基礎模型」,而非榜單上的競逐者。架構方面:66 層純解碼器 transformer,每個 token 路由至 256 位專家中的 6 位,另加 2 位恆常啟用的共享專家,混合局部/全局注意力,並採無編碼器的多模態設計——影像以區塊編碼,音訊以 dMel 頻譜表示,兩者皆投影至與文字共用的隱藏空間中一併處理。思考深度旋鈕技術上可調範圍為 0 至 0.99;Thinking Machines 官方公布的效能曲線則掃描 0.2 至 0.99 區間,在此範圍內 Inkling 在 Terminal Bench 2.1 上達到同等分數所需 token 數,約為 Nemotron 3 Ultra 的三分之一。

  • 0–0.99思考深度旋鈕——技術上可調全範圍
  • 30M+RL rollout → 思維鏈自發壓縮

它所進入的市場,以及其中的複雜之處 均具名歸屬,非本站自身判讀

兩項獨立測量勾勒出 Inkling 進場時的處境。Data Gravity 自身的 token 路由分析:截至 2026 年 5 月,中國開源模型佔 OpenRouter 路由 token 量約 61%,「五款最常用模型中有四款是中國模型——而兩年前曾是開源龍頭的 Meta Llama,已完全跌出排行榜」,路由量佔比不到 1%。Artificial Analysis 則在 Inkling 上線同日評論:這是「美國實驗室最領先的開源發布」,比前一名 Nemotron 3 Ultra 高出三分。然而複雜之處在於,Thinking Machines 官方自述的理由並非如此框定。其發布前五天公開的宣言,論點是反對 AI 發展過度集中於少數如「中央計劃」般的實驗室,並引海耶克論知識分散——但通篇未點名中國。「西方回應」的框架,來自上述獨立市場測量,而非 Thinking Machines 自己的說法。而 Inkling 自身的後訓練,又讓任何一種框架都變得複雜:其初期微調使用了開源模型的合成資料,「包含 Kimi K2.5」——正是市佔數據所指的那些中國模型之一。

Tinker 案例:從原始圖表重新核算 並非 Inkling——為 Qwen3-235B 微調,早於 Inkling 上線兩週

模型準確率每千件任務成本
Bridgewater 訓練之模型(Qwen3-235B 微調版)84.7%$4.72
GPT 5.578.2%$65.06
Claude Opus 4.878.0%$92.59
Claude Opus 4.677.2%$61.52
GPT 5.475.8%$28.50
Gemini 3.1 Pro74.3%$31.77

Bridgewater 與 Thinking Machines 共同發表的比較,將其微調模型與六款前沿模型並列。在這項任務上表現最強的是 GPT 5.5,平均準確率 78.2%,每千次任務成本 $65.06;Claude Opus 4.8 為 78.0%,成本卻達 $92.59,是全組最貴。微調後的 Qwen3-235B 達 84.66%,成本僅 $4.72——較 GPT 5.5 便宜 13.8 倍,正是該文自述的數字;較 Claude Opus 4.8 則便宜 19.6 倍。惟有兩點須一併考量:此為平台供應商與其客戶的共同發表,未經獨立複現;且所測的是 Qwen3-235B 微調模型,而非 Inkling。

安全測試 引自〈通往開源權重的安全路徑〉,2026 年 7 月 31 日

  • 內部 · 三大面向

    危險知識、濫用、多模態危害

    • CBRN 與攻擊性資安知識及操作能力,內部測試。
    • 涵蓋 17 種語言及文字、影像、音訊輸入的多模態危害測試。
  • 外部 · 四家具名機構

    Scale AI、Handshake AI、FAR.AI、Apollo Research

    • 各自負責不同領域:一般濫用、易受傷害使用者危害、CBRN/資安誘出、失控行為。
    • 均未發現任何超出現有開源模型既有風險程度的能力。

刻意移除安全防護 對抗性微調測試

由於開源權重可被重新微調以移除拒答訓練,Thinking Machines 特意對 Inkling 與 Inkling-Small 微調出「只求有幫助」的版本——刻意訓練成傾向配合而非拒答——並以相同的雙重用途評測進行測試。其自身結論為:「這些『只求有幫助』版本,在 CBRN 與資安任務上並未展現任何新增能力,其表現與現有開源模型相當。」結合內部與外部測試結果,Thinking Machines 認為發布 Inkling 並未增加超出現有可下載開源模型既有程度的風險。

Inkling-Small:六週後 獨立評測,Artificial Analysis

Artificial Analysis 在 Inkling-Small 上線當日發布的詳細評測顯示:以不到三分之一參數量,它在 Humanity's Last Exam(32% 對 30%)與 GPQA Diamond(89% 對 87%)上略勝 Inkling;但在代理型任務上落後——τ³-Banking 為 15%,遜於 Inkling 的 24%——並在 Artificial Analysis 自家的事實校準指數上呈負值,而 Inkling 為正值,「代表答錯的比例高過答對」。兩款模型在智能指數上的分數十分接近(40 對 41),但這是較粗略的綜合指標,本身無法說明何種任務適合哪一款模型。

結論 已定與未定之事

Inkling 是什麼

一款貨真價實、文件完備的開源模型——975B/41B MoE、開源權重 1M token 上下文、Apache 2.0 授權——六週後獲獨立評測列為美國開源模型之最,而它所進入的市場,早已由中國實驗室以數量取勝。

官方自述補上的一筆

據 Thinking Machines 自述,Inkling 的後訓練是以一輪初期監督式微調啟動的,所用的合成資料來自開源模型,「包含 Kimi K2.5」——正是它被拿來比較的中國模型之一。官方指這段啟動僅佔「一小部分算力」,大宗算力用於大規模強化學習;因此這是起點,而非這款模型的實質內容。

  • Bridgewater/Tinker 經濟效益案例真實且文件完整,但它是 Inkling 面世前對 Qwen3-235B 的微調案例。未見任何專屬 Inkling 的企業部署案例——請保留這項空缺,而非把 Tinker 案例當作 Inkling 自身成績的證據。
  • Cognition 查核評測的結果,是 Thinking Machines 對自家模型的自述說法。未見 Cognition 針對 Inkling 獨立公開發表的評分——在把此發現當作已獲獨立驗證之前,值得留意這一點。
  • 「對中國開源模型的西方回應」,是對獨立測量市佔數據(Data Gravity、Artificial Analysis)的解讀,並非 Thinking Machines 自身論述——其官方說法從未點名中國。這兩者須分開看待。

來源,除另有標明擷取或發布日期,均於 2026 年 8 月 26 日直接擷取:Thinking Machines Lab 官方 Inkling 及 Inkling-Small 發布文章、產品頁、Hugging Face 模型倉庫(模型卡、config.json 與即時 API 紀錄)、〈值得打造的未來是屬於人的〉,以及〈通往開源權重的安全路徑〉 · Bridgewater AIA Labs 與 Thinking Machines 聯合發表之 Tinker 微調經濟效益文章,並直接讀取其圖表內嵌資料 · Artificial Analysis 兩篇獨立的上線當日文章 · 〈中國的開源接管〉(Chris Zeoli,Data Gravity)· Cognition 自身方法論文章,用以查核是否存在 Inkling 專屬評分。