事實
本機推論 · 語言模型 · Apple Silicon · AI 代理 · 技術報告2026 年 4 月的 Gemma 4,紀錄至 2026 年 8 月
Gemma 4 · Apple Silicon · Claude Code 與 Copilot CLI,四個月後的重新檢視
真正的瓶頸是KV Cache 與 prefill,不是 token 上限
本報告計算在 Mac 上本機執行 Google Gemma 4、並接上 Claude Code 或 GitHub Copilot CLI 等 agentic CLI 工具所需的硬體條件。結論可以先說:決定 agent 體感的是 prefill 速度與 KV cache 佔用量,而非模型能吃多少 context——這也是為什麼每 token 僅啟用 3.8B 參數的 Gemma 4 26B-A4B MoE 成為本機 agentic 工作的甜蜜點。2026 年 4 月以來,Apple 已兩度調漲 Mac 售價;而兩個 Ollama 錯誤,也改變了哪個 Gemma 4 尺寸才真正安全可用。
- 3.8B下文推薦的 26B-A4B 模型,在總計 25.2B 中僅啟用 3.8B 參數
- 256KGemma 4 三款較大模型(12B、26B-A4B、31B)的最大 context
- +35%台灣入門款 Mac mini 自 2026 年 4 月以來的漲幅
- 614 GB/sApple M5 Max(128GB)的統一記憶體帶寬
關於本文價格
本文所列價格,若為台灣售價,均為 2026 年 8 月 25 日 Apple 官網之標價;若為美元售價,則以各處標註的日期為準。今年記憶體與儲存成本波動劇烈——光是 5 月到 6 月,Apple 就兩度調漲 Mac mini 售價——因此下單前請以當下標價為準,勿逕行採信本文數字。以上內容不構成購買建議。
自四月以來的變化 依確認強度分級,最確實的排在最前
| 確認程度 | 發生什麼事 | 細節 |
|---|---|---|
| 已確認 | Gemma 4 取代 Gemma 3 的命名方式 | Google DeepMind 於 2026 年 4 月 2 日發布 Gemma 4,共 5 種尺寸——E2B、E4B、12B、26B-A4B 與 31B——取代 2025 年 3 月發布的 Gemma 3(1B/4B/12B/27B)系列。 |
| 已確認 | Apple 兩度調漲 Mac mini 售價 | 入門款的實際美元售價於 2026 年 5 月由 599 美元漲至 799 美元,M4 Pro 起售價亦於 6 月由 1,399 美元漲至 1,599 美元。據 MacRumors 引述,Apple 向《華爾街日報》表示,這是它見過最劇烈的零件成本漲價,與 AI 資料中心對記憶體與儲存裝置的需求有關。 |
| 已確認 | 兩大主要 coding CLI 均已可接本機模型 | Ollama 於 2026 年 1 月推出原生相容 Anthropic 的 API,讓 Claude Code 可直接連接本機伺服器。GitHub Copilot CLI 則於 2026 年 6 月新增自備金鑰(BYOK)支援,包括本機模型。 |
| 已確認,但範圍比最初報導的窄 | Flash Attention 滯死問題只影響一種 Gemma 4 尺寸,並非本文推薦的那種 | 在 Nvidia CUDA 與 Apple Silicon 上,都有 Ollama 使用者報告 Gemma 4 的 31B Dense 模型在長 prompt 下開啟 Flash Attention 時會無限期滯死。至少一份報告明確指出,本文推薦的 26B-A4B 模型不受同樣長 prompt 影響。 |
| 已確認,仍未解決 | Ollama 上的 Qwen 3.5 27B tool calling 仍然損壞 | 重複懲罰(repetition-penalty)錯誤已於 v0.17.5 修復,但更深層的問題——Ollama 正確的 tool-calling renderer 被接到錯誤的模型名稱上——截至找到的報告為止仍未解決。 |
| 有報導,但未經獨立驗證 | M5 Max 在本機推論上更快,但快多少不明 | Apple 官方發佈只提到 GPU 運算能力與圖形性能的倍數,並未給出每秒 token 數;目前找到唯一的 LLM 吞吐量數據,來自一個自稱數字為「估算值」的測評部落格。 |
時序
芯片與模型的四年 先背景,再進入本報告涵蓋的一年
- 2023Apple 將 M3 Pro 的記憶體帶寬從 M2 Pro 的 200GB/s 削減至 150GB/s——這是值得了解的背景,因為 Mac 買家常會跨世代比較。
- 2024.10Mac mini M4 與 M4 Pro 發布;台灣入門款(16GB/256GB)售價 NT$19,900。
- 2025.03Google DeepMind 發布 Gemma 3,尺寸為 1B/4B/12B/27B。
- 2026.01Ollama 推出原生的 Anthropic 相容 API(v0.14),讓 Claude Code 可直接連接本機模型。
- 2026.03Apple 發布 M5 Pro 與 M5 Max,統一記憶體帶寬高達 614GB/s。
- 2026.04.02Google DeepMind 發布 Gemma 4——E2B、E4B、12B、26B-A4B、31B。
- 2026.04Ollama 使用者分別在 CUDA 與 Apple Silicon 上報告 Gemma 4 31B Dense 模型在長 prompt 下開啟 Flash Attention 時會滯死。
- 2026.05.01Apple 停售 Mac mini 最便宜款;入門價格實際上由 599 美元漲至 799 美元。
- 2026.06.17GitHub Copilot CLI 新增自備金鑰(BYOK)支援,可接本機與外部模型。
- 2026.06.25Apple 將 Mac mini M4 Pro 起售價從 1,399 美元調漲至 1,599 美元,並以新高價恢復之前停售的入門款。
- 2026.08.25Apple 台灣官網 Mac mini 標價自 NT$26,900 起,M4 Pro 兩款配置分別為 NT$54,900 與 NT$61,900。
論點
為何 context 長度不是該關注的數字 重點在 prefill 與 KV cache,不是 token 上限
Agentic CLI 工具每一輪都會重新傳送整個工作狀態——系統 prompt、tool schema,以及目前為止的對話記錄。對一個 coding agent 而言,這在模型產出任何新字之前,就可能已經是好幾千個 token;重新處理這段狀態,稱為 prefill,正是 Mac 的記憶體帶寬真正必須跟上的部分。context 長度只限制一個 session 能跑多久,卻無法決定每一輪的體感如何。真正決定體感的,是 prefill 速度,以及 KV cache——也就是已處理內容的暫存記憶——與模型本身權重共同佔用了多少記憶體。
- 1,024個 token:Gemma 4 大多數 attention 層所採用的 sliding window 大小,依模型自身公開規格。
- ×0.5將 KV cache 從 16 位元浮點數量化為 8 位元整數,記憶體佔用直接減半——這是格式定義本身的必然結果,並非實測結果。
人人都會搞錯的命名方式 Gemma 4 並不是 1B/4B/12B/27B
| 常見說法 | Gemma 4 SKU | 啟用參數 | 最大 context |
|---|---|---|---|
| 1B | E2B | 約 2.3B(有報導) | 128K |
| 4B | E4B | 約 4.5B(有報導) | 128K |
| 12B | 無對應;最接近的是 26B-A4B | 3.8B(總計 25.2B,已確認) | 256K |
| 27B | 31B Dense | 31B(Dense,全部啟用) | 256K |
26B-A4B 一列直接依模型自身公開的規格卡確認:總計 25.2B 參數,每個 token 透過 128 位專家中的 8 位(外加一位常駐的共享專家)啟用 3.8B 參數。E2B/E4B 的「有效參數」數字,來自彙整型模型清單的報導,並非本次研究直接開啟單一頁面所確認,因此標註為「有報導」。這四列都不是與 Gemma 3 對應型號等尺寸互換的關係——本表的用意是修正對應關係,而非宣稱某個 Gemma 4 模型等同於某個 Gemma 3 模型。
補充
Ollama 與 Apple Silicon 上已知的摩擦點 已確認,但範圍比最初報導的窄
僅限 31B Dense
Flash Attention 滯死問題
- 在 Nvidia CUDA 硬體(RTX 3090)上,prompt 超過約 3,000 至 4,000 個 token 時會出現此問題;在 Apple Silicon(M5 Max)上,則是 prompt 超過約 500 個 token 時另外出現同樣問題。
- 報導指出的根本原因:Gemma 4 混合了約五十層 sliding-window attention 與十層 global attention,兩者使用不同的 head 維度(256 對 512),而 Ollama 的 Flash Attention 實作原本並未正確處理這種混合。
- 至少有一份報告明確指出,本文推薦的 26B-A4B 模型可正常處理同樣長度的 prompt,不受影響;此錯誤僅限於 31B Dense。
仍未解決
Qwen 3.5 27B 的 tool calling
- 報告中同時指出三個獨立問題:取樣懲罰(sampling penalty)被靜默忽略、未封閉的
<think>標籤污染了後續對話輪次,以及 Ollama 正確的 tool-calling renderer 只被接到「qwen3-coder」這個模型名稱,而非「qwen3.5」。 - 取樣懲罰的錯誤已於 v0.17.5 修復;但 renderer 對應錯誤,截至找到的報告為止仍未解決。
- 報告中同時指出三個獨立問題:取樣懲罰(sampling penalty)被靜默忽略、未封閉的
尚未加速
Gemma 4 在 Apple Silicon 上尚無 MLX 加速
- Ollama 的 Apple Silicon 版本通常會使用 Apple 的 MLX 框架來加速;但有報告發現 Gemma 4 反而退回較慢的 llama.cpp 後端,在 31B Dense 上約為每秒 15 個 token,在 26B-A4B 上約為每秒 75 個 token。
- 本次研究並未找到 Gemma 4 在 Apple Silicon 上使用 MLX 加速的數據;一旦推出,這兩個數字應會提升。
從 M3 Pro 到 M5 Max 同一個取捨,走過三年
Apple 的自研晶片並非首次在記憶體帶寬上有所取捨:2023 年 10 月推出的 M3 Pro,帶寬僅 150GB/s,較 M2 Pro 的 200GB/s 削減 25%,記憶體匯流排也更窄——這提醒買家,晶片型號較新,並不代表帶寬必然更高,而這正是模型全天候串流自身權重時真正會遇到的瓶頸。2026 年 3 月發布的 M5 Pro 與 M5 Max 則反其道而行:採用全新的雙晶粒「Fusion Architecture」,依 Apple 自身數據,GPU 運算能力是上一代的四倍以上,頂規 128GB 版本的統一記憶體帶寬更高達 614GB/s。某測評部落格自稱「估算值」的測試顯示,M5 Max 在多個模型尺寸上勝過 M5 Pro 與作為對照組的 RTX 4090,不過 Apple 官方發佈本身並未針對任何模型給出每秒 token 數。
兩套 CLI,兩種接法 不同協定,不同時程
| 項目 | Claude Code | Copilot CLI |
|---|---|---|
| 原生本機模型支援 | 是,自 Ollama v0.14 起(2026 年 1 月) | 是,自備金鑰(BYOK),自 2026 年 6 月起 |
| 連線協定 | Anthropic Messages API | 相容 OpenAI/外部供應商 |
| 設定方式 | 將 ANTHROPIC_BASE_URL 指向本機 Ollama 伺服器 | 在 CLI 的模型選擇器中設定本機或外部模型 |
結論
哪一台 Mac,適合做什麼 看合適與否,而非誰是贏家
入門選擇
先用小模型練手
- 適合對象:剛接觸本機推論、想先試試小型 agent(8B 級 Dense 模型)、又不想花太多錢的人。
- 最擅長之處:Apple 自家入門款 Mac mini(16GB/256GB,2026 年 8 月為 NT$26,900)安靜、耗電低,且不需額外安裝任何東西,開箱即可搭配 Ollama 使用。
- 取捨:Apple 的記憶體與儲存客製選項是透過設定頁計價,並非公開標價,因此請以「高於入門款的一筆額外預算」估算,而非以固定數字計算。
甜蜜點
從容跑起 Gemma 4 的 26B-A4B
- 適合對象:想使用本報告認為是本機 agentic 甜蜜點的那個模型、並保留一些餘裕給其 256K context 的人。
- 最擅長之處:更多統一記憶體(24GB 以上)才是真正換來 agent 反應速度的關鍵,因為這樣才能讓模型的啟用參數與 KV cache,在不需置換(swap)的情況下與作業系統共存。
- 取捨:Apple 的記憶體與儲存客製選項是透過設定頁計價,並非公開標價,因此請以「高於入門款的一筆額外預算」估算,而非以固定數字計算。
本機能力的極限
預算夠的話,選 M5 Max
- 適合對象:想在本機執行最大型模型、且願意為此付費的人。
- 最擅長之處:依 Apple 自身公佈的數據,統一記憶體帶寬高達 614GB/s,GPU 運算能力是上一代的四倍以上。
- 取捨:目前僅有 MacBook Pro 機型可選,長時間推論有降頻風險;某測評部落格指出,對應的桌上型 Mac Studio 機型尚未推出。
根本不用 Mac
NVIDIA 主機,或雲端
- 適合對象:已擁有夠力 NVIDIA 硬體的人,或完全不想處理 Ollama 版本與 KV cache 參數設定的人。
- 最擅長之處:NVIDIA 顯卡的 VRAM 專屬於模型使用,不與作業系統共享;而雲端 API 則完全省去版本與設定管理的麻煩。
- 取捨:NVIDIA GPU 持續運作的耗電量,眾所周知遠高於 Apple Silicon Mac;且無論哪一種方式,都不像已買下的 Mac 那樣,每個 token 皆私密且免費。
總結
自四月以來,真正改變的並非核心論點——KV cache 與 prefill 仍然比 context 長度更能決定 agent 體感——而是實現它所需的價格。Apple 自家 Mac mini 目前的售價,已明顯高於本報告首次撰寫時;本報告過去曾標注價格的中階配置,如今已無法重新確認;此外,兩個真實存在的 Ollama 錯誤,也影響了哪個 Gemma 4 尺寸才真正安全可用。這些變化都不會改變該選用哪個模型,改變的是成本——購買前,值得自行核實目前的價格。