Tratopedia
ES
Tetapan

Saiz teks

Tema

Kontras tinggi

Versi

v1.81.0

Keluaran yang menjadi asas halaman ini dibina. Itulah versi yang disimpan oleh service worker.

Inferens setempat · Model bahasa · Apple Silicon · Ejen AI · Laporan teknikalGemma 4 April 2026, rekod hingga Ogos 2026

Gemma 4 · Apple Silicon · Claude Code dan Copilot CLI, empat bulan kemudian

Halangan sebenar ialah cache KV dan prapengisian, bukan had konteks

Laporan ini mengira apa yang diperlukan untuk menjalankan Gemma 4 milik Google secara setempat pada Mac, di belakang alat CLI agentik seperti Claude Code atau GitHub Copilot CLI. Kesimpulannya dahulu: apa yang menentukan rasa penggunaan ejen ialah kelajuan prapengisian dan jejak cache KV, bukan berapa banyak konteks yang boleh diterima model — itu juga sebabnya model campuran pakar 26B-A4B Gemma 4, dengan hanya 3.8B parameter aktif bagi setiap token, menjadi titik optimum untuk kerja agentik setempat. Sejak April 2026 Apple telah menaikkan harga Mac dua kali sejak itu, dan dua pepijat Ollama yang benar kini menentukan saiz Gemma 4 mana yang sebenarnya selamat dijalankan.

  • 3.8Bparameter aktif dalam model 26B-A4B yang disyorkan di bawah, daripada jumlah 25.2B
  • 256Kkonteks maksimum pada tiga model Gemma 4 yang lebih besar — 12B, 26B-A4B dan 31B
  • +35%kenaikan harga Mac mini peringkat masuk di Taiwan sejak April 2026
  • 614 GB/slebar jalur memori bersatu M5 Max Apple, pada 128GB

Tentang harga di sini

Setiap harga di bawah ialah harga runcit Apple sendiri di Taiwan seperti yang disenaraikan pada 25 Ogos 2026, atau harga AS seperti yang dilaporkan pada tarikh di sebelahnya. Ini tahun ketika kos memori dan storan bergerak dengan tajam — antara Mei dan Jun sahaja Apple menaikkan harga Mac mini dua kali — jadi semak harga semasa sebelum membeli dan jangan bergantung pada angka yang tercetak di sini. Tiada satu pun daripada ini nasihat pembelian.

Apa Yang Berubah Sejak April Digredkan mengikut tahap pengesahan, paling kukuh dahulu

KedudukanApa Yang BerlakuButiran
DisahkanGemma 4 menggantikan penamaan Gemma 3Google DeepMind melancarkan Gemma 4 pada 2 April 2026 dalam lima saiz — E2B, E4B, 12B, 26B-A4B dan 31B — menggantikan barisan 1B/4B/12B/27B Gemma 3 dari Mac 2025.
DisahkanApple menaikkan harga Mac mini dua kaliHarga efektif AS bagi konfigurasi peringkat masuk naik daripada AS$599 kepada AS$799 pada Mei 2026, dan harga permulaan M4 Pro naik daripada AS$1,399 kepada AS$1,599 pada Jun. Apple memberitahu Wall Street Journal, seperti dipetik oleh MacRumors, bahawa itu kenaikan kos komponen paling tajam yang pernah dilihatnya, berkait dengan permintaan pusat data AI terhadap memori dan storan.
DisahkanKedua-dua CLI pengekodan utama kini boleh mencapai model setempatOllama menambah API serasi Anthropic secara asli pada Januari 2026, jadi Claude Code boleh menuju terus ke pelayan setempat. GitHub Copilot CLI menambah sokongan bawa kunci sendiri (BYOK), termasuk model setempat, pada Jun 2026.
Disahkan, lebih sempit daripada laporan awalKebuntuan flash-attention menjejaskan satu saiz Gemma 4, bukan yang disyorkan di siniPengguna Ollama pada CUDA Nvidia dan Apple Silicon melaporkan model 31B Dense Gemma 4 tergantung tanpa had di bawah Flash Attention pada gesaan panjang. Sekurang-kurangnya satu laporan menyatakan model 26B-A4B yang disyorkan di halaman ini tidak terjejas oleh gesaan yang sama.
Disahkan, masih terbukaPanggilan alat Qwen 3.5 27B pada Ollama kekal rosakPepijat penalti pengulangan telah ditampal dalam v0.17.5, tetapi kerosakan yang lebih mendalam — pemapar panggilan alat Ollama yang betul disambungkan kepada nama model yang salah — masih terbuka setakat laporan yang ditemui.
Dilaporkan, tidak disahkan secara bebasM5 Max lebih pantas untuk inferens setempat, tetapi berapa banyak tidak jelasPengumuman Apple sendiri menyatakan gandaan pengkomputeran GPU dan grafik, bukan token sesaat; satu-satunya angka daya pemprosesan LLM yang ditemui diterbitkan oleh blog penanda aras yang melabelkan angkanya sendiri sebagai “Anggaran.”

Empat Tahun Cip dan Model Latar belakang dahulu, kemudian tahun yang diliputi laporan ini

  1. 2023Apple memotong lebar jalur memori M3 Pro kepada 150GB/s, daripada 200GB/s pada M2 Pro — latar belakang yang berguna, kerana pembeli Mac sering membandingkan merentas generasi cip.
  2. 2024.10Mac mini M4 dan M4 Pro dilancarkan; konfigurasi permulaan Taiwan (16GB/256GB) berharga NT$19,900.
  3. 2025.03Google DeepMind melancarkan Gemma 3, dalam saiz 1B/4B/12B/27B.
  4. 2026.01Ollama melancarkan API serasi Anthropic secara asli (v0.14), membolehkan Claude Code berjalan terus terhadap model setempat.
  5. 2026.03Apple mengumumkan M5 Pro dan M5 Max, dengan lebar jalur memori bersatu sehingga 614GB/s.
  6. 2026.04.02Google DeepMind melancarkan Gemma 4 — E2B, E4B, 12B, 26B-A4B, 31B.
  7. 2026.04Pengguna Ollama pada CUDA dan, secara berasingan, pada Apple Silicon melaporkan model 31B Dense Gemma 4 tergantung di bawah Flash Attention pada gesaan panjang.
  8. 2026.05.01Apple berhenti menjual konfigurasi Mac mini paling murah; harga permulaan efektif naik daripada AS$599 kepada AS$799.
  9. 2026.06.17GitHub Copilot CLI menambah sokongan bawa kunci sendiri (BYOK) bagi model setempat dan luaran.
  10. 2026.06.25Apple menaikkan harga permulaan Mac mini M4 Pro daripada AS$1,399 kepada AS$1,599, dan mengembalikan konfigurasi permulaan yang dihentikan pada harga baharu yang lebih tinggi.
  11. 2026.08.25Kedai Apple Taiwan menyenaraikan Mac mini dari NT$26,900, dan konfigurasi M4 Pro-nya pada NT$54,900 dan NT$61,900.

Mengapa Panjang Konteks Bukan Angka Yang Perlu Diperhati Prapengisian dan Cache KV, Bukan Had Token

Alat CLI agentik menghantar semula seluruh keadaan kerjanya — gesaan sistem, skema alat, dan transkrip yang sedang berjalan — pada setiap giliran. Bagi ejen pengekodan itu boleh menjadi beribu-ribu token sebelum model menghasilkan satu perkataan baharu, dan memproses semula keadaan itu, dipanggil prapengisian, adalah apa yang sebenarnya perlu dikejar oleh lebar jalur memori Mac. Panjang konteks hanya membataskan berapa lama sesi boleh berjalan; ia tidak menyatakan apa-apa tentang bagaimana rasa sesi itu, giliran demi giliran. Apa yang menentukan rasa itu ialah kelajuan prapengisian, dan berapa banyak memori yang diduduki oleh cache KV — ingatan yang sedang berjalan bagi semua yang telah diproses — bersama pemberat model itu sendiri.

  • 1,024token: saiz tetingkap gelongsor yang membataskan kebanyakan lapisan perhatian Gemma 4, mengikut spesifikasi rasmi model itu sendiri.
  • ×0.5Mengkuantumkan cache KV daripada titik terapung 16-bit kepada integer 8-bit terus mengurangkan jejak memorinya kepada separuh — fakta definisi bagi format itu sendiri, bukan penanda aras yang diukur.

Penamaan Yang Sering Disalahfaham Gemma 4 Bukan 1B/4B/12B/27B

Yang Lazim DisebutSKU Gemma 4Parameter AktifKonteks Maksimum
1BE2B~2.3B (dilaporkan)128K
4BE4B~4.5B (dilaporkan)128K
12BTiada setara; yang paling hampir ialah 26B-A4B3.8B daripada jumlah 25.2B (disahkan)256K
27B31B padat31B (padat, semua aktif)256K

Baris 26B-A4B disahkan terus daripada kad rasmi model itu sendiri: 25.2B jumlah parameter, 3.8B aktif bagi setiap token melalui lapan daripada 128 pakar (ditambah satu pakar kongsi yang sentiasa aktif). Angka “parameter berkesan” E2B/E4B dilaporkan oleh penyenaraian model teragregat dan bukan disahkan pada satu halaman yang dibuka terus dalam penyelidikan ini, dan ditanda sewajarnya. Tiada satu pun daripada empat baris ini pengganti bersaiz sama bagi rakan sejawat Gemma 3-nya — jadual ini wujud untuk membetulkan pemadanan, bukan untuk mengisytiharkan satu model Gemma 4 setara dengan satu model Gemma 3.

Geseran Yang Diketahui pada Ollama dan Apple Silicon Disahkan, tetapi lebih sempit daripada laporan awal

  • 31B Dense Sahaja

    Kebuntuan Flash-Attention

    • Dilaporkan pada perkakasan Nvidia CUDA (RTX 3090) bagi gesaan melebihi kira-kira 3,000–4,000 token, dan secara berasingan pada Apple Silicon (M5 Max) bagi gesaan melebihi kira-kira 500 token.
    • Punca utama yang dilaporkan: Gemma 4 mencampurkan kira-kira lima puluh lapisan perhatian tetingkap gelongsor dengan sepuluh lapisan perhatian global, dan kedua-duanya menggunakan dimensi kepala yang berbeza (256 berbanding 512) yang tidak dikendalikan dengan betul oleh pelaksanaan Flash Attention Ollama pada asalnya.
    • Sekurang-kurangnya satu laporan menyatakan dengan jelas bahawa model 26B-A4B — yang disyorkan di halaman ini — mengendalikan gesaan panjang yang sama tanpa masalah; pepijat ini khusus kepada 31B Dense.
  • Masih Terbuka

    Panggilan Alat Qwen 3.5 27B

    • Tiga kerosakan berasingan dilaporkan serentak: penalti persampelan diabaikan secara senyap, tag <think> yang tidak ditutup merosakkan giliran seterusnya, dan pemapar panggilan alat Ollama yang betul disambungkan hanya kepada nama model “qwen3-coder,” bukan “qwen3.5.”
    • Pepijat penalti persampelan telah ditampal dalam v0.17.5; percanggahan pemapar masih terbuka setakat laporan yang ditemui.
  • Belum Dipercepatkan

    Gemma 4 Berjalan Tanpa MLX pada Apple Silicon

    • Binaan Ollama untuk Apple Silicon biasanya menggunakan rangka kerja MLX Apple untuk kelajuan; satu laporan mendapati Gemma 4 kembali menggunakan bahagian belakang llama.cpp yang lebih perlahan, pada kira-kira 15 token sesaat bagi 31B Dense dan kira-kira 75 bagi 26B-A4B.
    • Tiada angka Gemma 4 yang dipercepatkan MLX pada Apple Silicon ditemui dalam penyelidikan ini; jika dan apabila satu diterbitkan, kedua-dua angka sepatutnya meningkat.

Dari M3 Pro kepada M5 Max Tiga Tahun Pertukaran Yang Sama

Barisan Silicon Apple pernah membuat pertukaran pada lebar jalur memori sebelum ini: M3 Pro dikeluarkan pada Oktober 2023 dengan 150GB/s, potongan 25% daripada 200GB/s M2 Pro, pada bas memori yang lebih sempit — peringatan bahawa nombor cip yang lebih baharu tidak semestinya bermaksud lebih banyak lebar jalur bagi model yang perlu menstrim pemberatnya sendiri melepasi kesesakan sepanjang masa. M5 Pro dan M5 Max, diumumkan Mac 2026, bergerak ke arah sebaliknya: “Fusion Architecture” dua-die yang baharu, lebih empat kali ganda pengkomputeran GPU generasi sebelumnya mengikut angka Apple sendiri, dan lebar jalur memori bersatu sehingga 614GB/s pada konfigurasi 128GB tertinggi. Ujian blog penanda aras yang melabelkan dirinya sendiri sebagai “Anggaran” meletakkan M5 Max mendahului M5 Pro dan RTX 4090 rujukan pada beberapa saiz model, walaupun pengumuman Apple sendiri tidak menyatakan angka token sesaat bagi mana-mana model.

Dua CLI, Dua Cara Masuk Protokol Berbeza, Garis Masa Berbeza

PerkaraClaude CodeCopilot CLI
Sokongan model setempat asliYa, sejak Ollama v0.14 (Jan 2026)Ya, bawa kunci sendiri (BYOK), sejak Jun 2026
ProtokolAnthropic Messages APISerasi OpenAI / pembekal luaran
PersediaanTujukan ANTHROPIC_BASE_URL kepada pelayan Ollama setempatKonfigurasikan model setempat atau luaran dalam pemilih model CLI

Mac Yang Mana, Untuk Apa Kesesuaian, Bukan Pemenang

  • Titik Permulaan

    Belajar Asas dengan Model Kecil

    • Untuk siapa: seseorang yang baharu dalam inferens setempat yang mahu mencuba ejen kecil — model padat kelas 8B — tanpa membelanjakan banyak wang.
    • Terbaik pada: Mac mini permulaan Apple sendiri (16GB/256GB, NT$26,900 setakat Ogos 2026) senyap, menjimatkan kuasa, dan tidak memerlukan apa-apa selain Ollama sedia ada untuk bermula.
    • Pertukaran: Apple menetapkan harga memori dan storan tempahan khas melalui pengkonfigurasinya, bukan sebagai angka tersenarai, jadi bajetkan premium berbanding peringkat permulaan dan bukan angka tetap.
  • Titik Optimum

    26B-A4B Gemma 4, Dengan Selesa

    • Untuk siapa: seseorang yang mahu model khusus yang dihujahkan laporan ini sebagai titik optimum agentik setempat, dengan ruang lebih untuk konteks 256K-nya.
    • Terbaik pada: lebih banyak memori bersatu (24GB atau lebih) itulah yang sebenarnya membeli responsif ejen di sini, kerana itulah yang membolehkan parameter aktif model dan cache KV-nya duduk bersama OS tanpa swap.
    • Pertukaran: Apple menetapkan harga memori dan storan tempahan khas melalui pengkonfigurasinya, bukan sebagai angka tersenarai, jadi bajetkan premium berbanding peringkat permulaan dan bukan angka tetap.
  • Keupayaan Setempat Maksimum

    M5 Max, Jika Bajet Mencukupi

    • Untuk siapa: seseorang yang mahu menjalankan model terbesar secara setempat dan sanggup membayar untuknya.
    • Terbaik pada: sehingga 614GB/s lebar jalur memori bersatu dan lebih empat kali ganda pengkomputeran GPU generasi sebelumnya, mengikut angka rasmi Apple sendiri.
    • Pertukaran: ia kini hanya tersedia dalam casis MacBook Pro, di mana inferens berterusan berisiko mengalami sekatan haba; blog penanda aras melaporkan padanan Mac Studio meja belum tersedia.
  • Bukan pada Mac Langsung

    Mesin NVIDIA, atau Awan

    • Untuk siapa: seseorang yang sudah memiliki perkakasan NVIDIA yang mampu, atau yang langsung tidak mahu menguruskan versi Ollama dan bendera cache KV.
    • Terbaik pada: VRAM kad NVIDIA didedikasikan untuk model dan bukan dikongsi dengan OS, dan API awan menghapuskan sepenuhnya pengurusan versi dan konfigurasi.
    • Pertukaran: penggunaan kuasa GPU NVIDIA berterusan diketahui umum jauh lebih tinggi daripada Mac Apple Silicon, dan kedua-dua pilihan tidak persendirian atau percuma bagi setiap token sebagaimana Mac yang sudah dibayar.

Kesimpulannya

Apa yang berubah sejak April bukanlah hujahnya — cache KV dan prapengisian masih menentukan rasa ejen lebih daripada panjang konteks — tetapi kos untuk melaksanakannya. Mac mini Apple sendiri kini kosnya jauh lebih tinggi berbanding semasa laporan ini mula-mula disiarkan, konfigurasi peringkat pertengahan khusus yang pernah dinamakan harganya oleh laporan ini tidak dapat disahkan semula, dan dua pepijat Ollama yang benar kini menentukan saiz Gemma 4 mana yang sebenarnya selamat dijalankan. Tiada satu pun daripada itu mengubah model mana yang perlu dijalankan; ia mengubah kosnya, dan berbaloi untuk menyemak harga semasa sendiri sebelum membeli.

Sumber: Google Developers Blog dan Android Developers Blog; Hugging Face (google/gemma-4-26B-A4B; penyenaraian GGUF Gemma 4 Unsloth); MacRumors (25 Jun 2026, 1 Mei 2026, 31 Okt 2023); NewMobileLife (26 Jun 2026); kedai Apple Taiwan, dicapai 25 Ogos 2026; PChome 24h 購物; kocpc.com.tw; isu GitHub #15350, #15368 dan #14493 pada ollama/ollama, dibaca hanya melalui carian; log perubahan GitHub sendiri (17 Jun 2026); Apple Newsroom (M5 Pro/M5 Max, 3 Mac 2026); halaman penanda aras PromptQuorum yang melabelkan dirinya sendiri sebagai “Anggaran.” Tiada satu pun daripada ini nasihat pembelian.