Tratopedia
ES
Tetapan

Saiz teks

Tema

Kontras tinggi

Versi

v1.177.0

Keluaran yang menjadi asas halaman ini dibina. Itulah versi yang disimpan oleh service worker.

Inferens setempat · Model bahasa · Apple Silicon · Ejen AI · Laporan teknikalGemma 4 April 2026, rekod hingga September 2026

Gemma 4 · Apple Silicon · Claude Code dan Copilot CLI, empat bulan kemudian

Halangan sebenar ialah cache KV dan prapengisian, bukan had konteks

Laporan ini mengira apa yang diperlukan untuk menjalankan Gemma 4 milik Google secara setempat pada Mac, di belakang alat CLI agentik seperti Claude Code atau GitHub Copilot CLI. Kesimpulannya dahulu: apa yang menentukan rasa penggunaan ejen ialah kelajuan prapengisian dan jejak cache KV, bukan berapa banyak konteks yang boleh diterima model — itu juga sebabnya model campuran pakar 26B-A4B Gemma 4, dengan hanya 3.8B parameter aktif bagi setiap token, menjadi titik optimum untuk kerja agentik setempat. Sejak April 2026 Apple telah menaikkan harga Mac dua kali sejak itu, dan dua pepijat Ollama yang benar kini menentukan saiz Gemma 4 mana yang sebenarnya selamat dijalankan.

  • 3.8Bparameter aktif dalam model 26B-A4B yang disyorkan di bawah, daripada jumlah 25.2B
  • 256Kkonteks maksimum pada tiga model Gemma 4 yang lebih besar — 12B, 26B-A4B dan 31B
  • +35%kenaikan harga Mac mini peringkat masuk di Taiwan sejak April 2026
  • 614 GB/slebar jalur memori bersatu M5 Max Apple, pada 128GB

Tentang harga di sini

Setiap harga di bawah ialah harga runcit Apple sendiri di Taiwan seperti yang disenaraikan pada 25 Ogos 2026, atau harga AS seperti yang dilaporkan pada tarikh di sebelahnya. Ini tahun ketika kos memori dan storan bergerak dengan tajam — antara Mei dan Jun sahaja Apple menaikkan harga Mac mini dua kali — jadi semak harga semasa sebelum membeli dan jangan bergantung pada angka yang tercetak di sini. Apple mula menjual Mac mini baharu, dengan M6 atau M5 Pro, pada 22 September 2026; harga dan cadangan Mac mini di bawah ialah bagi barisan M4 pada Ogos 2026. Tiada satu pun daripada ini nasihat pembelian.

Apa Yang Berubah Pada 2026 Digredkan mengikut tahap pengesahan, paling kukuh dahulu

KedudukanApa Yang BerlakuButiran
DisahkanGemma 4 menggantikan penamaan Gemma 3Google DeepMind melancarkan Gemma 4 pada 2 April 2026 dalam empat saiz — E2B, E4B, 26B-A4B dan 31B — dan menambah saiz kelima, 12B, pada 3 Jun 2026; ia menggantikan barisan 1B/4B/12B/27B Gemma 3 dari Mac 2025.
DisahkanApple menaikkan harga Mac mini dua kaliHarga efektif AS bagi konfigurasi peringkat masuk naik daripada AS$599 kepada AS$799 pada Mei 2026, dan harga permulaan M4 Pro naik daripada AS$1,399 kepada AS$1,599 pada Jun. Apple memberitahu Wall Street Journal, seperti dipetik oleh MacRumors, bahawa itu kenaikan kos komponen paling tajam yang pernah dilihatnya, berkait dengan permintaan pusat data AI terhadap memori dan storan.
DisahkanKedua-dua CLI pengekodan utama kini boleh mencapai model setempatOllama menambah API serasi Anthropic secara asli pada Januari 2026, jadi Claude Code boleh menuju terus ke pelayan setempat. GitHub Copilot CLI menambah sokongan bawa kunci sendiri (BYOK), termasuk model setempat, pada Jun 2026.
Disahkan, satu saiz model sahajaKebuntuan flash-attention menjejaskan satu saiz Gemma 4, bukan yang disyorkan di siniPengguna Ollama pada CUDA Nvidia dan Apple Silicon melaporkan model 31B Dense Gemma 4 tergantung tanpa had di bawah Flash Attention pada gesaan panjang. Sekurang-kurangnya satu laporan menyatakan model 26B-A4B yang disyorkan di halaman ini tidak terjejas oleh gesaan yang sama.
Disahkan, masih terbukaPanggilan alat Qwen 3.5 27B pada Ollama kekal rosakPepijat penalti pengulangan telah ditampal dalam v0.17.5, tetapi kerosakan yang lebih mendalam — pemapar panggilan alat Ollama yang betul disambungkan kepada nama model yang salah — masih terbuka setakat laporan terakhir.
Dilaporkan, tidak disahkan secara bebasM5 Max lebih pantas untuk inferens setempat, tetapi berapa banyak tidak jelasPengumuman Apple sendiri menyatakan gandaan pengkomputeran GPU dan grafik, bukan token sesaat; angka daya pemprosesan LLM pula datang daripada blog penanda aras yang melabelkan angkanya sendiri sebagai “Anggaran.”

Empat Tahun Cip dan Model Latar belakang dahulu, kemudian tahun yang diliputi laporan ini

  1. 2023Apple memotong lebar jalur memori M3 Pro kepada 150GB/s, daripada 200GB/s pada M2 Pro — latar belakang yang berguna, kerana pembeli Mac sering membandingkan merentas generasi cip.
  2. 2024.10Mac mini M4 dan M4 Pro dilancarkan; konfigurasi permulaan Taiwan (16GB/256GB) berharga NT$19,900.
  3. 2025.03Google DeepMind melancarkan Gemma 3, dalam saiz 1B/4B/12B/27B.
  4. 2026.01Ollama melancarkan API serasi Anthropic secara asli (v0.14), membolehkan Claude Code berjalan terus terhadap model setempat.
  5. 2026.03Apple mengumumkan M5 Pro dan M5 Max, dengan lebar jalur memori bersatu sehingga 614GB/s.
  6. 2026.04.02Google DeepMind melancarkan Gemma 4 dalam empat saiz — E2B, E4B, 26B-A4B, 31B.
  7. 2026.04Pengguna Ollama pada CUDA dan, secara berasingan, pada Apple Silicon melaporkan model 31B Dense Gemma 4 tergantung di bawah Flash Attention pada gesaan panjang.
  8. 2026.05.01Apple berhenti menjual konfigurasi Mac mini paling murah; harga permulaan efektif naik daripada AS$599 kepada AS$799.
  9. 2026.06.03Google menambah saiz Gemma 4 kelima, 12B “Unified”, tanpa pengekod imej atau audio yang berasingan.
  10. 2026.06.17GitHub Copilot CLI menambah sokongan bawa kunci sendiri (BYOK) bagi model setempat dan luaran.
  11. 2026.06.25Apple menaikkan harga permulaan Mac mini M4 Pro daripada AS$1,399 kepada AS$1,599, dan mengembalikan konfigurasi permulaan yang dihentikan pada harga baharu yang lebih tinggi.
  12. 2026.08.25Kedai Apple Taiwan menyenaraikan Mac mini dari NT$26,900, dan konfigurasi M4 Pro-nya pada NT$54,900 dan NT$61,900.
  13. 2026.09.22Apple mula menjual Mac mini baharu, dengan M6 atau M5 Pro, dan Mac Studio dengan M5 Max atau M5 Ultra.

Mengapa Panjang Konteks Bukan Angka Yang Perlu Diperhati Prapengisian dan Cache KV, Bukan Had Token

Alat CLI agentik menghantar semula seluruh keadaan kerjanya — gesaan sistem, skema alat, dan transkrip yang sedang berjalan — pada setiap giliran. Bagi ejen pengekodan itu boleh menjadi beribu-ribu token sebelum model menghasilkan satu perkataan baharu, dan memproses semula keadaan itu, dipanggil prapengisian, adalah apa yang sebenarnya perlu dikejar oleh lebar jalur memori Mac. Panjang konteks hanya membataskan berapa lama sesi boleh berjalan; ia tidak menyatakan apa-apa tentang bagaimana rasa sesi itu, giliran demi giliran. Apa yang menentukan rasa itu ialah kelajuan prapengisian, dan berapa banyak memori yang diduduki oleh cache KV — ingatan yang sedang berjalan bagi semua yang telah diproses — bersama pemberat model itu sendiri.

  • 1,024token: saiz tetingkap gelongsor yang membataskan kebanyakan lapisan perhatian Gemma 4, mengikut spesifikasi rasmi model itu sendiri.
  • ×0.5Mengkuantumkan cache KV daripada titik terapung 16-bit kepada integer 8-bit terus mengurangkan jejak memorinya kepada separuh — fakta definisi bagi format itu sendiri, bukan penanda aras yang diukur.

Penamaan Yang Sering Disalahfaham Gemma 4 Bukan 1B/4B/12B/27B

Yang Lazim DisebutSKU Gemma 4ParameterKonteks Maksimum
1BE2B2.3B berkesan (5.1B dengan benaman)128K
4BE4B4.5B berkesan (8B dengan benaman)128K
12B12B Unified (padat)11.95B (padat, semua aktif)256K
Tiada padanan Gemma 326B-A4B (campuran pakar)3.8B aktif daripada jumlah 25.2B256K
27B31B padat30.7B (padat, semua aktif)256K

Setiap baris dibaca daripada kad model Google sendiri. Dalam E2B dan E4B, “E” bermaksud parameter berkesan: setiap lapisan membawa jadual benamannya sendiri, yang besar tetapi hanya digunakan untuk carian pantas, jadi kiraan berkesan (2.3B, 4.5B) jauh lebih kecil daripada jumlah dengan benaman (5.1B, 8B). Dalam 26B-A4B, “A” bermaksud aktif: 3.8B daripada 25.2B parameternya bekerja pada setiap token, melalui lapan daripada 128 pakar ditambah satu pakar kongsi yang sentiasa aktif. Model 12B mengekalkan saiz Gemma 3 tetapi bukan reka bentuknya — “Unified” bermaksud ia tiada pengekod imej atau audio yang berasingan, dan menyalurkan kedua-duanya terus ke dalam model bahasa. Tiada satu pun daripada baris ini pengganti setara bagi rakan sejawat Gemma 3-nya — jadual ini wujud untuk membetulkan pemadanan, bukan untuk mengisytiharkan satu model Gemma 4 setara dengan satu model Gemma 3.

Geseran Yang Diketahui pada Ollama dan Apple Silicon Benar, dan setiap satu lebih sempit daripada bunyinya

  • 31B Dense Sahaja

    Kebuntuan Flash-Attention

    • Dilaporkan pada perkakasan Nvidia CUDA (RTX 3090) bagi gesaan melebihi kira-kira 3,000–4,000 token, dan secara berasingan pada Apple Silicon (M5 Max) bagi gesaan melebihi kira-kira 500 token.
    • Punca utama yang dilaporkan: Gemma 4 mencampurkan kira-kira lima puluh lapisan perhatian tetingkap gelongsor dengan sepuluh lapisan perhatian global, dan kedua-duanya menggunakan dimensi kepala yang berbeza (256 berbanding 512) yang tidak dikendalikan dengan betul oleh pelaksanaan Flash Attention Ollama pada asalnya.
    • Sekurang-kurangnya satu laporan menyatakan dengan jelas bahawa model 26B-A4B — yang disyorkan di halaman ini — mengendalikan gesaan panjang yang sama tanpa masalah; pepijat ini khusus kepada 31B Dense.
  • Masih Terbuka

    Panggilan Alat Qwen 3.5 27B

    • Tiga kerosakan berasingan dilaporkan serentak: penalti persampelan diabaikan secara senyap, tag <think> yang tidak ditutup merosakkan giliran seterusnya, dan pemapar panggilan alat Ollama yang betul disambungkan hanya kepada nama model “qwen3-coder,” bukan “qwen3.5.”
    • Pepijat penalti persampelan telah ditampal dalam v0.17.5; percanggahan pemapar masih terbuka setakat laporan terakhir.
  • Belum Dipercepatkan

    Gemma 4 Berjalan Tanpa MLX pada Apple Silicon

    • Binaan Ollama untuk Apple Silicon biasanya menggunakan rangka kerja MLX Apple untuk kelajuan; satu laporan mendapati Gemma 4 kembali menggunakan bahagian belakang llama.cpp yang lebih perlahan, pada kira-kira 15 token sesaat bagi 31B Dense dan kira-kira 75 bagi 26B-A4B.
    • Belum ada angka Gemma 4 yang dipercepatkan MLX pada Apple Silicon untuk dibandingkan; jika dan apabila sokongan MLX tiba, kedua-dua angka sepatutnya meningkat.

Dari M3 Pro kepada M5 Max Tiga Tahun Pertukaran Yang Sama

Barisan Silicon Apple pernah membuat pertukaran pada lebar jalur memori sebelum ini: M3 Pro dikeluarkan pada Oktober 2023 dengan 150GB/s, potongan 25% daripada 200GB/s M2 Pro, pada bas memori yang lebih sempit — peringatan bahawa nombor cip yang lebih baharu tidak semestinya bermaksud lebih banyak lebar jalur bagi model yang perlu menstrim pemberatnya sendiri melepasi kesesakan sepanjang masa. M5 Pro dan M5 Max, diumumkan Mac 2026, bergerak ke arah sebaliknya: “Fusion Architecture” dua-die yang baharu, lebih empat kali ganda pengkomputeran GPU generasi sebelumnya mengikut angka Apple sendiri, dan lebar jalur memori bersatu sehingga 614GB/s pada konfigurasi 128GB tertinggi. Ujian blog penanda aras yang melabelkan dirinya sendiri sebagai “Anggaran” meletakkan M5 Max mendahului M5 Pro dan RTX 4090 rujukan pada beberapa saiz model, walaupun pengumuman Apple sendiri tidak menyatakan angka token sesaat bagi mana-mana model.

Dua CLI, Dua Cara Masuk Protokol Berbeza, Garis Masa Berbeza

PerkaraClaude CodeCopilot CLI
Sokongan model setempat asliYa, sejak Ollama v0.14 (Jan 2026)Ya, bawa kunci sendiri (BYOK), sejak Jun 2026
ProtokolAnthropic Messages APISerasi OpenAI / pembekal luaran
PersediaanTujukan ANTHROPIC_BASE_URL kepada pelayan Ollama setempatKonfigurasikan model setempat atau luaran dalam pemilih model CLI

Mac Yang Mana, Untuk Apa Kesesuaian, Bukan Pemenang

  • Titik Permulaan

    Belajar Asas dengan Model Kecil

    • Untuk siapa: seseorang yang baharu dalam inferens setempat yang mahu mencuba ejen kecil — model padat kelas 8B — tanpa membelanjakan banyak wang.
    • Terbaik pada: Mac mini M4 permulaan Apple (16GB/256GB, NT$26,900 di kedai Apple Taiwan pada Ogos 2026) senyap, menjimatkan kuasa, dan tidak memerlukan apa-apa selain Ollama sedia ada untuk bermula. Itu barisan Ogos 2026: Mac mini baharu, dengan M6 atau M5 Pro, mula dijual pada 22 September 2026.
    • Pertukaran: Apple menetapkan harga memori dan storan tempahan khas melalui pengkonfigurasinya, bukan sebagai angka tersenarai, jadi bajetkan premium berbanding peringkat permulaan dan bukan angka tetap.
  • Titik Optimum

    26B-A4B Gemma 4, Dengan Selesa

    • Untuk siapa: seseorang yang mahu model khusus yang dihujahkan laporan ini sebagai titik optimum agentik setempat, dengan ruang lebih untuk konteks 256K-nya.
    • Terbaik pada: lebih banyak memori bersatu (24GB atau lebih) itulah yang sebenarnya membeli responsif ejen di sini, kerana itulah yang membolehkan parameter aktif model dan cache KV-nya duduk bersama OS tanpa swap.
    • Pertukaran: Apple menetapkan harga memori dan storan tempahan khas melalui pengkonfigurasinya, bukan sebagai angka tersenarai, jadi bajetkan premium berbanding peringkat permulaan dan bukan angka tetap.
  • Keupayaan Setempat Maksimum

    M5 Max, Jika Bajet Mencukupi

    • Untuk siapa: seseorang yang mahu menjalankan model terbesar secara setempat dan sanggup membayar untuknya.
    • Terbaik pada: sehingga 614GB/s lebar jalur memori bersatu dan lebih empat kali ganda pengkomputeran GPU generasi sebelumnya, mengikut angka rasmi Apple sendiri.
    • Pertukaran: Apple memperkenalkan M5 Max pada Mac 2026 untuk MacBook Pro, sebuah komputer riba; pilihan meja, Mac Studio dengan M5 Max, hanya mula dijual pada 22 September 2026, dari US$2,499 di Amerika Syarikat.
  • Bukan pada Mac Langsung

    Mesin NVIDIA, atau Awan

    • Untuk siapa: seseorang yang sudah memiliki perkakasan NVIDIA yang mampu, atau yang langsung tidak mahu menguruskan versi Ollama dan bendera cache KV.
    • Terbaik pada: VRAM kad NVIDIA didedikasikan untuk model dan bukan dikongsi dengan OS, dan API awan menghapuskan sepenuhnya pengurusan versi dan konfigurasi.
    • Pertukaran: kuasa. NVIDIA menetapkan kad RTX 4090 sahaja pada 450W jumlah kuasa grafik dan 19W ketika melahu, serta menyarankan bekalan kuasa sistem 850W; Apple mengukur Mac Studio asas dengan M5 Max, keseluruhan komputer di soket dinding, pada 200W maksimum dan 7W ketika melahu. Dan API awan tidak persendirian dan tidak percuma bagi setiap token, sebagaimana mesin yang sudah dimiliki pembeli.

Kesimpulannya

Apa yang menentukan rasa ejen tidak berubah — cache KV dan prapengisian masih lebih penting daripada panjang konteks — tetapi kos untuk melaksanakannya telah berubah. Apple menaikkan harga Mac mini dua kali pada Mei dan Jun 2026, ia menetapkan harga naik taraf memori tempahan khas hanya melalui pengkonfigurasinya, dan dua pepijat Ollama yang benar menentukan saiz Gemma 4 mana yang sebenarnya selamat dijalankan. Tiada satu pun daripada itu mengubah model mana yang perlu dijalankan; ia mengubah kosnya, dan berbaloi untuk menyemak harga semasa sendiri sebelum membeli.

Perkara yang tidak dapat disahkan

Satu dakwaan tidak dapat disahkan apabila dicari pada 28 Sep 2026, jadi halaman ini tidak menegaskannya. “Inferens berterusan berisiko mengalami sekatan haba”, tentang M5 Max dalam casis MacBook Pro — Laporan belum disahkan: satu panduan penyelesaian masalah yang diterbitkan menyatakan bahawa setiap casis komputer riba akhirnya menjadi perlahan di bawah inferens berterusan, jadi idea itu mempunyai pencerita yang boleh dikenal pasti, tetapi tiada ukuran sekatan haba yang diterbitkan bagi MacBook Pro M5 Max ditemui.

Sumber: blog The Keyword Google (Gemma 4, 2 Apr 2026; Gemma 4 12B, 3 Jun 2026); Google Developers Blog dan Android Developers Blog; weblog Simon Willison (12 Mac 2025); Hugging Face (google/gemma-4-E2B, -E4B, -12B dan -26B-A4B; penyenaraian GGUF Gemma 4 Unsloth); MacRumors (25 Jun 2026, 1 Mei 2026, 31 Okt 2023); NewMobileLife (26 Jun 2026); kedai Apple Taiwan, dicapai 25 Ogos 2026; PChome 24h 購物; kocpc.com.tw; isu GitHub #15350, #15368 dan #14493 pada ollama/ollama, dibaca hanya melalui carian; blog Ollama (16 Jan 2026) dan nota keluaran v0.14.0; log perubahan GitHub sendiri (17 Jun 2026); Apple Newsroom (M5 Pro/M5 Max, 3 Mac 2026; Mac mini dan Mac Studio, 22 Sep 2026); Sokongan Apple (penggunaan kuasa Mac Studio, 21 Sep 2026); NVIDIA (spesifikasi GeForce RTX 4090); halaman penanda aras PromptQuorum yang melabelkan dirinya sendiri sebagai “Anggaran.” Tiada satu pun daripada ini nasihat pembelian.

Versi

Dokumen ini ditulis semula apabila kandungannya perlu berubah. Setiap versi kekal diterbitkan di alamatnya sendiri.

  1. v0002 semasa
  2. v0001 digantikan

Versi semasa juga berada di latest/.