Tratopedia
EN
Ajustes

Tamaño del texto

Tema

Alto contraste

Versión

v1.81.0

La publicación con la que se generó esta página. Es la que almacena en caché el service worker.

Inferencia local · Modelos de lenguaje · Apple Silicon · Agentes de IA · Informe técnicoGemma 4 de abril de 2026, registro hasta agosto de 2026

Gemma 4 · Apple Silicon · Claude Code y Copilot CLI, cuatro meses después

El verdadero cuello de botella es la caché KV y el prellenado, no el límite de contexto

Este informe calcula qué hace falta para ejecutar Gemma 4 de Google en local en un Mac, detrás de una herramienta CLI agéntica como Claude Code o GitHub Copilot CLI. Primero la conclusión: lo que determina la sensación de uso de un agente es la velocidad de prellenado y el tamaño de la caché KV, no cuánto contexto admite el modelo — que es también la razón de que el modelo de mezcla de expertos 26B-A4B de Gemma 4, con solo 3.8B de parámetros activos por token, sea el punto óptimo para el trabajo agéntico en local. Desde abril de 2026 Apple ha subido los precios de sus Mac dos veces, y dos fallos reales de Ollama afectan ahora a qué tamaño de Gemma 4 es realmente seguro ejecutar.

  • 3.8Bparámetros activos en el modelo 26B-A4B recomendado a continuación, de 25.2B en total
  • 256Kcontexto máximo en los tres modelos mayores de Gemma 4 — 12B, 26B-A4B y 31B
  • +35%subida del precio del Mac mini de entrada en Taiwán desde abril de 2026
  • 614 GB/sancho de banda de memoria unificada del M5 Max de Apple, con 128GB

Sobre los precios

Cada precio de abajo es el precio de venta de Apple en Taiwán tal como figuraba el 25 de agosto de 2026, o un precio estadounidense según se informó en la fecha indicada junto a él. Este es un año en el que los costes de memoria y almacenamiento se han movido bruscamente — solo entre mayo y junio Apple subió dos veces el precio del Mac mini —, así que conviene comprobar la cifra actual antes de comprar en lugar de fiarse de la impresa aquí. Nada de esto es un consejo de compra.

Qué ha cambiado desde abril Clasificado según su confirmación, de mayor a menor

ConfirmaciónQué pasóDetalle
ConfirmadoGemma 4 sustituye la nomenclatura de Gemma 3Google DeepMind lanzó Gemma 4 el 2 de abril de 2026 en cinco tamaños — E2B, E4B, 12B, 26B-A4B y 31B — en sustitución de la gama 1B/4B/12B/27B de Gemma 3, de marzo de 2025.
ConfirmadoApple subió el precio del Mac mini dos vecesEl precio efectivo en EE. UU. de la configuración de entrada subió de 599 a 799 dólares en mayo de 2026, y el precio inicial del M4 Pro subió de 1,399 a 1,599 dólares en junio. Apple declaró al Wall Street Journal, citado por MacRumors, que fue la subida de coste de componentes más brusca que había visto, ligada a la demanda de memoria y almacenamiento de los centros de datos de IA.
ConfirmadoAmbas CLI de código principales ya llegan a modelos localesOllama añadió en enero de 2026 una API nativa compatible con Anthropic, de modo que Claude Code puede apuntar directamente a un servidor local. GitHub Copilot CLI añadió en junio de 2026 compatibilidad con claves propias (BYOK), incluidos modelos locales.
Confirmado, más acotado de lo inicialmente informadoUn bloqueo de flash attention afecta a un tamaño de Gemma 4, no al recomendado aquíUsuarios de Ollama tanto en CUDA de Nvidia como en Apple Silicon informan de que el modelo 31B Dense de Gemma 4 se bloquea indefinidamente con Flash Attention en prompts largos. Al menos un informe afirma que el modelo 26B-A4B recomendado en esta página no se ve afectado por los mismos prompts.
Confirmado, sigue abiertoLa llamada a herramientas de Qwen 3.5 27B en Ollama sigue rotaUn fallo de penalización por repetición se corrigió en la v0.17.5, pero el fallo más profundo — el renderizador correcto de llamada a herramientas de Ollama conectado al nombre de modelo equivocado — seguía abierto según el informe encontrado.
Reportado, no verificado de forma independienteEl M5 Max es más rápido en inferencia local, pero no está claro cuántoEl propio anuncio de Apple indica múltiplos de cómputo de GPU y de gráficos, no tokens por segundo; las únicas cifras de rendimiento de LLM encontradas proceden de un blog de referencia que etiqueta sus propios números como “estimados”.

Cuatro años de chips y modelos Primero el contexto, luego el año que cubre este informe

  1. 2023Apple recorta el ancho de banda de memoria del M3 Pro a 150GB/s, desde los 200GB/s del M2 Pro — contexto que conviene conocer, ya que quien compra un Mac suele comparar entre generaciones de chip.
  2. 2024.10Se lanzan el Mac mini M4 y el M4 Pro; la configuración de entrada en Taiwán (16GB/256GB) cuesta NT$19,900.
  3. 2025.03Google DeepMind lanza Gemma 3, en tamaños 1B/4B/12B/27B.
  4. 2026.01Ollama lanza una API nativa compatible con Anthropic (v0.14), que permite a Claude Code ejecutarse directamente contra un modelo local.
  5. 2026.03Apple anuncia el M5 Pro y el M5 Max, con un ancho de banda de memoria unificada de hasta 614GB/s.
  6. 2026.04.02Google DeepMind lanza Gemma 4 — E2B, E4B, 12B, 26B-A4B, 31B.
  7. 2026.04Usuarios de Ollama en CUDA y, por separado, en Apple Silicon informan de que el modelo 31B Dense de Gemma 4 se bloquea con Flash Attention en prompts largos.
  8. 2026.05.01Apple deja de vender la configuración más barata del Mac mini; el precio de entrada efectivo sube de 599 a 799 dólares.
  9. 2026.06.17GitHub Copilot CLI añade compatibilidad con clave propia (BYOK) para modelos locales y externos.
  10. 2026.06.25Apple sube el precio inicial del Mac mini M4 Pro de 1,399 a 1,599 dólares, y reintroduce la configuración de entrada descatalogada al nuevo precio, más alto.
  11. 2026.08.25La tienda de Apple en Taiwán lista el Mac mini desde 26,900 NT$, y sus configuraciones M4 Pro a 54,900 NT$ y 61,900 NT$.

Por qué la longitud del contexto no es la cifra que hay que vigilar Prellenado y caché KV, no el límite de tokens

Una herramienta CLI agéntica reenvía todo su estado de trabajo — un prompt de sistema, un esquema de herramientas y la transcripción en curso — en cada turno. En un agente de código eso puede suponer varios miles de tokens antes de que el modelo produzca una sola palabra nueva, y volver a procesar ese estado, llamado prellenado, es justo lo que el ancho de banda de memoria de un Mac tiene que sostener. La longitud del contexto solo acota cuánto puede durar una sesión; no dice nada sobre cómo se siente esa sesión, turno a turno. Lo que fija esa sensación es la velocidad de prellenado, y cuánta memoria ocupa la caché KV — la memoria en curso de todo lo ya procesado — junto con los propios pesos del modelo.

  • 1,024tokens: el tamaño de la ventana deslizante que acota la mayoría de las capas de atención de Gemma 4, según la especificación publicada del propio modelo.
  • ×0.5Cuantizar la caché KV de coma flotante de 16 bits a enteros de 8 bits reduce su huella de memoria exactamente a la mitad — un hecho definitorio de esos formatos, no un resultado de referencia medido.

La nomenclatura que todos confunden Gemma 4 no es 1B/4B/12B/27B

Lo que se suele decirSKU de Gemma 4Parámetros activosContexto máximo
1BE2B~2.3B (reportado)128K
4BE4B~4.5B (reportado)128K
12BSin equivalente; el más cercano es 26B-A4B3.8B de 25.2B en total (confirmado)256K
27B31B densa31B (densa, todo activo)256K

La fila de 26B-A4B se confirma directamente en la ficha publicada del propio modelo: 25.2B de parámetros en total, 3.8B activos por token a través de ocho de ciento veintiocho expertos (más un experto compartido siempre activo). Las cifras de “parámetros efectivos” de E2B/E4B proceden de listados agregados de modelos y no se confirmaron en una única página abierta directamente en esta investigación, y se marcan en consecuencia. Ninguna de estas cuatro filas es un sustituto de tamaño equivalente de su homólogo en Gemma 3 — la tabla existe para corregir la correspondencia, no para declarar un modelo de Gemma 4 equivalente a uno de Gemma 3.

Fricciones conocidas en Ollama y Apple Silicon Confirmado, pero más acotado de lo inicialmente informado

  • Solo 31B Dense

    El bloqueo de flash attention

    • Reportado en hardware Nvidia CUDA (una RTX 3090) para prompts de más de unos 3,0004,000 tokens, y por separado en Apple Silicon (un M5 Max) para prompts de más de unos 500 tokens.
    • La causa raíz reportada: Gemma 4 combina alrededor de cincuenta capas de atención por ventana deslizante con diez capas de atención global, y ambas usan dimensiones de cabeza distintas (256 frente a 512) que la implementación de Flash Attention de Ollama no gestionaba originalmente.
    • Al menos un informe afirma claramente que el modelo 26B-A4B — el recomendado en esta página — gestiona los mismos prompts largos sin problemas; el fallo es específico de 31B Dense.
  • Sigue abierto

    La llamada a herramientas de Qwen 3.5 27B

    • Se reportaron tres fallos independientes a la vez: las penalizaciones de muestreo se ignoran en silencio, una etiqueta <think> sin cerrar corrompe los turnos posteriores, y el renderizador correcto de llamada a herramientas de Ollama está conectado únicamente al nombre de modelo “qwen3-coder,” no a “qwen3.5.”
    • El fallo de penalización de muestreo se corrigió en la v0.17.5; el desajuste del renderizador seguía abierto según el informe encontrado.
  • Aún sin aceleración

    Gemma 4 se ejecuta sin MLX en Apple Silicon

    • Las compilaciones de Ollama para Apple Silicon suelen usar el framework MLX de Apple por velocidad; un informe encontró que Gemma 4 recurre en su lugar al backend más lento de llama.cpp, a unos 15 tokens por segundo en 31B Dense y unos 75 en 26B-A4B.
    • En esta investigación no se encontró ninguna cifra acelerada por MLX para Gemma 4 en Apple Silicon; si y cuando se publique una, ambos números deberían subir.

Del M3 Pro al M5 Max Tres años del mismo compromiso

La línea Silicon de Apple ya había recortado ancho de banda de memoria antes: el M3 Pro salió en octubre de 2023 con 150GB/s, un recorte del 25% frente a los 200GB/s del M2 Pro, con un bus de memoria más estrecho — un recordatorio de que un número de chip más nuevo no implica automáticamente más ancho de banda para un modelo que tiene que hacer fluir sus propios pesos las veinticuatro horas. El M5 Pro y el M5 Max, anunciados en marzo de 2026, van en sentido contrario: una nueva “Fusion Architecture” de dos chips, más de cuatro veces el cómputo de GPU de la generación anterior según las cifras de Apple, y un ancho de banda de memoria unificada de hasta 614GB/s en la configuración superior de 128GB. Las pruebas de un blog de referencia, etiquetadas por él mismo como “Estimadas,” sitúan al M5 Max por delante del M5 Pro y de una RTX 4090 de referencia en varios tamaños de modelo, aunque el propio anuncio de Apple no indica una cifra de tokens por segundo para ningún modelo.

Dos CLI, dos vías de acceso Protocolos distintos, calendarios distintos

ElementoClaude CodeCopilot CLI
Compatibilidad nativa con modelos localesSí, desde Ollama v0.14 (enero de 2026)Sí, con clave propia (BYOK), desde junio de 2026
ProtocoloAnthropic Messages APICompatible con OpenAI / proveedores externos
ConfiguraciónApuntar ANTHROPIC_BASE_URL a un servidor Ollama localConfigurar un modelo local o externo en el selector de modelos de la CLI

Qué Mac, para qué Encaje, no un ganador

  • Punto de entrada

    Aprender con un modelo pequeño

    • Para quién: alguien nuevo en la inferencia local que quiere probar un agente pequeño — un modelo denso de clase 8B — sin gastar demasiado.
    • Lo mejor: el Mac mini de entrada de Apple (16GB/256GB, NT$26,900 en agosto de 2026) es silencioso, consume poco y no necesita nada más que Ollama tal cual para empezar.
    • Contrapartida: Apple pone precio a la memoria y el almacenamiento a medida en su configurador, no como cifra publicada, así que conviene prever un sobrecoste sobre el nivel de entrada y no una cifra fija.
  • El punto óptimo

    El 26B-A4B de Gemma 4, con holgura

    • Para quién: quien quiere el modelo concreto que este informe defiende como el punto óptimo agéntico local, con margen para su contexto de 256K.
    • Lo mejor: más memoria unificada (24GB o más) es lo que realmente compra capacidad de respuesta del agente aquí, porque es lo que permite que los parámetros activos del modelo y su caché KV convivan con el sistema operativo sin recurrir al swap.
    • Contrapartida: Apple pone precio a la memoria y el almacenamiento a medida en su configurador, no como cifra publicada, así que conviene prever un sobrecoste sobre el nivel de entrada y no una cifra fija.
  • Máxima capacidad local

    El M5 Max, si el presupuesto da para más

    • Para quién: quien quiere ejecutar los modelos más grandes en local y está dispuesto a pagar por ello.
    • Lo mejor: hasta 614GB/s de ancho de banda de memoria unificada y más de cuatro veces el cómputo de GPU de la generación anterior, según las cifras publicadas por la propia Apple.
    • Contrapartida: por ahora solo se vende en un chasis MacBook Pro, donde la inferencia sostenida corre el riesgo de limitación térmica; un blog de referencia informa de que el equivalente de sobremesa, Mac Studio, aún no está disponible.
  • Ni siquiera en un Mac

    Una máquina NVIDIA, o la nube

    • Para quién: quien ya tiene hardware NVIDIA capaz, o quien no quiere gestionar en absoluto versiones de Ollama ni parámetros de caché KV.
    • Lo mejor: la VRAM de una tarjeta NVIDIA se dedica al modelo en lugar de compartirse con el sistema operativo, y una API en la nube elimina por completo la gestión de versiones y configuración.
    • Contrapartida: es bien sabido que el consumo continuo de una GPU NVIDIA es mucho mayor que el de un Mac con Apple Silicon, y ninguna de las dos opciones es privada ni gratuita por token como sí lo es un Mac ya pagado.

En resumen

Lo que ha cambiado desde abril no es el argumento — la caché KV y el prellenado siguen determinando la sensación de un agente más que la longitud del contexto — sino el precio de llevarlo a la práctica. El propio Mac mini de Apple cuesta ahora sensiblemente más que cuando se publicó este informe por primera vez, la configuración de gama media concreta para la que este informe solía dar un precio no pudo reconfirmarse, y dos fallos reales de Ollama afectan ahora a qué tamaño de Gemma 4 es realmente seguro ejecutar. Nada de eso cambia qué modelo ejecutar; cambia lo que cuesta, y merece la pena comprobar el precio actual por cuenta propia antes de comprar.

Fuentes: Google Developers Blog y Android Developers Blog; Hugging Face (google/gemma-4-26B-A4B; los listados GGUF de Gemma 4 de Unsloth); MacRumors (25 jun 2026, 1 may 2026, 31 oct 2023); NewMobileLife (26 jun 2026); la tienda de Apple en Taiwán, consultada el 25 ago 2026; PChome 24h 購物; kocpc.com.tw; los issues de GitHub #15350, #15368 y #14493 en ollama/ollama, leídos solo mediante búsqueda; el propio changelog de GitHub (17 jun 2026); Apple Newsroom (M5 Pro/M5 Max, 3 mar 2026); la página de referencia de PromptQuorum, etiquetada por ella misma como “Estimada.” Nada de esto es un consejo de compra.