Qué pasó
Inferencia local · Modelos de lenguaje · Apple Silicon · Agentes de IA · Informe técnicoGemma 4 de abril de 2026, registro hasta agosto de 2026
Gemma 4 · Apple Silicon · Claude Code y Copilot CLI, cuatro meses después
El verdadero cuello de botella es la caché KV y el prellenado, no el límite de contexto
Este informe calcula qué hace falta para ejecutar Gemma 4 de Google en local en un Mac, detrás de una herramienta CLI agéntica como Claude Code o GitHub Copilot CLI. Primero la conclusión: lo que determina la sensación de uso de un agente es la velocidad de prellenado y el tamaño de la caché KV, no cuánto contexto admite el modelo — que es también la razón de que el modelo de mezcla de expertos 26B-A4B de Gemma 4, con solo 3.8B de parámetros activos por token, sea el punto óptimo para el trabajo agéntico en local. Desde abril de 2026 Apple ha subido los precios de sus Mac dos veces, y dos fallos reales de Ollama afectan ahora a qué tamaño de Gemma 4 es realmente seguro ejecutar.
- 3.8Bparámetros activos en el modelo 26B-A4B recomendado a continuación, de 25.2B en total
- 256Kcontexto máximo en los tres modelos mayores de Gemma 4 — 12B, 26B-A4B y 31B
- +35%subida del precio del Mac mini de entrada en Taiwán desde abril de 2026
- 614 GB/sancho de banda de memoria unificada del M5 Max de Apple, con 128GB
Sobre los precios
Cada precio de abajo es el precio de venta de Apple en Taiwán tal como figuraba el 25 de agosto de 2026, o un precio estadounidense según se informó en la fecha indicada junto a él. Este es un año en el que los costes de memoria y almacenamiento se han movido bruscamente — solo entre mayo y junio Apple subió dos veces el precio del Mac mini —, así que conviene comprobar la cifra actual antes de comprar en lugar de fiarse de la impresa aquí. Nada de esto es un consejo de compra.
Qué ha cambiado desde abril Clasificado según su confirmación, de mayor a menor
| Confirmación | Qué pasó | Detalle |
|---|---|---|
| Confirmado | Gemma 4 sustituye la nomenclatura de Gemma 3 | Google DeepMind lanzó Gemma 4 el 2 de abril de 2026 en cinco tamaños — E2B, E4B, 12B, 26B-A4B y 31B — en sustitución de la gama 1B/4B/12B/27B de Gemma 3, de marzo de 2025. |
| Confirmado | Apple subió el precio del Mac mini dos veces | El precio efectivo en EE. UU. de la configuración de entrada subió de 599 a 799 dólares en mayo de 2026, y el precio inicial del M4 Pro subió de 1,399 a 1,599 dólares en junio. Apple declaró al Wall Street Journal, citado por MacRumors, que fue la subida de coste de componentes más brusca que había visto, ligada a la demanda de memoria y almacenamiento de los centros de datos de IA. |
| Confirmado | Ambas CLI de código principales ya llegan a modelos locales | Ollama añadió en enero de 2026 una API nativa compatible con Anthropic, de modo que Claude Code puede apuntar directamente a un servidor local. GitHub Copilot CLI añadió en junio de 2026 compatibilidad con claves propias (BYOK), incluidos modelos locales. |
| Confirmado, más acotado de lo inicialmente informado | Un bloqueo de flash attention afecta a un tamaño de Gemma 4, no al recomendado aquí | Usuarios de Ollama tanto en CUDA de Nvidia como en Apple Silicon informan de que el modelo 31B Dense de Gemma 4 se bloquea indefinidamente con Flash Attention en prompts largos. Al menos un informe afirma que el modelo 26B-A4B recomendado en esta página no se ve afectado por los mismos prompts. |
| Confirmado, sigue abierto | La llamada a herramientas de Qwen 3.5 27B en Ollama sigue rota | Un fallo de penalización por repetición se corrigió en la v0.17.5, pero el fallo más profundo — el renderizador correcto de llamada a herramientas de Ollama conectado al nombre de modelo equivocado — seguía abierto según el informe encontrado. |
| Reportado, no verificado de forma independiente | El M5 Max es más rápido en inferencia local, pero no está claro cuánto | El propio anuncio de Apple indica múltiplos de cómputo de GPU y de gráficos, no tokens por segundo; las únicas cifras de rendimiento de LLM encontradas proceden de un blog de referencia que etiqueta sus propios números como “estimados”. |
Cronología
Cuatro años de chips y modelos Primero el contexto, luego el año que cubre este informe
- 2023Apple recorta el ancho de banda de memoria del M3 Pro a 150GB/s, desde los 200GB/s del M2 Pro — contexto que conviene conocer, ya que quien compra un Mac suele comparar entre generaciones de chip.
- 2024.10Se lanzan el Mac mini M4 y el M4 Pro; la configuración de entrada en Taiwán (16GB/256GB) cuesta NT$19,900.
- 2025.03Google DeepMind lanza Gemma 3, en tamaños 1B/4B/12B/27B.
- 2026.01Ollama lanza una API nativa compatible con Anthropic (v0.14), que permite a Claude Code ejecutarse directamente contra un modelo local.
- 2026.03Apple anuncia el M5 Pro y el M5 Max, con un ancho de banda de memoria unificada de hasta 614GB/s.
- 2026.04.02Google DeepMind lanza Gemma 4 — E2B, E4B, 12B, 26B-A4B, 31B.
- 2026.04Usuarios de Ollama en CUDA y, por separado, en Apple Silicon informan de que el modelo 31B Dense de Gemma 4 se bloquea con Flash Attention en prompts largos.
- 2026.05.01Apple deja de vender la configuración más barata del Mac mini; el precio de entrada efectivo sube de 599 a 799 dólares.
- 2026.06.17GitHub Copilot CLI añade compatibilidad con clave propia (BYOK) para modelos locales y externos.
- 2026.06.25Apple sube el precio inicial del Mac mini M4 Pro de 1,399 a 1,599 dólares, y reintroduce la configuración de entrada descatalogada al nuevo precio, más alto.
- 2026.08.25La tienda de Apple en Taiwán lista el Mac mini desde 26,900 NT$, y sus configuraciones M4 Pro a 54,900 NT$ y 61,900 NT$.
El argumento
Por qué la longitud del contexto no es la cifra que hay que vigilar Prellenado y caché KV, no el límite de tokens
Una herramienta CLI agéntica reenvía todo su estado de trabajo — un prompt de sistema, un esquema de herramientas y la transcripción en curso — en cada turno. En un agente de código eso puede suponer varios miles de tokens antes de que el modelo produzca una sola palabra nueva, y volver a procesar ese estado, llamado prellenado, es justo lo que el ancho de banda de memoria de un Mac tiene que sostener. La longitud del contexto solo acota cuánto puede durar una sesión; no dice nada sobre cómo se siente esa sesión, turno a turno. Lo que fija esa sensación es la velocidad de prellenado, y cuánta memoria ocupa la caché KV — la memoria en curso de todo lo ya procesado — junto con los propios pesos del modelo.
- 1,024tokens: el tamaño de la ventana deslizante que acota la mayoría de las capas de atención de Gemma 4, según la especificación publicada del propio modelo.
- ×0.5Cuantizar la caché KV de coma flotante de 16 bits a enteros de 8 bits reduce su huella de memoria exactamente a la mitad — un hecho definitorio de esos formatos, no un resultado de referencia medido.
La nomenclatura que todos confunden Gemma 4 no es 1B/4B/12B/27B
| Lo que se suele decir | SKU de Gemma 4 | Parámetros activos | Contexto máximo |
|---|---|---|---|
| 1B | E2B | ~2.3B (reportado) | 128K |
| 4B | E4B | ~4.5B (reportado) | 128K |
| 12B | Sin equivalente; el más cercano es 26B-A4B | 3.8B de 25.2B en total (confirmado) | 256K |
| 27B | 31B densa | 31B (densa, todo activo) | 256K |
La fila de 26B-A4B se confirma directamente en la ficha publicada del propio modelo: 25.2B de parámetros en total, 3.8B activos por token a través de ocho de ciento veintiocho expertos (más un experto compartido siempre activo). Las cifras de “parámetros efectivos” de E2B/E4B proceden de listados agregados de modelos y no se confirmaron en una única página abierta directamente en esta investigación, y se marcan en consecuencia. Ninguna de estas cuatro filas es un sustituto de tamaño equivalente de su homólogo en Gemma 3 — la tabla existe para corregir la correspondencia, no para declarar un modelo de Gemma 4 equivalente a uno de Gemma 3.
Qué añaden otros
Fricciones conocidas en Ollama y Apple Silicon Confirmado, pero más acotado de lo inicialmente informado
Solo 31B Dense
El bloqueo de flash attention
- Reportado en hardware Nvidia CUDA (una RTX 3090) para prompts de más de unos 3,000–4,000 tokens, y por separado en Apple Silicon (un M5 Max) para prompts de más de unos 500 tokens.
- La causa raíz reportada: Gemma 4 combina alrededor de cincuenta capas de atención por ventana deslizante con diez capas de atención global, y ambas usan dimensiones de cabeza distintas (256 frente a 512) que la implementación de Flash Attention de Ollama no gestionaba originalmente.
- Al menos un informe afirma claramente que el modelo 26B-A4B — el recomendado en esta página — gestiona los mismos prompts largos sin problemas; el fallo es específico de 31B Dense.
Sigue abierto
La llamada a herramientas de Qwen 3.5 27B
- Se reportaron tres fallos independientes a la vez: las penalizaciones de muestreo se ignoran en silencio, una etiqueta
<think>sin cerrar corrompe los turnos posteriores, y el renderizador correcto de llamada a herramientas de Ollama está conectado únicamente al nombre de modelo “qwen3-coder,” no a “qwen3.5.” - El fallo de penalización de muestreo se corrigió en la v0.17.5; el desajuste del renderizador seguía abierto según el informe encontrado.
- Se reportaron tres fallos independientes a la vez: las penalizaciones de muestreo se ignoran en silencio, una etiqueta
Aún sin aceleración
Gemma 4 se ejecuta sin MLX en Apple Silicon
- Las compilaciones de Ollama para Apple Silicon suelen usar el framework MLX de Apple por velocidad; un informe encontró que Gemma 4 recurre en su lugar al backend más lento de llama.cpp, a unos 15 tokens por segundo en 31B Dense y unos 75 en 26B-A4B.
- En esta investigación no se encontró ninguna cifra acelerada por MLX para Gemma 4 en Apple Silicon; si y cuando se publique una, ambos números deberían subir.
Del M3 Pro al M5 Max Tres años del mismo compromiso
La línea Silicon de Apple ya había recortado ancho de banda de memoria antes: el M3 Pro salió en octubre de 2023 con 150GB/s, un recorte del 25% frente a los 200GB/s del M2 Pro, con un bus de memoria más estrecho — un recordatorio de que un número de chip más nuevo no implica automáticamente más ancho de banda para un modelo que tiene que hacer fluir sus propios pesos las veinticuatro horas. El M5 Pro y el M5 Max, anunciados en marzo de 2026, van en sentido contrario: una nueva “Fusion Architecture” de dos chips, más de cuatro veces el cómputo de GPU de la generación anterior según las cifras de Apple, y un ancho de banda de memoria unificada de hasta 614GB/s en la configuración superior de 128GB. Las pruebas de un blog de referencia, etiquetadas por él mismo como “Estimadas,” sitúan al M5 Max por delante del M5 Pro y de una RTX 4090 de referencia en varios tamaños de modelo, aunque el propio anuncio de Apple no indica una cifra de tokens por segundo para ningún modelo.
Dos CLI, dos vías de acceso Protocolos distintos, calendarios distintos
| Elemento | Claude Code | Copilot CLI |
|---|---|---|
| Compatibilidad nativa con modelos locales | Sí, desde Ollama v0.14 (enero de 2026) | Sí, con clave propia (BYOK), desde junio de 2026 |
| Protocolo | Anthropic Messages API | Compatible con OpenAI / proveedores externos |
| Configuración | Apuntar ANTHROPIC_BASE_URL a un servidor Ollama local | Configurar un modelo local o externo en el selector de modelos de la CLI |
Conclusión
Qué Mac, para qué Encaje, no un ganador
Punto de entrada
Aprender con un modelo pequeño
- Para quién: alguien nuevo en la inferencia local que quiere probar un agente pequeño — un modelo denso de clase 8B — sin gastar demasiado.
- Lo mejor: el Mac mini de entrada de Apple (16GB/256GB, NT$26,900 en agosto de 2026) es silencioso, consume poco y no necesita nada más que Ollama tal cual para empezar.
- Contrapartida: Apple pone precio a la memoria y el almacenamiento a medida en su configurador, no como cifra publicada, así que conviene prever un sobrecoste sobre el nivel de entrada y no una cifra fija.
El punto óptimo
El 26B-A4B de Gemma 4, con holgura
- Para quién: quien quiere el modelo concreto que este informe defiende como el punto óptimo agéntico local, con margen para su contexto de 256K.
- Lo mejor: más memoria unificada (24GB o más) es lo que realmente compra capacidad de respuesta del agente aquí, porque es lo que permite que los parámetros activos del modelo y su caché KV convivan con el sistema operativo sin recurrir al swap.
- Contrapartida: Apple pone precio a la memoria y el almacenamiento a medida en su configurador, no como cifra publicada, así que conviene prever un sobrecoste sobre el nivel de entrada y no una cifra fija.
Máxima capacidad local
El M5 Max, si el presupuesto da para más
- Para quién: quien quiere ejecutar los modelos más grandes en local y está dispuesto a pagar por ello.
- Lo mejor: hasta 614GB/s de ancho de banda de memoria unificada y más de cuatro veces el cómputo de GPU de la generación anterior, según las cifras publicadas por la propia Apple.
- Contrapartida: por ahora solo se vende en un chasis MacBook Pro, donde la inferencia sostenida corre el riesgo de limitación térmica; un blog de referencia informa de que el equivalente de sobremesa, Mac Studio, aún no está disponible.
Ni siquiera en un Mac
Una máquina NVIDIA, o la nube
- Para quién: quien ya tiene hardware NVIDIA capaz, o quien no quiere gestionar en absoluto versiones de Ollama ni parámetros de caché KV.
- Lo mejor: la VRAM de una tarjeta NVIDIA se dedica al modelo en lugar de compartirse con el sistema operativo, y una API en la nube elimina por completo la gestión de versiones y configuración.
- Contrapartida: es bien sabido que el consumo continuo de una GPU NVIDIA es mucho mayor que el de un Mac con Apple Silicon, y ninguna de las dos opciones es privada ni gratuita por token como sí lo es un Mac ya pagado.
En resumen
Lo que ha cambiado desde abril no es el argumento — la caché KV y el prellenado siguen determinando la sensación de un agente más que la longitud del contexto — sino el precio de llevarlo a la práctica. El propio Mac mini de Apple cuesta ahora sensiblemente más que cuando se publicó este informe por primera vez, la configuración de gama media concreta para la que este informe solía dar un precio no pudo reconfirmarse, y dos fallos reales de Ollama afectan ahora a qué tamaño de Gemma 4 es realmente seguro ejecutar. Nada de eso cambia qué modelo ejecutar; cambia lo que cuesta, y merece la pena comprobar el precio actual por cuenta propia antes de comprar.