Tratopedia
EN
Ajustes

Tamaño del texto

Tema

Alto contraste

Versión

v1.177.0

La publicación con la que se generó esta página. Es la que almacena en caché el service worker.

Ingeniería de LLM · Agentes de IA · Evaluación comparativa · Informe de evaluaciónPublicación de Spotify Engineering, 3 sep 2026 · registro a 8 sep 2026

Ingeniería de LLM · un hook, un modelo más barato y lo que cubre la cifra de ahorro

Desviar las lecturas masivas a un modelo más barato: qué recorta en realidad ese 90%

El blog de ingeniería de Spotify describe shunt, un plugin de Claude Code que bloquea una lectura masiva antes de que llegue al modelo de vanguardia y la desvía a un modelo trabajador más barato — gemini-2.5-flash en los ejemplos publicados —, reportando un ahorro medio del 90% en el uso de tokens del propio Claude. Esa cifra es real, según los propios números publicados por el proveedor, y es más estrecha de lo que sugiere el titular: es la media de tres de cuatro escenarios de referencia, contada como una estimación y no como un recuento medido de tokens, y describe hacia dónde van los tokens, no si se gasta menos en total.

Qué ocurrió clasificado según su grado de solidez

SolidezQué ocurrióFuente
ConfirmadoSpotify publicó dos AiKA Modes en Portal — bulk-reader y code-writer — junto con un plugin de Claude Code, shunt, que bloquea una lectura masiva con un hook PreToolUse (provisional: gancho previo al uso de la herramienta) y la desvía a un modelo trabajador más barato. Ambos modos están configurados con gemini-2.5-flash en los ejemplos publicados, aunque el campo del modelo acepta cualquier modelo configurado en una instancia de Portal.Spotify Engineering — 3 sep 2026
ConfirmadoEl umbral por defecto del hook que bloquea la lectura es de 350 líneas, configurable mediante SHUNT_MIN_LINES; un segundo hook detecta el mismo intento de lectura de un archivo grande a través de cat, head, tail, less o more, dejando pasar un comando con tubería o redirección por tratarse de una lectura específica.Spotify Engineering; spotify/portal-ai-plugins
ConfirmadoSolo se aplica a la mitad de lectura. La propia sección de limitaciones conocidas del repositorio indica que no hay “enforcement para code-writer”: solo bulk-reader pasa por un hook, y la generación de código se delega únicamente si Claude lo decide, a partir de la descripción de una skill.repositorio spotify/portal-ai-plugins
ConfirmadoEl propio evaluación publicada por el plugin reporta un ahorro medio en lecturas masivas del 90% — exactamente la media de tres escenarios, con 82%, 94% y 94%. Un cuarto escenario, de generación de código, queda excluido de esa media, y se indica que es más difícil de medir en tokens.repositorio spotify/portal-ai-plugins
ConfirmadoLos recuentos de tokens del benchmark se estiman como caracteres divididos entre cuatro, y la propia descripción del benchmark indica que “mide los tokens de contexto de Claude con y sin shunt” — el consumo del propio Claude específicamente, no un total combinado de ambos modelos.repositorio spotify/portal-ai-plugins
ConfirmadoTanto la edición delegada como el razonamiento delegado fallan: los resúmenes del modelo trabajador no llevan números de línea fiables, y ese modelo pasó por alto un error de seguridad de hilos que, según el autor del artículo, él mismo encontró al darle a Claude el mismo contexto.Spotify Engineering — 3 sep 2026
ConfirmadoGartner predice que los costes de codificación con IA superarán el salario medio de un desarrollador para 2028 — la fuente que el artículo de Spotify enlaza directamente para esa afirmación.Gartner — 24 jun 2026
Confirmado, pero no verificable aquíUna cuarta parte de los responsables de ingeniería ya gasta entre $200 y $500 por desarrollador al mes en tokens, y algunos superan los $2,000 — cifras que la cobertura del sector atribuye a la misma investigación de Gartner, pero que no aparecen en la página de Gartner que enlaza el artículo.DevOps.com, sobre la investigación de Gartner — 30 jun 2026
Confirmado, pero no verificable aquíEl propio monorepo del benchmark — descrito como 162,000 líneas de Java — no está publicado, aunque la solicitud de incorporación original del plugin nombra identificadores de archivo internos reales, no marcadores de posición.repositorio spotify/portal-ai-plugins (ambas ramas)
No públicoNinguna parte independiente ha reproducido ni verificado de otro modo la cifra publicada del 90% frente a una base de código distinta.no se encontró entre las fuentes consultadas

Cronología todo evento fechado, en orden

  1. 24 jun 2026Gartner publica un comunicado de prensa que predice que los costes de codificación con IA superarán el salario medio de un desarrollador para 2028.
  2. 30 jun 2026DevOps.com cubre la misma investigación, añadiendo las cifras en dólares por desarrollador y su propia advertencia de que las proyecciones para 2028 son, por naturaleza, especulativas.
  3. 12 ago 2026Se abre la solicitud de incorporación del plugin shunt, que nombra los archivos internos reales sobre los que se ejecutó el benchmark original.
  4. 14 ago 2026shunt se fusiona en el repositorio público; la tabla de benchmark de su README se generaliza ese mismo día.
  5. 3 sep 2026Spotify Engineering publica el artículo de Dimitri Mazmanov que describe shunt y su benchmark.
  6. 6 sep 2026Se publica un comentario independiente que se niega a tratar la cifra del 90% como algo más que autodeclarado.

El argumento un traslado, no una desaparición — y más estrecho que el titular

shunt no hace desaparecer los tokens; los reubica. Cuando un archivo grande llenaría, de otro modo, el propio contexto de Claude, el hook bloquea esa lectura y entrega el archivo a un modelo trabajador aparte, dentro del propio contexto de ese modelo. La razón que da el propio artículo de por qué una consulta de seguimiento no cuesta nada lo dice directamente: reenviar los archivos “es gratis donde importa, porque el corpus va al modelo trabajador y nunca entra en el contexto de Claude” — una afirmación sobre qué contexto de modelo absorbe el coste, no una afirmación de que el total combinado, entre ambos modelos, sea menor. El propio archivo de benchmark del plugin confirma esta lectura en su nota metodológica: mide “los tokens de contexto de Claude con y sin shunt” — el consumo del propio Claude, específicamente, no una suma de lo que usaron ambos modelos. Ni el consumo de tokens del propio modelo trabajador ni su precio por token aparecen publicados en ninguna fuente leída para este registro, así que no queda demostrada ninguna comparación de coste total.

  • 90%del propio uso de tokens de Claude, media de tres escenarios
  • gemini-2.5-flashel modelo trabajador en los ejemplos publicados

El “90%” publicado es la media de exactamente tres escenarios de lectura masiva — 82% (de 33,684 tokens a 5,737), 94% (de 75,990 a 4,148) y 94% (de 16,221 a 821), en archivos de 4,014, 7,408 y 1,281 líneas — y excluye un cuarto escenario, de generación de código, del que el propio artículo dice que es “más difícil de medir en tokens”: sin el plugin, Claude tanto lee los archivos de referencia como genera la salida en forma de costosos tokens de salida, mientras que con él el código va directo al disco y Claude nunca llega a verlo. Las propias cifras de tokens detrás de los cuatro escenarios son a su vez una estimación: el propio archivo del benchmark documenta su método como caracteres divididos entre cuatro, “una aproximación conservadora para código” — ni un recuento medido por tokenizador, ni una cifra de uso facturado reportada por el proveedor, para ninguno de los dos modelos.

  • 3 de 4escenarios incluidos en la media publicada
  • caracteres ÷ 4el método propio del benchmark para contar tokens

Las cifras se apoyan en código fuente interno genuino: antes de que se generalizara el README del repositorio público, la solicitud de incorporación original del plugin nombraba un archivo interno real, SpotifyUri.java, y un componente real del repositorio, PromotionRuleRepository, para dos de los tres escenarios de lectura masiva — prueba de que el benchmark se ejecutó sobre código real, aunque Spotify no publica ese código en sí, y ningún lector puede repetir la misma comparación sobre los mismos archivos. Tampoco se ha localizado, para este registro, ninguna parte independiente que haya repetido la comparación sobre una base de código distinta, y el único comentario externo encontrado trata la cifra explícitamente como autodeclarada: “la cifra es autodeclarada y depende de la carga de trabajo… trátela como la medición que hace Spotify de su propio código.”

  • 162,000 líneasel tamaño declarado del monorepo Java del benchmark, no publicado en sí

Qué añaden otras fuentes la misma forma de solución dentro de las propias herramientas de Anthropic, y dos problemas distintos junto a ella

  • ~55,000tokens que cuesta solo en definiciones un catálogo de herramientas multiservidor típico, antes de hacer ningún trabajo
  • 85%+la reducción que reporta la búsqueda de herramientas en ese mismo caso, cargando solo las herramientas necesarias
  • claude-haiku-4-5el modelo más barato al que los propios ejemplos multiagente de Anthropic delegan el trabajo intensivo en lectura
  • 0reproducciones independientes de la cifra del 90% publicada, encontradas entre las fuentes consultadas
MecanismoSe dirige aDónde se ejecuta
shunt (Portal by Spotify)Lecturas masivas de archivos y generación de código repetitivoPlugin y plataforma externos, enrutado mediante un hook PreToolUse
Subagentes de Claude CodeCualquier subtarea intensiva en lecturaIntegrado en el propio Claude Code; un subagente puede fijarse a un modelo más barato como Haiku
Sesiones multiagente de Managed AgentsSubtareas independientes e intensivas en lectura, repartidas en paraleloEl propio Agent SDK/plataforma de Anthropic; cada agente delegado tiene su propio modelo y su propio contexto aislado
Búsqueda de herramientas (defer_loading)El hinchazón de las definiciones de herramientas, no las lecturas de archivosLa propia API de uso de herramientas de Anthropic; carga solo las pocas herramientas que necesita una solicitud
Edición de contexto (clear_tool_uses)Resultados de herramientas obsoletos ya admitidos en el contextoLa propia API de gestión de contexto de Anthropic; borra los resultados antiguos al superarse un umbral configurado

Conclusión qué dar por bueno, y qué sostener con cautela

Un ahorro real, mal llamado

El ahorro que reporta Spotify es genuino según sus propios números, pero es un traslado de gasto del contexto de un modelo caro al contexto de uno más barato, no un recorte demostrado de tokens gastados en total — nada publicado indica cuánto cuesta el propio modelo trabajador.

Tres escenarios, no todo el plugin

El 90% describe la media de tres escenarios de lectura masiva, usando un recuento estimado de tokens; el cuarto escenario, generación de código, queda explícitamente excluido de esa media, y ninguna parte externa ha reproducido ninguno de los cuatro.

La forma de la solución no es nueva

Desviar el trabajo intensivo en lectura hacia un modelo más barato dentro de su propio contexto ya existe como mecanismo propio dentro de los subagentes de Claude Code y de las sesiones multiagente de Managed Agents de Anthropic. Lo que añade el artículo de Spotify es un ejemplo concreto de ello, aplicado específicamente a lecturas de archivos y código repetitivo, no una idea nueva sobre a dónde deben ir los tokens de un agente.

Dimitri Mazmanov, “Portal by Spotify cut my Claude Code token usage by 90%,” Spotify Engineering, 3 sep 2026 · “Gartner Predicts AI Coding Costs Will Surpass Average Developer's Salary by 2028…,” Gartner, 24 jun 2026 · James Maguire, “AI Coding Costs Could Exceed Developer Salaries, Gartner Warns,” DevOps.com, 30 jun 2026 · “Create custom subagents,” “Multiagent orchestration,” “Tool search tool,” y “Context editing,” Anthropic · repositorio spotify/portal-ai-plugins (README, README del plugin shunt y datos del benchmark), Spotify · “Modes,” Spotify for Backstage · Maxime Dalessandro, “Claude Code token usage: what Spotify's 90% cut proves,” datapace, 6 sep 2026.

Versiones

Este documento se reescribe cuando lo que dice tiene que cambiar. Cada versión sigue publicada en su propia dirección.

  1. v0001 actual

La versión actual también está en latest/.