Tratopedia
EN
Ajustes

Tamaño del texto

Tema

Alto contraste

Versión

v1.81.0

La publicación con la que se generó esta página. Es la que almacena en caché el service worker.

Terminología · Ingeniería de LLM · Modelos de lenguaje · Evaluación comparativa · IA · ExplicaciónTratopedia · 15 ago 2026

Segundo de cinco · la capa que rodea al prompt

“Todo el contexto” duró seis días

El 19 de junio de 2025 el CEO de Shopify dijo que la ingeniería de contexto era el arte de aportar todo el contexto para que una tarea fuera verosímilmente resoluble. Seis días después Andrej Karpathy respaldó el término y lo cambió sin hacer ruido: llenar la ventana con la información justa para el paso siguiente. Tres semanas más tarde, Chroma midió dieciocho modelos y halló que el rendimiento pierde fiabilidad de forma sostenida a medida que crece la entrada. A finales de septiembre, la definición de Anthropic había invertido la original — encontrar el conjunto más pequeño posible de tokens de alta señal. En unos cien días el término pasó de ser una pregunta sobre si habías dado al modelo lo suficiente a una pregunta sobre si le habías dado demasiado.

Cuatro definiciones, en quince semanas Puestas una al lado de la otra, no dicen lo mismo. La diferencia es el artículo.

  • 6días entre el respaldo al término y el estrechamiento de su significado
  • 102días desde “todo el contexto” hasta “el conjunto más pequeño posible”
  • 18modelos que probó Chroma, y ninguno usa su contexto de forma uniforme
  • 0artículos de Wikipedia sobre el término en el momento de la captura — es un párrafo dentro de otra entrada
  • Tobi Lütke · 19 jun 2025

    “Aportar todo el contexto”

    Una prueba de suficiencia: ¿le has dado bastante?

    • Completo: el arte de aportar todo el contexto para que la tarea sea verosímilmente resoluble por el LLM.
    • Fíjate en “la tarea” — singular, y hecha una sola vez.
    • Sus propias palabras son “me gusta mucho el término”, lo que se lee como respaldo más que como acuñación. Nada de lo consultado nombra tampoco a un usuario anterior.
  • Andrej Karpathy · 25 jun 2025

    “La información justa para el paso siguiente”

    Seis días después. Cambiaron dos palabras, y con ellas el trabajo.

    • “+1 a la ingeniería de contexto frente a la ingeniería de prompts. La gente asocia los prompts con descripciones breves de tareas… cuando en toda aplicación LLM de nivel industrial, la ingeniería de contexto es el delicado arte y ciencia de llenar la ventana de contexto…”
    • De “la tarea” a “el paso siguiente”: de algo que se hace una vez por trabajo a algo que se hace una vez por turno.
    • Lo que se recuperó aquí se corta a mitad de frase. El final — “con la información justa para el paso siguiente” — lo cita Anthropic, que enlaza con esta publicación. Corroborado, no leído entero.
  • Chroma · 14 jul 2025

    No una definición — una restricción

    Kelly Hong, Anton Troynikov y Jeff Huber, en 18 modelos.

    • La suposición que ponen a prueba: un modelo “debería manejar el token número 10,000 con la misma fiabilidad que el número 100”. Su hallazgo: no se sostiene.
    • Los modelos “no usan su contexto de forma uniforme; en su lugar, su rendimiento se vuelve cada vez menos fiable a medida que crece la longitud de la entrada” — en GPT-4.1, Claude 4, Gemini 2.5 y Qwen3.
    • Cae entre la acuñación y la formalización. Eso resulta sugerente, y esta página no lo trata como causa demostrada.
  • Anthropic · 29 sep 2025

    “El conjunto más pequeño posible de tokens de alta señal”

    La inversión, completa. Y la primera definición formal.

    • Formalmente: el conjunto de estrategias para curar y mantener el conjunto óptimo de tokens durante la inferencia del LLM, incluida toda la demás información que pueda acabar ahí al margen de los prompts.
    • También explicita la cadencia: “la fase de curación ocurre cada vez que decidimos qué pasar al modelo.”
    • La definición de un proveedor, y la única formal aquí. anthropic.com está bloqueado para esta sesión — el texto lo aportó djTratoh.

Con cuánta firmeza se sostiene cada parte Casi todo se leyó en origen. Dos cosas no, y una se calculó.

FirmezaQuéSobre qué
Leído en origenLa formulación de Lütke: “el arte de aportar todo el contexto para que la tarea sea verosímilmente resoluble por el LLM”Su publicación en X, obtenida el 15 ago 2026
Leído en origenLa formulación de Karpathy, hasta “llenar la ventana de contexto”Su publicación en X, obtenida el 15 ago 2026. El texto recuperado queda truncado ahí
Leído en origenChroma probó 18 LLM; los modelos “no usan su contexto de forma uniforme”; el rendimiento “se vuelve cada vez menos fiable a medida que crece la longitud de la entrada”Context Rot, informe técnico de Chroma, 14 jul 2025, obtenido en origen. Solo se leyó la apertura — aquí no se cita ningún resultado experimental concreto
Leído en origenNo hay artículo de Wikipedia sobre la ingeniería de contexto; es un párrafo dentro de “Prompt engineering”Un 404 en el momento de la captura, 15 ago 2026. Una ausencia es un hallazgo: la enciclopedia lo sigue tratando como un subtema
DerivadoLas dos publicaciones están separadas por seis días — 19 de junio 03:01 UTC y 25 de junio 15:54 UTC de 2025Calculado a partir de los propios ID de las publicaciones, que codifican una marca de tiempo en milisegundos. Una derivación, no una lectura — repetible, pero no lo mismo que ver una fecha en la página
Aportado, host bloqueadoLa definición formal de Anthropic, el presupuesto de atención, el argumento de la atención n² y las tres técnicas de horizonte largoEffective context engineering for AI agents, 29 sep 2025. anthropic.com devuelve 403 a esta sesión con todas las herramientas; djTratoh aportó el texto
Nuestra lecturaEl término se invirtió: una prueba de suficiencia pasó a ser una prueba de escasezCompuesto a partir de las cuatro definiciones anteriores. Ninguna fuente consultada lo señala
Nuestra lecturaLa medición de Chroma es una causa plausible del estrechamientoCae entre la acuñación y la formalización, y Anthropic la cita — pero nada dice que la definición cambiara por eso

Ciento dos días La cronología más apretada de los cinco términos — cuatro documentos, y una medición en el hueco.

  1. dic 2024El trabajo, sin la palabra. Anthropic describe el “LLM aumentado” — un modelo más recuperación, herramientas y memoria — como el bloque básico de todo lo agéntico. Todo ello es ingeniería de contexto; nada de ello se llama aún así.
  2. 19 jun 2025Todo el contexto. Tobi Lütke publica que prefiere “ingeniería de contexto” a “ingeniería de prompts” porque describe mejor la habilidad central: aportar todo el contexto para que la tarea sea verosímilmente resoluble.
  3. 25 jun 2025Seis días después, el contexto justo. Karpathy añade su +1 — y lo replantea como llenar la ventana con la información justa para el paso siguiente. La palabra “todo” no sobrevive a la semana.
  4. 14 jul 2025Alguien lo mide. Chroma publica Context Rot: dieciocho modelos, y ninguno maneja el token diezmilésimo con la misma fiabilidad que el centésimo. El rendimiento pierde fiabilidad de forma sostenida a medida que crece la entrada.
  5. 18 sep 2025El bucle recibe una definición. Simon Willison se decide por “un agente LLM ejecuta herramientas en un bucle para alcanzar un objetivo”. Ese bucle es lo que sigue produciendo los tokens que alguien tiene ahora que curar.
  6. 29 sep 2025El conjunto más pequeño posible. Anthropic da al término su primera definición formal — curar y mantener el conjunto óptimo de tokens durante la inferencia — y fija el objetivo como el conjunto más pequeño de tokens de alta señal. Ciento dos días después de “todo”.

Por qué una definición se invertiría en cien días Porque la primera era una esperanza y la segunda había sido medida.

La definición de Lütke es una prueba de suficiencia. ¿Le has dado al modelo todo lo que necesita? Si no, la tarea no es verosímilmente resoluble, y la culpa es tuya y no del modelo. Es una idea generosa y práctica, y señala un fallo real — un agente que no puede ver el archivo no puede usarlo. La de Anthropic es una prueba de escasez, y señala el fallo contrario. El contexto es finito, los modelos tienen un presupuesto de atención, y cada token gasta una parte. La arquitectura explica por qué: un transformer deja que cada token atienda a todos los demás, de modo que n tokens producen n² relaciones por pares, y la atención se estira cada vez más fina a medida que se llena la ventana. El resultado es una pendiente y no un precipicio — los modelos siguen siendo capaces con textos largos, pero pierden precisión. Lo que ocurrió entre una y otra es que alguien lo midió. Chroma probó dieciocho modelos frente a la suposición de que el token diezmilésimo es tan fiable como el centésimo, e informó de que no lo es — no en un modelo, en todos. Una vez que eso consta, “aporta todo el contexto” deja de ser generoso y pasa a ser una forma de degradar tu propio sistema. Esta página no afirma que Chroma causara el cambio. El informe se sitúa entre la acuñación y la formalización, y Anthropic lo cita; eso resulta sugerente y es todo lo que puede mostrarse. Lo que sí puede mostrarse es la formulación: “todo el contexto” el 19 de junio, “la información justa” el 25 de junio, “el conjunto más pequeño posible” el 29 de septiembre.

  • all → leastel mismo término, con ciento dos días de diferencia
  • 18modelos en los que el contexto no se usa de forma uniforme, según Chroma
  • relaciones por pares a partir de n tokens — por qué la atención se adelgaza a medida que se llena la ventana

Qué se hace realmente al respecto La práctica de la propia Anthropic, que es el relato más concreto disponible.

  1. 1Escribe a la altitud adecuadaEntre una lógica if-else frágil y codificada a mano y unas indicaciones vagas que dan por supuesto un contexto compartido. Busca el conjunto mínimo que especifique del todo el comportamiento — y ten en cuenta que mínimo no quiere decir corto.
  2. 2Mantén pequeño el conjunto de herramientasLas herramientas deben ser autónomas, robustas frente al error y solaparse lo mínimo. La prueba es contundente: si un ingeniero humano no sabe decir qué herramienta usar en una situación dada, no cabe esperar que el modelo lo haga mejor.
  3. 3Recupera tarde, no prontoGuarda identificadores ligeros — rutas de archivo, consultas, enlaces — y carga los datos en tiempo de ejecución. Los metadatos son señal en sí mismos: un archivo llamado test_utils.py en tests/ significa algo distinto del mismo nombre en src/core_logic/.
  4. 4En trabajos largos, tira cosasTres técnicas: compactación (resumir una ventana llena y reiniciar desde el resumen), toma de notas estructurada (escribir notas fuera de la ventana y volver a leerlas) y subagentes (explorar con decenas de miles de tokens y devolver entre mil y dos mil).

Las tres técnicas de horizonte largo, comparadas Las propias indicaciones de Anthropic sobre cuál encaja con qué.

TécnicaQué haceMejor para
CompactaciónResumir una ventana que se acerca a su límite y reinicializar desde el resumen. Claude Code conserva las decisiones de arquitectura, los errores sin resolver y los detalles de implementación, descarta la salida redundante de las herramientas y continúa con los cinco archivos abiertos más recientementeTareas que exigen mucho ir y venir
Toma de notas estructuradaEl agente escribe notas en una memoria fuera de la ventana de contexto y las recupera más tarde. Una lista de tareas, o un NOTES.mdDesarrollo iterativo con hitos claros
SubagentesAgentes especializados trabajan en ventanas limpias y devuelven resúmenes condensados — a menudo 1,0002,000 tokens de decenas de miles exploradosInvestigación y análisis donde compensa explorar en paralelo

Un punto merece separarse del enfoque del proveedor, porque es la parte que más probablemente envejezca. El consejo de Anthropic termina con “haz lo más sencillo que funcione” y con la expectativa de que los modelos más inteligentes necesitarán menos curación — que el diseño agéntico “tenderá a dejar que los modelos inteligentes actúen de forma inteligente, con cada vez menos curación humana”. Eso es una predicción, hecha por una parte interesada en que sea cierta, y debe leerse como tal. Lo que no es una predicción es la medición de Chroma, hecha por otra organización, en dieciocho modelos, entre ellos los buques insignia de tres proveedores. Si los modelos ya manejaran el contexto largo de forma uniforme, ese informe lo diría. Dice lo contrario, y lo dice de todos ellos. Las dos cosas pueden ser ciertas a la vez: la curación puede volverse más fácil sin dejar de ser necesaria. Pero solo una de ellas ha sido medida.

  • 1medición independiente en este artículo. Todo lo demás es una definición o una práctica
  • 1–2ktokens que devuelve un subagente de decenas de miles explorados
  • 403lo que anthropic.com devuelve a esta sesión. Su publicación fue aportada, no obtenida

Qué llevarse Tres cosas, y la primera es una advertencia sobre citar el término.

Pregunta a qué definición se refiere cada cual

“Aporta todo el contexto” y “encuentra el conjunto más pequeño posible de tokens” son instrucciones opuestas, y ambas se han publicado bajo este mismo término con ciento dos días de diferencia. Quien diga “ingeniería de contexto” en 2026 podría referirse a cualquiera de las dos. El término no se desambigua solo.

La única medición independiente es la parte en la que más conviene confiar

Tres de las cuatro definiciones que aparecen aquí vienen de gente con algo que vender o una postura que defender. El informe de Chroma no define el término en absoluto — pone a prueba si los modelos usan el contexto largo de forma uniforme, en dieciocho de ellos, y concluye que no. Ese es el hecho que sostiene todo lo demás, y viene de la única parte que no está definiendo nada.

Nadie de los consultados afirma haberlo acuñado

Lütke escribió “me gusta mucho el término” — respaldando algo, no bautizándolo. Karpathy escribió “+1”. Ninguno de los dos se lee como un origen, y en nada de lo consultado aquí apareció un usuario anterior. El término se les atribuye de forma rutinaria; con las pruebas disponibles, lo que hicieron fue popularizarlo.

Tobi Lütke en X, 19 jun 2025, y Andrej Karpathy en X, 25 jun 2025 — ambos obtenidos en origen el 15 ago 2026, marcas de tiempo derivadas de los propios ID de las publicaciones · Kelly Hong, Anton Troynikov y Jeff Huber, “Context Rot: How Increasing Input Tokens Impacts LLM Performance”, informe técnico de Chroma, 14 jul 2025, apertura leída en origen · Simon Willison, 18 sep 2025, leído en origen · Anthropic, “Effective context engineering for AI agents”, 29 sep 2025, y “Building effective agents”, 19 dic 2024 — aportados como texto por djTratoh, porque anthropic.com devuelve 403 a esta sesión · en.wikipedia.org/wiki/Context_engineering devolvió 404 en el momento de la captura Este término es uno de los cinco que recoge el tema permanente ingeniería de LLM, que lo sitúa junto a los otros cuatro.