Qué es
Terminología · Ingeniería de LLM · Modelos de lenguaje · Evaluación comparativa · IA · ExplicaciónTratopedia · 15 ago 2026
Primero de cinco · la capa más interna
El puesto murió. La sensibilidad, no.
La ingeniería de prompts consiste en escribir la instrucción para que el modelo haga lo que querías decir. Consiguió una entrada de diccionario, un puesto de trabajo y después un obituario: la prensa especializada declaró obsoleto el puesto antes de que pasaran dos años desde su invención. Pero no se ha informado de que se hayan corregido las mediciones que la convirtieron en disciplina en primer lugar. Reordenar los ejemplos de un prompt ha movido la precisión más de cuarenta puntos. Cambiar solo el formato la ha movido más de setenta. Esa sensibilidad persiste con modelos más grandes, más ejemplos y ajuste por instrucciones. Lo que terminó fue una profesión, no un fenómeno — y la práctica no se detuvo tanto como se trasladó, de ser todo el modo en que usas un modelo a ser un componente dentro de algo mayor.
Tres definiciones, y la única palabra que se movió Las tres coinciden en la práctica. Solo una la llama profesión.
- 40+puntos de precisión que, según se ha comprobado, mueve reordenar los ejemplos de un prompt
- 76puntos de precisión solo por cambios de formato, en escenarios few-shot
- 8ejemplos de cadena de pensamiento que llevaron a un modelo de 540B al estado del arte en GSM8K
- 2años desde que el puesto era el más codiciado de la IA hasta que la prensa especializada lo declaró obsoleto
Oxford English Dictionary · 2025
“…y la disciplina o profesión que se ocupa de esto”
- Completa: la acción o el proceso de formular y refinar prompts para un programa de inteligencia artificial, un algoritmo, etc., con el fin de optimizar su salida o de lograr un resultado deseado; la disciplina o profesión que se ocupa de esto.
- Esa cláusula final es la mitad que se movió. En 2023 “prompt” quedó finalista en la palabra del año de Oxford.
Anthropic · sep 2025
“Métodos para escribir y organizar instrucciones para LLM”
- Ni profesión ni disciplina. Solo la escritura.
- La misma entrada llama a la ingeniería de contexto la progresión natural de la ingeniería de prompts — no su sustituta.
Wikipedia · en el momento de la captura
“Estructurar entradas en lenguaje natural para producir salidas especificadas”
- Coloca a su lado la ingeniería de contexto como “el área relacionada… centrada en contextos que no son prompts y en contextos de prompt” — instrucciones de sistema, metadatos, herramientas de API, tokens.
- Dos fuentes desde direcciones opuestas, una misma forma: el prompt se quedó, y todo lo que lo rodea recibió un nombre propio.
Con cuánta firmeza se sostiene cada parte Se leyeron cuatro artículos en la fuente. Las cifras que todo el mundo cita, no.
| Firmeza | Qué | Sobre qué |
|---|---|---|
| Leído en la fuente | Ocho ejemplos de cadena de pensamiento llevaron a un modelo de 540B parámetros a una precisión de estado del arte en GSM8K, superando incluso a un GPT-3 con ajuste fino y verificador | Wei et al., arXiv 2201.11903, enviado el 28 ene 2022. Resumen leído en la fuente |
| Leído en la fuente | GPT-3: 175,000 millones de parámetros, diez veces cualquier modelo no disperso anterior; el uso few-shot “a veces incluso alcanzando competitividad con los anteriores enfoques de ajuste fino del estado del arte” | Brown et al., arXiv 2005.14165, enviado el 28 may 2020. Resumen leído en la fuente |
| Leído en la fuente | Diez tareas de PLN reformuladas como respuesta a preguntas sobre un contexto, un solo modelo, sin parámetros específicos de la tarea | McCann et al., arXiv 1806.08730, enviado el 20 jun 2018. Resumen leído en la fuente |
| Leído en la fuente | La definición del OED, incluida “la disciplina o profesión que se ocupa de esto” | Citada por Wikipedia a partir de Oxford University Press, 2025. La entrada del diccionario en sí no se abrió |
| Vía Wikipedia | Más de 40 puntos de precisión por reordenar los ejemplos; hasta 76 solo por cambios de formato en escenarios few-shot | Wikipedia, citando estudios. Esos estudios no se han leído aquí — lo que se usa es la magnitud, no ningún resultado concreto |
| Vía Wikipedia | La sensibilidad persiste pese a modelos más grandes, más ejemplos few-shot y ajuste por instrucciones | Wikipedia. Esta es la afirmación de la que depende todo el argumento, y es la que sostiene la fuente más débil de aquí |
| Vía Wikipedia | El aprendizaje en contexto es una propiedad emergente de la escala, y temporal — a diferencia del entrenamiento o del ajuste fino, no deja nada tras de sí | Wikipedia |
| Solo el titular | El puesto fue declarado obsoleto: AI Prompt Engineering is Dead (mar 2024); The Hottest AI Job of 2023 Is Already Obsolete (abr 2025) | IEEE Spectrum y el Wall Street Journal. Solo se vieron los titulares; no se leyó ninguno de los dos artículos, y aquí se usan solo como prueba de que el género existe |
| Nuestra lectura | El alcance de la palabra se encoge en cada paso mientras que el fenómeno no | Ensamblado a partir de todo lo anterior. Ninguna fuente consultada presenta esta progresión |
Cronología
Qué significaba la palabra cada vez que se movió No es una lista de acontecimientos — es una lista de significados. Cada fecha es una publicación, no un cambio en cómo hablaba la gente.
- jun 2018Un prompt es una pregunta que elige una tarea. decaNLP reformula diez tareas de PLN como respuesta a preguntas sobre un contexto — “¿Cuál es el sentimiento?”, “Traduce esto al alemán” — con un solo modelo y sin parámetros específicos de la tarea.
- 2019El prompt sustituye al ajuste fino. GPT-2 realiza tareas posteriores en zero-shot, “sin ninguna modificación de parámetros ni de arquitectura”. La instrucción es ahora toda la especificación.
- may 2020De preguntar a enseñar. GPT-3, con 175,000 millones de parámetros, hace que funcione el prompting few-shot: el prompt lleva ahora ejemplos resueltos, y el prompting se convierte en aprendizaje en contexto.
- ene 2022De la respuesta al método. Cadena de pensamiento: ocho ejemplos que muestran el razonamiento, no los resultados, llevan a un modelo de 540B al estado del arte en GSM8K. Nótese la fecha — esto es diez meses antes de ChatGPT.
- 2022Y de vuelta a una frase. Se descubre que añadir “Let's think step-by-step” funciona sin ninguna demostración. El alcance se reduce de una técnica a una frase.
- 2023Cima: se convierte en profesión. Un lema del OED cuya definición termina “la disciplina o profesión que se ocupa de esto”. “Prompt” queda finalista en la palabra del año de Oxford. Las empresas contratan ingenieros de prompts.
- 2024–25La profesión se desinfla. IEEE Spectrum publica “AI Prompt Engineering is Dead” en marzo de 2024; el Wall Street Journal declara obsoleto en abril de 2025 el puesto de 2023. Wikipedia señala que el título se volvió menos común — los modelos escriben mejores prompts que las personas, y todos los demás recibieron formación en ello.
- sep 2025Reubicada, no eliminada. Anthropic llama a la ingeniería de contexto la progresión natural de la ingeniería de prompts. El prompt se queda; todo lo que lo rodea — herramientas, memoria, historial de mensajes — recibe un nombre propio, y el prompt pasa a ser un componente de ello.
El argumento
¿Está muerta? Dos conjuntos de pruebas que apuntan en direcciones opuestas, sobre dos cosas distintas.
El argumento a favor del obituario es real. El puesto apareció y desapareció en menos de dos años, y Wikipedia da dos razones en lugar de una: los modelos escriben ahora mejores prompts que las personas, y los empleados corrientes recibieron formación en esa destreza, de modo que a un puesto especializado no le quedaba nada en lo que ser especialista. Ambas son plausibles y ninguna está cuantificada en nada de lo consultado. El argumento en contra es que las mediciones nunca se movieron. Si la calidad de la salida oscila cuarenta puntos de precisión cuando reordenas los mismos ejemplos, y setenta y seis cuando no cambias nada salvo el formato, entonces todavía queda ahí algo que someter a ingeniería — y el hallazgo dice explícitamente que esto persiste con modelos más grandes, más ejemplos y ajuste por instrucciones. Esa es la afirmación que sostiene toda esta página, y la lleva su fuente más débil: la cita que hace Wikipedia de estudios que esta sesión no leyó. Así queda marcado en la tabla de arriba y conviene sostenerlo con holgura. Los dos conjuntos de pruebas no están realmente en conflicto, porque tratan de cosas distintas. Uno trata del empleo. El otro, de los modelos. Una práctica puede dejar de ser una carrera y seguir siendo necesaria — que es aproximadamente lo que describen tanto Anthropic como Wikipedia, desde direcciones opuestas, cuando meten el prompt dentro de algo más grande en lugar de tirarlo.
- 2 yrdesde el puesto más codiciado de la IA hasta declararse obsoleto, según los propios titulares de la prensa especializada
- 40 ptsmovidos al reordenar los mismos ejemplos. Nada de lo consultado dice que esto se haya corregido
- 2asuntos distintos: un conjunto de pruebas trata del empleo, el otro de los modelos
Lo que añaden otros
Qué eran en realidad las técnicas Los métodos con nombre, y qué añadió cada uno al anterior.
| Técnica | Qué hace | Qué añadió |
|---|---|---|
| Few-shot | Meter ejemplos resueltos en el prompt | El modelo puede aprender una tarea solo a partir del prompt. Esa capacidad es emergente con la escala, y temporal — a diferencia del ajuste fino, después no queda nada |
| Cadena de pensamiento | Ejemplos que muestran los pasos del razonamiento, no solo la respuesta | Da forma al proceso del modelo. Ocho ejemplos, un modelo de 540B, estado del arte en GSM8K |
| Zero-shot CoT | Añadir “Let's think step-by-step” y prescindir de los ejemplos | Mostró que el efecto no necesitaba en absoluto las demostraciones — una sola frase lo alcanzaba |
| Autoconsistencia | Ejecutar varias cadenas de pensamiento y tomar la conclusión más común | Convierte una única respuesta muestreada en una votación |
| Árbol de pensamiento | Varias líneas de razonamiento en paralelo, con retroceso | Búsqueda, en lugar de una única pasada — en anchura, en profundidad o por haz |
Y adónde fue Tres sitios donde la misma práctica aparece con otros nombres.
- 1Al prompt de sistemaLa guía de Anthropic es escribir a la altitud correcta — entre una lógica if-else frágil y codificada a mano y unas indicaciones vagas que dan por supuesto un contexto compartido. Busca el conjunto mínimo que especifique por completo el comportamiento, teniendo en cuenta que mínimo no significa corto.
- 2A las definiciones de herramientas“Las definiciones y especificaciones de herramientas deberían recibir tanta atención de ingeniería de prompts como los prompts en su conjunto”. En SWE-bench, Anthropic afirma haber dedicado más tiempo a optimizar las herramientas que el prompt.
- 3A una capa de algo mayorLa ingeniería de contexto se hace cargo del trabajo circundante — qué puede ver y recordar el modelo en cada paso. La ingeniería de prompts no desaparece de ahí; pasa a ser la parte que escribe la instrucción, una vez por paso en lugar de una vez por tarea.
Merece la pena retener un detalle de los artículos, porque suele perderse al contarlo de nuevo. La cadena de pensamiento se envió el 28 de enero de 2022 — diez meses antes de que se publicara ChatGPT. La técnica que más a menudo se presenta como el punto álgido de la ingeniería de prompts llegó antes que su público, lo cual es un correctivo útil para una historia que, por lo demás, empieza con una caja de chat. Un segundo detalle: Wikipedia describe el resultado de la cadena de pensamiento diciendo que rinde “de forma comparable a los modelos con ajuste fino específico de tarea”. El propio resumen del artículo dice estado del arte y superando a GPT-3 con ajuste fino y verificador. Ambas frases hablan del mismo experimento; una es sencillamente más débil que lo que se afirmó. Esta página usa la formulación del artículo, y la diferencia es la razón corriente para seguir un resumen hasta su fuente.
- 10 mola cadena de pensamiento precede en diez meses a la publicación de ChatGPT
- SOTAlo que afirma el artículo, frente a “de forma comparable” en el resumen que se hace de él
- 175Bparámetros en GPT-3 — diez veces cualquier modelo no disperso anterior
Conclusión
Qué retener Tres cosas, y la primera trata de cómo leer los obituarios.
Un puesto de trabajo se acabó. Eso no es lo mismo que el fin de una práctica
Dos titulares declararon obsoleto el puesto. Ninguno trata de si la redacción sigue moviendo la salida — y no consta en nada de lo consultado que se hayan corregido las mediciones que dicen que sí. Lee “la ingeniería de prompts ha muerto” como una afirmación sobre la contratación, porque eso es lo que abarcan las pruebas que hay detrás.
El territorio de la palabra se encogió en cada uno de los pasos
Un selector de tareas en 2018, un sustituto del ajuste fino en 2019, una forma de enseñar con ejemplos en 2020, una forma de dar forma al razonamiento en 2022, luego una frase, luego una profesión, luego un componente dentro de la ingeniería de contexto. Esta progresión se ensambla aquí y no aparece en ninguna fuente por sí sola — pero cada paso de ella se leyó en su propia publicación.
La afirmación más fuerte de aquí descansa sobre la fuente más débil
Que la sensibilidad persista con la escala, más ejemplos y ajuste por instrucciones es lo que hace funcionar todo el argumento — y procede de Wikipedia citando estudios que esta sesión no leyó. Así queda marcado en la tabla. Si vas a comprobar una sola cosa de esta página, comprueba esa.