¿Qué es la Ingeniería de Contexto?

La ingeniería de contexto es el conjunto de técnicas que decide, en cada llamada a un LLM, qué información se coloca dentro de su ventana de contexto. No es un truco de prompt. Es la arquitectura que gestiona el flujo de datos que entra en el modelo.
El término se usa para distinguirlo del prompt engineering clásico, que se centra en cómo escribir una sola instrucción. Cuando la interacción se convierte en conversación larga, sesión persistente o agente autónomo, ya no hay un prompt: hay un pipeline que construye el contexto en cada turno.
El documento de referencia es Effective Context Engineering for AI Agents de Anthropic Engineering.
Por Qué Es Necesaria
Sección titulada «Por Qué Es Necesaria»Un LLM no tiene memoria persistente. Cada llamada es independiente. Todo lo que el modelo tiene que “recordar” tiene que introducirse en la ventana de contexto de esa llamada. La ventana es finita y se mide en tokens.
Si la conversación es corta, cabe todo. Si crece, la aplicación tiene que elegir qué conserva y qué descarta.
La ingeniería de contexto responde a esa pregunta.
Los Cuatro Bloques del Contexto
Sección titulada «Los Cuatro Bloques del Contexto»Un contexto típico se compone de cuatro capas:
Instrucciones del sistema: el prompt fijo que define el rol, las reglas y los límites. Está al principio y no cambia entre turnos.
Historial de conversación: los turnos anteriores. Se degrada o se resume cuando la ventana se llena.
Estado externo: datos del perfil del usuario, resultados de herramientas, ficheros abiertos. Se inyecta selectivamente.
Recuperación bajo demanda: fragmentos de bases de datos o documentos que el modelo pide o que el sistema anticipa. Es donde entra RAG.
Cada bloque compite por espacio en la ventana. Elegir qué prioriza cada turno es el problema central.
Compactación
Sección titulada «Compactación»Cuando el historial se acerca al límite de la ventana, la aplicación puede aplicar compactación: resumir los turnos antiguos con el propio LLM y sustituir el detalle por el resumen. El resumen ocupa menos tokens y conserva los detalles críticos.
El riesgo: el resumen puede omitir un dato clave. Cuando ocurre, el modelo pierde información que sí existió en la conversación pero ya no está en su contexto activo.
Eliminación
Sección titulada «Eliminación»Alternativa más simple que compactar: descartar tramos considerados poco útiles. Saludos, resultados de búsquedas cerradas, mensajes de sistema temporales. Es más barato que compactar pero más ruidoso porque no siempre se acierta qué es descartable.
Memoria Externa
Sección titulada «Memoria Externa»Para información que sobrepasa cualquier ventana razonable, se guarda fuera del contexto en una memoria externa. La arquitectura de referencia es MemGPT, descrita en el paper MemGPT: Towards LLMs as Operating Systems de Packer et al.
MemGPT propone tratar el LLM como un sistema operativo con dos niveles:
Memoria principal: la ventana de contexto. Rápida, pequeña, siempre visible al modelo.
Almacenamiento externo: una base de datos u otro almacén persistente. Lento, grande, invisible al modelo salvo cuando se recupera.
El sistema mueve datos entre ambos niveles según la demanda, igual que un sistema operativo mueve datos entre RAM y disco.
Recuperación Bajo Demanda
Sección titulada «Recuperación Bajo Demanda»Estrategia complementaria a la memoria externa: en lugar de traer todo al contexto, dotar al modelo de una herramienta de búsqueda y dejar que él decida cuándo consultarla.
Just-in-time retrieval: el modelo emite una llamada a la herramienta de búsqueda cuando necesita un dato específico. Se le pasa solo el resultado relevante.
Es lo mismo que un empleado que no memoriza el manual entero: sabe dónde consultarlo y solo abre la página que necesita.
Lost in the Middle
Sección titulada «Lost in the Middle»Ampliar la ventana no resuelve el problema por sí solo. El paper Lost in the Middle: How Language Models Use Long Contexts de Liu et al. documenta un patrón claro: los modelos usan bien la información situada al principio y al final del contexto, y peor la del medio.
La curva de rendimiento tiene forma de U. Meter un dato crítico en la mitad de un contexto largo es equivalente, en la práctica, a no meterlo.
Consecuencia: la ingeniería de contexto no consiste solo en decidir qué entra, sino también dónde dentro del contexto se coloca.
Diferencia con Prompt Engineering
Sección titulada «Diferencia con Prompt Engineering»Prompt engineering: qué escribir en una sola llamada.
Ingeniería de contexto: qué entra en cada llamada de una serie, cómo se decide el contenido, dónde se coloca, cuándo se compacta y qué se recupera.
Uno es la palabra. El otro es la arquitectura.
Fallos Habituales
Sección titulada «Fallos Habituales»Historial que crece sin control: la aplicación no compacta ni descarta y la ventana se llena de ruido.
Compactación agresiva: se resume tanto que se pierden restricciones activas del objetivo.
Recuperación tardía: el modelo genera antes de consultar la fuente, alucina, y la respuesta no cambia aunque después consulte.
Posicionamiento en el medio: el dato crítico queda entre bloques largos de contexto irrelevante y el modelo lo ignora.
Colisión con la memoria paramétrica: el modelo confía en lo que recuerda del entrenamiento por encima del fragmento recuperado.
Qué pasa en la práctica
Sección titulada «Qué pasa en la práctica»- Un historial largo mal gestionado degrada la calidad de la respuesta más que un modelo pequeño bien alimentado.
- Repetir la instrucción crítica cerca del final del contexto mejora la adherencia.
- La compactación con resumen requiere validar que el resumen conserva las restricciones activas.
- La memoria externa solo sirve si la recuperación acierta. Una recuperación mediocre es peor que no tener memoria externa.
Error común
Sección titulada «Error común»Creer que un modelo con ventana grande recuerda por sí solo lo que le has dicho hace veinte turnos. No lo recuerda. La aplicación decide en cada llamada qué le vuelve a introducir. Si la aplicación no lo introduce, para el modelo no existe.
Para el uso práctico y ejemplos de conversaciones que fallan por mal manejo del contexto: Ingeniería de contexto: cómo simula la memoria la IA.