Harness Engineering: la tercera era después de Prompt y Context, en 3 señales
Escribí sobre ingeniería de contexto hace unos meses y me quedó la sensación de que la historia estaba a medias. Prompt engineering en 2022-2024, Context engineering en 2025, y ahí se cortaba la línea de tiempo.
La línea siguió. El nombre nuevo no lo pusimos nosotros: lo pusieron OpenAI, Anthropic y LangChain, cada uno por su cuenta, entre febrero y abril de 2026. La palabra es Harness Engineering, y las tres publicaciones dicen lo mismo con vocabulario distinto.
Abajo repaso las 3 señales una por una, aclaro qué es “harness” con más rigor que “todo lo que rodea al modelo”, y termino con la pregunta que en 2026 reemplazó a “¿cuál modelo?”: ahora la pregunta útil es “¿cuál harness?”.

Las 3 señales del mismo cambio
Ninguna de las tres empresas se coordinó con las otras. Publicaron en ventanas cercanas porque el problema que resolvieron era el mismo.
Señal 1 — OpenAI (febrero 2026): “Harness engineering: leveraging Codex in an agent-first world”
OpenAI cuenta que, entre agosto de 2025 y enero de 2026, tres ingenieros llevaron 1,500 pull requests al merge y enviaron alrededor de un millón de líneas de código de producción sin escribir una sola línea a mano. Nadie tocó el modelo a mitad del experimento. Los ajustes fueron a otro lado: al AGENTS.md, a los sandboxes, a los hooks de validación y al docs/ que el agente consulta.
La frase que se llevó las citas fue: “Agents aren’t hard; the harness is hard”. En español, lo difícil es el harness, no los agentes.
Señal 2 — Anthropic (abril 2026): “Harness design for long-running application development”
Anthropic publica un ensayo sobre cómo diseñar el harness para agentes que corren horas o días enteros, no unos pocos minutos. El eje está en la retroalimentación estructurada: por dónde el agente se entera de que se equivocó, cómo el sistema se lo comunica, y de qué manera esa señal vuelve al ciclo de decisión sin desbordar el contexto.
Ahí la palabra “harness” aparece 47 veces en un solo artículo. No es casualidad. El equipo de Anthropic quiere fijar el término en el vocabulario técnico.
Señal 3 — LangChain (marzo 2026): “Agent = Model + Harness”
Harrison Chase, en una charla y después en una publicación, resume la ecuación: Agent = Model + Harness. El modelo pone el razonamiento; el harness pone las reglas del juego. Cambiar solo el modelo suma unos pocos puntos; cambiar el harness suma decenas.
Ese número (decenas de puntos) también aparece en la publicación de LangChain con datos de LangSmith. En sus benchmarks internos, mantener el modelo constante y mejorar el harness produjo mejoras de 20-40 puntos porcentuales en la tasa de éxito. Cambiar de modelo con el mismo harness apenas movía la cifra entre +5 y -5.
Entonces, ¿qué es un harness?
La definición corta: todo lo que rodea al modelo y le dice qué puede hacer, qué no puede hacer, cómo saber si se equivocó y qué hacer después.
La definición larga la propuso un artículo académico en arXiv de fines de 2025 (“Natural language agent harnesses”), y las tres empresas lo citan en su bibliografía. El harness tiene 6 componentes:
- Contexto estructurado — qué información entra al modelo y cómo se organiza
- Restricciones declaradas — qué está permitido y qué está prohibido, con la razón anotada
- Herramientas expuestas — qué operaciones puede invocar (leer archivo, ejecutar comando, llamar API)
- Sandbox — dónde ejecuta esas operaciones y qué límites tiene
- Hooks de ciclo de vida — validaciones antes y después de cada paso (linter, tipo, tests)
- Retroalimentación — cómo el resultado de cada paso influye en el siguiente
Un prompt es 1 de estos 6. Un contexto son 1-2. Un harness es los 6.

¿Reemplaza a Prompt y a Context?
Esta pregunta ahora divide opiniones en la comunidad. Mi lectura es que se acumula por capas, y las tres señales me respaldan:
- OpenAI sigue escribiendo prompts declarativos precisos dentro del harness
- Anthropic sigue usando context engineering para decidir qué entra en la ventana
- LangChain dice literalmente “Model + Harness”, no “Harness en vez de Model”
La lectura correcta es de anidamiento:
Harness ⊇ Context ⊇ Prompt
El harness contiene al context. El context contiene al prompt. Un prompt flojo no lo salva el context; un context flojo tampoco lo salva el harness. Y con un harness débil, ni el mejor prompt ni el mejor context alcanzan para que el agente termine su trabajo sin supervisión constante.
¿Por qué el nombre importa para tu equipo?
Podríamos habernos quedado con “context engineering v2” o “MLOps para agentes” o “agent scaffolding”. Que las tres empresas eligieran “harness” al mismo tiempo tiene una consecuencia práctica: es el término que los buscadores y las IA de búsqueda van a asociar con este giro.
Para redactar documentación interna, proponer una nueva línea de trabajo en tu equipo o evaluar una herramienta de agentes: usar el vocabulario que la industria fijó te ahorra explicar de cero cada vez.
Por la misma lógica, el equipo de LLMO en llmoframework.com está observando ahora cómo los agentes de búsqueda con IA (ChatGPT, Perplexity, Claude, Google AI Overview) citan artículos que usan “harness” en el título frente a los que lo llaman de otra forma. Los primeros tienen tasas de citación 3-4× más altas ante las mismas preguntas técnicas. Elegir el vocabulario que la industria fijó cambia cómo el contenido llega a otros lectores, aunque el fondo técnico sea idéntico.
3 preguntas para saber si ya estás haciendo Harness Engineering
Un test rápido, el que uso yo y el que le paso a otros equipos que arrancan con agentes en serio:
- ¿Puedes describir el harness de tu agente en 5 minutos sin abrir código? Si necesitas más de 15, tu harness es implícito y casi seguro frágil.
- Cuando el agente se equivoca, ¿la corrección va al AGENTS.md o al modelo? Si va al modelo (cambio de checkpoint, cambio de proveedor), no tienes harness; tienes prompt engineering en modo pánico.
- Los hooks (linter, tests, contract checks), ¿se ejecutan antes o después de que el agente haga commit? Si es después, la retroalimentación llega tarde: el agente aprende del error un turno tarde, cuando ya empezó otra cosa.
Tres síes: ya haces Harness Engineering, aunque no lo llames así.
Menos síes: las tres publicaciones que cité son gratuitas y directas. Empieza por la de OpenAI, sigue con la de Anthropic y cierra con la de LangChain. En una tarde tienes el mapa completo.
Y esa es la parte que me gusta de este nombre nuevo: la tercera era cabe en 3 publicaciones de blog públicas y gratuitas, escritas por los mismos equipos que ganaron el año pasado.
Ese es un buen momento para entrar.
ken imoto · WebRTC & Voice AI engineer · kenimoto.dev
¿Te resultó útil este artículo?