El harness del agente: el modelo propone, el sistema decide y el recibo lo demuestra
Un ingeniero de infraestructura de IA en OpenAI sostiene que el peor fallo de un agente en producción no es la alucinación ni el crash, sino el éxito silencioso que deja un agujero en el registro duradero.

Vinoth Govindarajan, ingeniero del área de datos e infraestructura de IA en OpenAI, ha dedicado una charla a algo que no suele salir en las demos: el harness del agente, la capa que envuelve al modelo y decide qué ocurre de verdad. Su tesis de arranque es que el fallo más peligroso en producción no es la alucinación ni el cierre inesperado, sino el éxito silencioso: el sistema dice que ha hecho algo, la interfaz se lo cree y el registro duradero se queda con un agujero.
El ejemplo que pone es sencillo. Un agente confirma que va a recordar un reembolso para el siguiente turno. No hay pantalla roja, no hay excepción, el usuario ve una respuesta coherente. Pero la acción no llegó a la memoria persistente de la que dependerá el contexto futuro. El agente seguirá respondiendo con seguridad, razonando sobre un historial incompleto. Govindarajan lo compara con un accidente: un crash molesta, pero al menos marca un límite claro y permite reanudar desde el último punto bueno. Un falso positivo no avisa a nadie.
De la respuesta correcta al estado correcto
El ponente, que antes trabajó en sistemas distribuidos en Uber y Apple, sostiene que las preguntas útiles dejan de ser sobre el modelo en cuanto este puede ejecutar cosas. Un benchmark mide el comportamiento del modelo; no dice si el borde persistente y el borde visible coinciden. Cuando el agente ya puede enviar un mensaje, escribir en una base de datos o lanzar un flujo de trabajo, aparecen otras tres: quién es el dueño del estado, quién confirmó primero cuando dos eventos llegan a la vez, y quién puede demostrar qué pasó realmente.
De ahí saca tres reglas que presenta como propias de sistemas de producción, no de modelos. Un hecho necesita un único dueño y una única ruta de reproducción; si no se puede reconstruir después, no se posee. La concurrencia es aceptable, pero el entrelazado accidental no: el estado compartido necesita un único camino de escritura. Y la transcripción no es el recibo: lo que el agente dijo no prueba lo que se intentó, lo que se aprobó y lo que se confirmó en el borde visible.
El contrato
Su modelo mental es el de un coche. El modelo es el motor y importa, pero nadie compra un vehículo de producción mirando solo los caballos; también quiere dirección, frenos, salpicadero, caja de cambios y caja negra. Con los agentes pasa igual: el motor da capacidad, el harness da control. El contrato que propone cabe en una frase: el modelo propone, el harness confirma y el recibo lo demuestra. El modelo puede sugerir una llamada a herramienta, un mensaje, una edición o un plan, pero la frontera de producción no es suya. Corresponde al harness decidir si esa propuesta entra en el estado, si la mutación está ordenada, si el trabajo está acotado y si la autoridad es válida.
Govindarajan avisa de que no vende nada: usa OpenClaw como caso público porque su harness es abierto y deja ver estas costuras, y dice aplicar el mismo modelo a sistemas internos de OpenAI. El patrón no es nuevo, viene del mundo de los sistemas distribuidos, pero sí lo es aplicarlo a agentes que ejecutan acciones, y de momento cada equipo lo resuelve a su manera.


