Los agentes de código basados en LLM alcanzan fiabilidad diaria en 2026
Claude Opus 4.5 y GPT‑5.1 mejoraron sus agentes de programación al punto de ser útiles en tareas cotidianas, desencadenando una ola de experimentos y nuevos proyectos.

Simon Willison cerró el WeAreDevelopers World Congress en San José con una visión cronológica de 2026. Desde noviembre de 2025, cuando se lanzaron Claude Opus 4.5 y GPT‑5.1, los agentes de código dejaron de ser “a veces erróneos” para convertirse en herramientas lo suficientemente fiables como para usar en el día a día. Willson señaló que la diferencia se notó cuando los agentes dejaron de fallar en tareas simples, como generar SVGs de pelícanos montando bicicletas, y empezaron a producir código que requería poca corrección.
El cambio de comportamiento se reflejó en varios proyectos personales. En noviembre, Willson realizó el primer commit a un repositorio desconocido llamado Warelay, que pasó por varios renombres —CLAWDIS, CLAWDBOT, Moltbot— hasta llegar a OpenClaw. Ese mismo año, impulsado por la nueva confianza en los agentes, construyó un intérprete de JavaScript completo en Python, basado en MicroQuickJS de Fabrice Bellard, y lo alojó en el repositorio micro‑javascript. Además, desarrolló un runtime de WebAssembly en Python, disponible en pwasm, que corre bajo Pyodide y se ejecuta en el navegador.
Willson también comentó que alrededor de 40 de las 277 sesiones del congreso tocaron la seguridad de los agentes, una señal de que la industria está tomando en serio los riesgos de sandboxing y posibles secuestros. Aunque su predicción de un “desastre tipo Challenger” aún no se ha materializado, la discusión sobre aislamiento y control de acceso está en pleno auge.
El autor introdujo dos conceptos de humor que se han vuelto parte del vocabulario técnico: Deep Blue para describir la apatía que sienten los ingenieros al ver que la IA puede hacer todo, y AI mania para la compulsión de delegar cada tarea posible a un agente. Su propia AI mania lo llevó a crear los proyectos antes citados, que aunque útiles para saciar la curiosidad, él admite que el mundo probablemente no necesita un intérprete de JavaScript lento y buggy escrito en Python.
En conclusión, 2026 marca el punto en que los agentes de código basados en LLM dejaron de ser una curiosidad experimental y se convirtieron en herramientas de producción, obligando a los profesionales a replantear flujos de trabajo, prioridades de proyecto y estrategias de seguridad.

