Comparativa de modelos frontera genera una simulación Falcon 9 en Three.js con un solo prompt
Opus 5.5, Opus 5, GPT‑6 Astra y GPT‑6 Sol fueron puestos a prueba con el mismo prompt para crear una aplicación HTML/JS que reproduce un lanzamiento Falcon 9 en tiempo real.
Los cuatro modelos de IA más avanzados del momento recibieron idéntico prompt: generar una aplicación web de una sola página que simule el lanzamiento de un Falcon 9 (misión Starlink) usando Three.js. El objetivo era evaluar su capacidad para manejar una máquina de estados 3D compleja, geometría procedural y una UI de telemetría en tiempo real, sin paso de compilación.
El prompt especificaba la generación de la geometría del cohete (cilindros, conos y cajas para booster, etapas, patas plegables, grid fins y la carena de carga), el entorno de lanzamiento (plataforma con strongback, suelo texturizado y gradiente atmosférico), y una animación basada en física realista que incluya cálculo continuo de empuje, masa, gravedad y aceleración. Además, se exigía un sistema de partículas propio para el chorro de gases y el humo del pad, con escalado, velocidad, opacidad y color interpolados, y una cámara cinemática con "camera shake" proporcional al thrust y al Max‑Q. Iluminación direccional, sombras dinámicas y una luz puntual parpadeante en el motor completaban la lista.
Los resultados mostraron diferencias notables. Opus 5.5 y GPT‑6 Astra lograron generar código que compila y ejecuta sin errores, pero el rendimiento varía: Opus 5.5 produce una escena más ligera, manteniendo 60 fps en navegadores de escritorio, mientras que GPT‑6 Astra incluye más detalles en la partícula, lo que reduce la tasa a unos 45 fps. Por su parte, Opus 5 y GPT‑6 Sol entregaron scripts más extensos, con referencias a módulos externos que requieren ajustes manuales, lo que rompe la premisa de "sin build step".
En cuanto a la lógica de la simulación, solo Opus 5.5 implementó una integración de fuerzas que respeta la variación de masa durante la separación de etapas, logrando una fase de Max‑Q más realista. Los demás modelos simplificaron la masa a un valor constante, lo que genera una aceleración lineal y una falta de "camera shake" coherente.
El video de referencia del proyecto original está disponible en el enlace de la publicación, donde se puede comparar visualmente la calidad del render y la fluidez de la animación.
Esta prueba subraya que, aun con prompts idénticos, la capacidad de los modelos para traducir requisitos complejos en código funcional varía significativamente. Para equipos que consideran usar LLMs en generación de prototipos front‑end, la elección del modelo influirá tanto en la calidad del código como en la carga de trabajo posterior de optimización.


