BookinglyTech News
Inteligencia artificial

Los world models: de la simulación interna a la generación de mundos físicos

Yann LeCun abandona Meta con 1.000 millones para desarrollar modelos que predecen la física del entorno, superando a los LLM en tareas de control y robótica.

2 min de lecturaDev.to0 vistas

La narrativa actual en inteligencia artificial gira en torno a un concepto antiguo: el world model o modelo del mundo. No se trata de otro chatbot, sino de sistemas que aprenden a predecir cómo reacciona el entorno a una acción específica. La premisa es simple: en lugar de aprender por ensayo y error en el mundo real, el agente ensaya dentro de una simulación comprimida que genera internamente. Esto permite reducir drásticamente el tiempo de entrenamiento y los riesgos físicos.

El origen práctico data de 2018, cuando David Ha y Jürgen Schmidhuber demostraron que un agente podía resolver el benchmark de CarRacing y sobrevivir en Doom entrenando casi exclusivamente en su propia "imaginación" generada. Años después, Google DeepMind refinó esta técnica con la serie Dreamer. DreamerV3 resolvió tareas complejas en Minecraft, como recoger un diamante, desde cero y sin demostraciones humanas, logrando una eficiencia de muestreo que ningun método tradicional igualaba. La clave operativa es que la mayor parte del aprendizaje ocurre en el espacio latente, no en la realidad física.

Del laboratorio a la flota

Esta técnica ha pasado de la curiosidad académica a infraestructura industrial. NVIDIA lanzó su plataforma Cosmos, generada con 20 millones de horas de vídeo real para crear escenarios físicos consistentes. La empresa afirma que procesar los datos para entrenar el primer modelo requirieron dos semanas en GPUs Blackwell, frente a los tres años que habrían sido necesarios con CPUs. Empresas de robótica como 1X, Agility y Figure AI, así como firmas de conducción autónoma como Waabi y Wayve, ya integran estas herramientas.

El impacto más tangible se ve en la robótica física. DayDreamer, una variante de este enfoque, permitió a un robot cuadrúpedo aprender a caminar en una hora de tiempo real, y a recuperarse de caídas en diez minutos. En el sector de la conducción autónoma, Waymo anunció en 2026 un modelo generativo capaz de crear escenarios de peligro raros que sus coches nunca han experimentado en carreteras reales, basándose en la tecnología Genie de DeepMind.

La apuesta más arriesgada viene de Yann LeCun, quien ha dejado Meta y levantado alrededor de 1.000 millones de dólares para un startup dedicada a esta línea. Su tesis es que los modelos de lenguaje actuales son insuficientes para alcanzar el nivel humano, y que la capacidad de modelar la causalidad física es el camino correcto. La diferencia operativa para el desarrollador o arquitecto es clara: mientras un LLM predice la siguiente palabra, un world model predice el siguiente estado del entorno. Esto cambia la arquitectura de los sistemas de control, la gestión de datos de entrenamiento y la necesidad de hardware de inferencia en tiempo real.