Ant Group libera LingBot-World 2.0 Small: un modelo de mundo de 1.3B para GPU consumer
El nuevo modelo permite generación de vídeo en tiempo real en una sola tarjeta gráfica, dirigido a desarrolladores y pequeños equipos.
Ant Group ha abierto el acceso a tres nuevas versiones de LingBot-World 2.0, un modelo de mundo en tiempo real capaz de generar vídeo continuo durante horas y responder a entradas de usuario como acciones de personaje o eventos ambientales. La novedad principal es la versión Small, con 1.300 millones de parámetros, diseñada específicamente para ejecutarse en tiempo real sobre una única GPU de consumo.
Ant Group lanzó la variante de 14.000 millones de parámetros de LingBot-World 2.0 en julio, pero la barrera de entrada para probarla localmente era alta. Con LingBot-World 2.0 Small, el objetivo es que desarrolladores independientes, laboratorios universitarios y equipos pequeños puedan desplegar el modelo en su propio hardware sin necesidad de clústeres de servidores. La compañía afirma que el modelo cumple sus promesas de generación en tiempo real en estas condiciones, permitiendo explorar nuevas interacciones y optimizar el inferencia desde el principio.
Además de la variante Small, el paquete incluye dos modelos más con propósitos específicos. LingBot-World 2.0 Bidirectional actúa como una fuente de destilación de alta calidad para el entrenamiento de modelos de mundo en tiempo real. Por su parte, LingBot-World 2.0 Causal Pretrain sirve como base de preentrenamiento causal, orientada a la posterior capacitación, evaluación y adaptación a escenarios concretos. Juntos, completan el ecosistema de herramientas para quien quiera trabajar seriamente con esta arquitectura.
El modelo original de LingBot-World 2.0 destaca por su capacidad de mantener coherencia en generaciones de larga duración y por soportar acciones complejas como disparos, hechizos o cambios meteorológicos. Con suficiente potencia de cálculo, la versión completa alcanza una resolución de 720p a 60 FPS. Para la versión Small, el foco no está en la máxima calidad visual, sino en la accesibilidad y la iteración rápida.
El código está disponible en el repositorio de GitHub, mientras que los pesos del modelo pueden descargarse desde Hugging Face. El equipo técnico ha publicado un artículo detallado en arXiv que explica la arquitectura y los resultados de entrenamiento.
Para los equipos de TI, esto representa una oportunidad concreta para probar modelos de generación de mundo interactivos sin inversión en infraestructura de alto coste. Si el rendimiento en GPU de consumo cumple con las expectativas en entornos reales, podría abrir la puerta a aplicaciones en simulación, educación o prototipado de experiencias inmersivas donde el coste de entrada era el principal obstáculo.
