HiDream-O1-World: el modelo del mundo chino que fue primero y ya es sexto
La startup china HiDream.ai lanzó el 16 de agosto un modelo interactivo que permite navegar escenarios generados y modificarlos sobre la marcha. Lideró el ranking Navi de WBench y ya ha caído al sexto puesto.

HiDream.ai, la startup china fundada en marzo de 2023, presentó el 16 de agosto HiDream-O1-World, un modelo del mundo interactivo que acepta texto, imagen e interacción: el usuario se mueve por entornos generados y cambia personajes, objetos y condiciones mientras la escena avanza. Entró en el leaderboard Navi de WBench con 80,9 puntos y fue primero. El 15 de septiembre seguía con 80,9, pero ya era sexto.
De la imagen al vídeo, y del vídeo al entorno
Al frente está Tao Mei, fundador y consejero delegado. Pasó doce años en Microsoft Research Asia y después en JD.com, donde dirigió la investigación en visión por computador y acabó de vicepresidente. Su trabajo ya combinaba visión y lenguaje, como en el paper de ACM Multimedia de 2017 "To Create What You Tell: Generating Videos from Captions". Más del 90% del núcleo técnico tiene máster o doctorado. En 2025 la plantilla no llegaba a 50 personas; en mayo de 2026 andaba entre 200 y 300.
La primera financiación externa incluyó a 15 antiguos alumnos de la Universidad de Ciencia y Tecnología de China. En diciembre de 2023 ya había cerrado dos rondas por cerca de 100 millones de yuanes. De ahí salieron Pixeling, una plataforma de creación visual, y PixMaker, para imágenes de comercio electrónico.
Mei contó a The Paper que su enfoque de doble modelo, entrenar el de imagen, más barato, para probar ideas antes de llevarlas a vídeo, dejó los costes de entrenamiento en torno a una quinta parte de lo que él consideraba la media del sector. Los primeros resultados no acompañaron: llamó "terrible" a su primer modelo de vídeo, de agosto de 2023. Tras la llegada de Sora, el equipo se pasó a una arquitectura Diffusion Transformer y exploró aproximaciones híbridas autorregresivas. De ese camino sale HiDream-O1-World, que usa la arquitectura Unified Transformer de la empresa para procesar texto, imagen, vídeo y datos espaciales en un mismo marco, y separa la geometría de la escena de su apariencia visual para mantener la coherencia espacial mientras se navega.
El problema de ser el número uno
La ventaja técnica se estrecha rápido. HiDream-O1-Image-1.5 quedó en junio entre los tres primeros del leaderboard de texto a imagen de Artificial Analysis, por delante del Nano Banana 2 de Google; el 2 de septiembre era decimosexto, con un coste de API de unos 80 dólares por cada 1.000 imágenes. Mei dijo a Xinhua en junio que sus herramientas pueden dejar el coste de producir un anuncio de un minuto en formato vídeo corto en torno a una décima parte del de la producción tradicional. La cifra es suya.
En mayo publicó bajo licencia MIT el modelo HiDream-O1-Image, de 8.000 millones de parámetros, junto con el código. Mei ha dicho que DeepSeek le cambió la forma de pensar sobre el open source, incluso cuando el retorno comercial no está claro.
El otro aprendizaje vino de los clientes. "Al principio pensábamos que la capacidad del modelo era el producto", recordó Mei en una entrevista con 36Kr en mayo de 2026. Las empresas querían software que hiciera un trabajo, no modelos que montar por su cuenta. De ahí salió su estrategia 1+1+3: modelos base, una plataforma empresarial de modelos y agentes, y aplicaciones para marketing, cine y televisión y redes sociales, que puede tirar de modelos de terceros cuando encajan mejor en una tarea.
El interés por los modelos del mundo sube a medida que la IA pasa de generar contenido a simular entornos. World Labs, la empresa de Fei-Fei Li, levantó 1.000 millones de dólares este año y presentó Atlas, un modelo ómnibus que cubre texto, imagen, vídeo y 3D. Que una plantilla de 200 personas compita en esa liga mide a la vez el estado del arte y lo frágil que es cualquier primera posición en un ranking.