BookinglyTech News
Inteligencia artificial

Lexiang pone su modelo Aether, de 4.000 millones de parámetros, a mover dos humanoides en una barbacoa

La empresa china lo entrenó con unas 200 horas de vídeo humano y ningún dato de robots reales, y lo sometió a más de una hora de servicio al aire libre en Shanghái.

2 min de lecturaPandaily0 vistas

Lexiang Technology ha puesto a su modelo Aether, de unos 4.000 millones de parámetros, a gobernar dos humanoides durante un servicio de barbacoa al aire libre en Shanghái. La retransmisión pasó de la hora y la compañía la plantea como una prueba de estrés pública de generalización entre encarnaciones distintas: el mismo modelo moviendo dos cuerpos diferentes.

Lo llamativo no es la parrilla, es el entrenamiento. Aether se ha entrenado con unas 200 horas de vídeo humano y ningún dato procedente de robots reales. Ese detalle choca con lo habitual en los modelos de visión-lenguaje-acción, donde la teleoperación y las capturas hechas por robots suelen ser la materia prima principal, y donde conseguir esos datos es caro y lento. Si un modelo aprende a moverse solo mirando a personas, el cuello de botella se mueve de sitio.

Sin pesos, sin licencia, sin métricas

De momento no hay mucho más que rascar. Lexiang no ha publicado los pesos, ni una licencia, ni si el modelo estará disponible para terceros. Tampoco ha dado cifras de éxito: ni tasa de tareas completadas, ni número de intervenciones humanas, ni cuántos errores hubo en esa hora de servicio. Lo único que hay es el directo y los dos números que da la empresa, los 4.000 millones de parámetros y las 200 horas de vídeo, que son suyos y no de un tercero.

Eso deja al lector técnico sin lo que necesita para juzgar nada. Una retransmisión demuestra que el sistema funcionó ese día, en ese entorno y con esas condiciones, no que el enfoque generalice. La generalización entre encarnaciones es justo lo que se está intentando medir aquí, y precisamente por eso un vídeo sin evaluación reproducible aporta poco.

Por qué le importa a quien entrena modelos

El interés está en la vía. Si entrenar con vídeo humano basta para que un modelo de este tamaño controle cuerpos distintos sin pasar por teleoperación, el coste de montar un pipeline de datos baja de golpe, y eso afecta a cualquiera que esté construyendo robótica sobre modelos de lenguaje y visión. Es la misma discusión que hay en manipulación y navegación: cuánto se puede aprender de fuentes pasivas antes de necesitar el robot en el bucle.

Lo que falta por ver es si Lexiang publica pesos, arquitectura y algún conjunto de evaluación que otros puedan repetir. Hasta entonces queda una demostración con público y una cifra de entrenamiento que nadie de fuera ha podido comprobar.