BookinglyTech News
Inteligencia artificial

GPT-6 Astra muestra un salto en razonamiento espacial, pero solo completa 7 de 100 tareas

Un benchmark de robótica con brazos duales enfrenta al modelo de OpenAI con MolmoAct2 de Ai2: Astra termina 7 de cada 100 tareas y su rival, ninguna.

2 min de lecturaThe Decoder0 vistas

GPT-6 Astra, el modelo de OpenAI, supera a MolmoAct2, de Ai2, en StationeryBench, un benchmark de robótica que mide razonamiento espacial con tareas de escritorio. Astra completó 7 de cada 100 tareas; MolmoAct2 no terminó ninguna. El investigador Yoav Artzi, de Cornell y Google DeepMind, lo describe como un cambio de escalón en razonamiento espacial.

StationeryBench pone a los dos modelos a controlar los mismos robots YAM de dos brazos, 200 ensayos en total, repartidos en cinco tareas: quitar el tapón a un rotulador, volcar una caja de clips o pasar una regla entre los dos brazos. No se trata solo de acertar o fallar. La prueba puntúa también el progreso parcial, y ahí la distancia se ve mejor que en el recuento de tareas terminadas: mediana de 46 sobre 100 para Astra, 12 para MolmoAct2. Los resultados, los vídeos y el código están publicados en el repositorio de StationeryBench.

Un salto, con matices

Que un modelo termine 7 de cada 100 intentos no suena a gran cosa, y en términos absolutos no lo es: sigue muy lejos de un robot que sirva para algo. El dato relevante es el otro lado de la comparación, cero, y que ambos controlaban el mismo hardware en el mismo entorno. En REMAP, un benchmark que todavía no se ha publicado, Artzi sitúa a GPT-Astra cerca del nivel humano en precisión, aunque avisa: "ni siquiera ASTRA llega a lo que hacen los humanos en otros escenarios".

El investigador sospecha que OpenAI ha entrenado el modelo con grandes cantidades de datos 3D, escenas de Blender incluidas. Es una hipótesis suya, encaja con que la mejora se concentre en tareas tridimensionales, y la empresa no ha dado detalles del entrenamiento. Tampoco hay ninguna demostración de producto por parte de OpenAI: los vídeos que acompañan a los datos son los del propio banco de pruebas.

A OpenAI le interesa el asunto por otra razón. La compañía mantiene planes a largo plazo de fabricar sus propios robots de consumo, y un modelo con mejor comprensión espacial sería una pieza obvia de ese camino. Queda por ver REMAP cuando se publique, y si alguien reproduce estos números en hardware distinto al del banco de pruebas.