BookinglyTech News
Inteligencia artificial

GPT-6 Astra acierta el 80% de los errores de montaje en el benchmark de Epoch AI

El modelo de OpenAI lidera la prueba comparativa FAB con un 80% de acierto, frente al 28% del mejor modelo hace diez meses. Claude Fable 5.1 y Claude Opus 5 se quedan en el 70% y el 61%.

2 min de lecturaITHome0 vistas

Epoch AI ha publicado los resultados de su prueba comparativa sobre montaje de muebles, y el mejor modelo multimodal ya detecta errores en un montaje real ocho de cada diez veces. GPT-6 Astra, de OpenAI, encabeza la tabla con un 80% de acierto; hace diez meses el líder apenas llegaba al 28%.

Qué mide el test

El Furniture Assembly Benchmark (FAB) nació para medir razonamiento visual y espacial sobre algo tangible. Son 60 fotos de tres muebles de IKEA montados a propósito de forma incorrecta, capturadas en distintas fases del proceso. Al modelo no se le da solo la imagen: recibe el PDF oficial de instrucciones, una herramienta de ampliación y un intérprete de Python, y tiene que decidir si hay un error, señalar el paso y describirlo.

La puntuación es multietapa: basta con localizar bien el paso y explicar el problema de forma aproximada para rascar puntos. La intención no es comprobar si el modelo se sabe el manual de memoria, sino reproducir el caso de uso real: alguien hace una foto de lo que está montando y pregunta si ha puesto una pieza al revés o se ha saltado un paso.

Detrás de Astra quedan Claude Fable 5.1, con un 70%, y Claude Opus 5, con un 61%. La referencia de noviembre de 2025 era Claude Opus 4.5, con un 28%: en unos diez meses, el techo de la tabla se ha casi triplicado.

Dónde fallan y cuánto tardan

La velocidad también ha cambiado. Astra analiza una foto en unos 3 minutos de mediana, es el más rápido del estudio y mejora entre 2 y 10 veces al anterior líder. Sigue lejos de lo que se entendería por tiempo real, según los autores.

Los patrones de error son distintos según la casa. Gemini, de Google, y la serie Qwen, de Alibaba, casi siempre dan por hecho que hay un fallo y salen a buscarlo. Los modelos antiguos de Anthropic y OpenAI pecaban de lo contrario: muchas veces no encontraban nada. La dificultad tampoco depende del índice de complejidad del mueble; pesa más lo escondido que esté el error, el ángulo de la foto y cuánto se siguió montando después.

En el lado abierto, Kimi K3 es el mejor peso abierto chino y va unos 7 meses por detrás de la frontera internacional, cuando en capacidad general esa distancia era de 4,4 meses. El razonamiento visual sigue siendo el punto flojo, y modelos populares como DeepSeek V4 Pro y GLM 5.3 ni siquiera ofrecen soporte de imagen.

Que un modelo localice un tornillo mal puesto importa poco. Que pueda cruzar un manual con una foto y decir qué está mal importa en mantenimiento, reparación e instalación, que es donde Epoch AI sitúa el valor de esta prueba. El cuello de botella ya no es el acierto, son los minutos que todavía se necesita por imagen.