BookinglyTech News
Infraestructura

GPT‑6 Astra completa un circuito de prueba de conducción a 0.94 mph

OpenAI logró que su modelo GPT‑6 Astra conduzca un Toyota Corolla por un recorrido de 134,7 m en 5 min 22 s, superando a GPT‑5.6 Sol, Grok 4.6 y Claude Fable 5.1.

2 min de lecturaThe Register0 vistas

GPT‑6 Astra, el último modelo de OpenAI, terminó un circuito de conducción en un parking de 134,7 m en 5 min 22 s, algo que sus predecesores no lograron. La prueba, parte del proyecto DrivingBench, midió el rendimiento de varios LLMs frente a un entorno real de conducción.

El equipo de Tobias Gessler, Aditya Ramabadran y Simon Mahns registró 6,6 millones de tokens para inferir la tarea, con un coste de 7,74 $ gracias a la facturación por entrada en caché (1 $/M). Sumado al hardware (un dispositivo de asistencia de conducción de Comma AI y un móvil conectado a xAI), el coste total alcanzó 1 006 $. A esa cifra, el coste por milla es de 92,47 $, comparado con 0,184 $ por milla en combustible.

A pesar de la velocidad muy baja (0,94 mph), el modelo mostró una percepción y planificación adecuadas, usando la herramienta observe cada 5‑6 s. Los demás modelos, como Claude Fable 5.1, fallaron en el primer carril, a menudo por problemas de percepción de la línea diagonal del primer cono.

Ramabadran explicó que los modelos a veces rechazaban conducir por “razones de seguridad”, incluso en un lot vacío. Los investigadores tuvieron que etiquetar la prueba como “simulación” y cambiar el nombre del servidor MCP a DrivingBench Sandbox para convencer al LLM de que no estaba en un entorno real.

El experimento demuestra que, aunque los LLMs de frontera pueden realizar tareas de conducción, su latencia y costo de cómputo los hacen imprácticos para la conducción real a corto plazo. Los sistemas especializados, con GPUs de datacenter y optimizados para la tarea, siguen siendo la opción dominante.

Ramabadran sugirió la posibilidad de entrenar un modelo grande y luego destilarlo a uno más pequeño, compatible con el hardware del vehículo. Esta aproximación se alinea con el Bitter Lesson de James Huang, que sostiene que los métodos generales basados en la disminución del coste de cómputo suelen ser los más efectivos.

En última instancia, el proyecto confirma que los LLMs todavía no están listos para reemplazar a los sistemas de conducción autónoma dedicados. La práctica seguirá siendo la de modelos especializados, con la ventaja de ser más rápidos, económicos y con pruebas en el mundo real.

DrivingBench report

openpilot