BookinglyTech News
Inteligencia artificial

OpenAI presenta GPT-6 Astra con un caso de Basis y cifras de parte

El proveedor afirma que el modelo completa un libro fiscal de 50 pestañas en la mitad de tiempo que GPT-5.6 Sol, según las mediciones de su propio cliente.

2 min de lecturaOpenAI0 vistas

OpenAI ha publicado un caso de cliente con Basis, una empresa que construye agentes para automatizar trabajo contable, y de paso ha dejado ver el nombre de un modelo que no había anunciado hasta ahora: GPT-6 Astra. La comparación que sostiene la pieza es entre ese modelo y GPT-5.6 Sol. Todas las cifras que aparecen salen de OpenAI o de Basis; no hay ninguna medición independiente.

La prueba del libro de 50 pestañas

El ejercicio que describen consiste en un libro de trabajo fiscal con 50 pestañas que el agente debe completar de forma exacta. Según Mitch Troyanovsky, cofundador de Basis, GPT-6 Astra lo termina en la mitad del tiempo que tarda GPT-5.6 Sol. La empresa no publica tiempos absolutos, ni cuántas veces repitieron la tarea, así que la proporción se queda en una afirmación suya. Tampoco hay comparación con modelos de otros proveedores.

Basis añade que el modelo toma mejores decisiones al arrancar la tarea, lo que hace que sus agentes sigan un camino más directo y dediquen menos tiempo a corregir errores. Eso, dice Troyanovsky, se traduce también en un uso más eficiente de los tokens.

Razonamiento que sube y baja

El otro detalle técnico que cuenta Basis es que GPT-6 Astra ajusta cuánto razona a medida que avanza la tarea: sube el cómputo cuando el paso es difícil y lo baja cuando es fácil. El modelo hace ese ajuste sin tirar la caché, lo que según la empresa reduce coste y tiempo de respuesta. Es el punto con más interés para quien despliega agentes de larga duración, porque el gasto se acumula precisamente en las tareas que encadenan muchas llamadas.

En las evaluaciones internas de Basis, el modelo mejora alrededor de un 20% la puntuación. Esa métrica mide si el agente respeta plantillas, consulta fuentes primarias en cuestiones fiscales y revisa su propio trabajo. La empresa sostiene que ahora puede inferir esas expectativas a partir de un contexto más amplio y con menos instrucciones explícitas, lo que le ahorra escribir reglas para cada situación concreta y le da más confianza en que sus agentes aguanten casos que no cubren sus pruebas.

Lo que falta es casi todo lo demás: no hay ficha técnica, ni ventana de contexto, ni precios, ni fecha de disponibilidad, ni una versión del modelo identificada con más precisión que un nombre comercial. El 20% es una mejora sobre la evaluación que Basis se ha hecho a sí misma, y la comparación de velocidad enfrenta dos modelos del mismo proveedor.

Para quien trabaja con agentes sobre tareas largas, el dato a seguir es el ajuste dinámico de razonamiento sin perder la caché, porque ataca el coste real de operar estas cargas. El resto habrá que verlo cuando OpenAI publique números que no vengan de su propia página de clientes.