BookinglyTech News
Inteligencia artificial

GPT-6 Astra reduce alucinaciones pero sigue vulnerable a inyecciones indirectas

OpenAI presenta su nuevo modelo con mejoras en precisión y defensa ante jailbreaks, aunque la seguridad corporativa aún tiene asignatura pendiente.

2 min de lecturaThe Decoder0 vistas

OpenAI ha lanzado GPT-6 Astra, un modelo que reduce significativamente las alucinaciones y mejora la resistencia a los intentos de manipulación directa respecto a su predecesor, GPT-5.6 Sol. Sin embargo, las pruebas de terceros revelan que sigue siendo vulnerable a las inyecciones de prompts indirectas, un problema crítico para el despliegue de agentes de IA autónomos en entornos corporativos.

Según la ficha técnica del sistema proporcionada por OpenAI, Astra comete menos errores factuales que GPT-5.6 Sol. La compañía evaluó el modelo contra conversaciones de ChatGPT donde los usuarios habían reportado respuestas incorrectas, un escenario diseñado para maximizar la tasa de fallo. En estas condiciones extremas, Astra reprodujo mucho menos los errores reportados, con las mayores mejoras observadas en configuraciones de baja latencia y niveles de razonamiento bajos.

En cuanto a la seguridad, Astra demuestra una eficacia casi perfecta del 99,99% frente a inyecciones de prompts directas, gracias a su método GPT-Red que utiliza atacantes automatizados durante el entrenamiento. La resistencia a los jailbreaks también es alta: frente a un conjunto fijo de ataques conocidos, el modelo se niega a responder en entre el 91,5% y el 98,3% de los casos. No obstante, cuando el atacante adapta su estrategia a lo largo de múltiples rondas de conversación, la tasa de defensa cae al 67%, lo que significa que un adversario persistente puede obtener una respuesta problemática en aproximadamente una de cada tres intentos. Estos datos corresponden al modelo "a pelo", sin las capas de seguridad de producción como los clasificadores que se incluyen en el producto final.

El punto débil sigue siendo la inyección de prompts indirecta, donde el ataque se esconde dentro de un documento que la IA procesa. Gray Swan, una firma de seguridad, evaluó Astra en su IPI Arena utilizando 1.810 ataques curados. Con 15 intentos por escenario, Astra fue vulnerado al menos una vez en el 8,5% de los casos. Para comparar, GPT-5.6 Sol falló en el 27% y Claude Opus 5 mantuvo una tasa de éxito del ataque en un 4,8%. Aunque estas cifras mejoran respecto a pruebas anteriores, una vulnerabilidad en una de cada doce interacciones es un riesgo inaceptable para equipos de seguridad que despliegan agentes que escriben código, operan herramientas o controlan sistemas informáticos de forma autónoma y continua.