BookinglyTech News
Inteligencia artificial

La autonomía de la IA duplica su horizonte de tarea cada 4,7 meses

Un ensayo de ingeniería sostiene que el riesgo de un sistema de IA depende de sus permisos, no de la capacidad del modelo, y cita la última medición del AISI

2 min de lecturaDev.to0 vistas

Un ingeniero de software e investigador indio que firma como rjshree sostiene que la pregunta importante sobre la IA ya no es cuánto sabe un modelo, sino qué se le permite hacer. Su tesis de fondo: dos sistemas montados sobre el mismo modelo pueden tener riesgos muy distintos según los permisos que los rodeen. Para apoyarla recurre a las mediciones del Instituto de Seguridad de IA del Reino Unido (AISI).

De ocho meses a menos de cinco

El AISI mide los llamados horizontes temporales: cuánto dura la tarea que un modelo puede completar de forma autónoma dentro de un entorno de evaluación, con un 80% de fiabilidad. En febrero de 2026 el instituto estimó que esa duración se duplicaba cada 4,7 meses desde finales de 2024, por debajo de los ocho meses que calculaba en noviembre de 2025. Más tarde informó de que los modelos nuevos superaban las dos tendencias anteriores, aunque avisó de que es pronto para saber si eso fija un ritmo de progreso duradero. La evaluación es acotada y no equivale a decir que un modelo pueda hacer cualquier tarea humana equivalente.

El resto del texto es razonamiento de ingeniería, no resultado de laboratorio. Un modelo pasivo recibe un prompt y devuelve un análisis; un modelo agéntico encadena objetivo, razonamiento, uso de herramientas, acción externa y realimentación, con acceso a sistema de ficheros, navegador, ejecución de código, APIs, bases de datos o infraestructura. Lo que cambia no es el modelo, sino su acceso, su autonomía, sus permisos, su escala y la reversibilidad de lo que hace. El autor lo resume en una idea: un modelo muy capaz sin privilegios tiene un radio de daño pequeño, y uno más flojo con credenciales amplias y permiso para tocar sistemas críticos puede montar un estropicio mucho mayor. No es una ecuación validada, admite, sino una forma de mirar el problema.

Del error informativo al error operativo

Un chatbot que alucina da una respuesta falsa. Un agente que alucina puede actuar sobre esa respuesta falsa. Si el sistema concluye por error que una configuración es insegura, el primero te lo dice y tú decides; el segundo puede cambiar la configuración, tocar ficheros, reiniciar un servicio, abrir un ticket o disparar un despliegue. El fallo deja de ser informativo y pasa a ser operativo.

De ahí la recomendación práctica: diseñar asumiendo que el modelo se equivocará, se confundirá, será manipulado o trabajará con información incompleta. Para quien despliega agentes, eso significa pensar en permisos mínimos, trazabilidad y vuelta atrás antes que en benchmarks.

Queda por ver si las cifras del AISI se sostienen. El propio instituto pide cautela y el ensayo no aporta datos propios: es una postura, no un informe.