BookinglyTech News
Ciberseguridad

Escáneres de GitHub Actions fallan en detectar gran parte de los riesgos de IA

Un estudio de 80 flujos de trabajo etiquetados manualmente muestra que los dos escáneres evaluados detectan poco menos de la mitad de los problemas reales.

1 min de lecturar/devops0 vistas

El autor analizó 80 flujos de trabajo de GitHub Actions, etiquetados a mano, para medir cuántos contienen agentes de IA que procesan texto externo (por ejemplo, Claude Code o Gemini CLI) y cuántos escáneres pueden detectarlos.

De los 49 flujos evaluables en un muestreo sin sesgo, 18 presentaban esa vulnerabilidad, lo que representa un 36,7 % (intervalo de confianza Wilson 95 %: 24,7‑50,7 %). No es una minoría, pero tampoco la mayoría.

Se probaron dos herramientas en un segundo conjunto de 30 flujos, de los cuales 12 contenían vulnerabilidades alcanzables externamente. ARKEXA alcanzó 67 % de precisión y 17 % de recall, con sólo 0,2 falsos positivos por archivo. zizmor 1.30.0 obtuvo 43 % de precisión pero 100 % de recall, reportando 211 hallazgos, de los cuales 16 correspondían a flujos que un humano consideró limpios. En resumen, ARKEXA genera menos ruido pero pierde 10 de 12 problemas reales; zizmor captura todo, pero con un nivel de ruido inaceptable para CI sin filtro.

El repositorio incluye método, corpus, etiquetas y semillas. Un tercer escáner, poutine, quedó sin puntuación por falta de binario Windows.

Estos resultados indican que, por ahora, ninguno de los escáneres está listo para usarse en CI sin un proceso de triage que gestione falsos positivos y falsos negativos.