BookinglyTech News
Infraestructura

Los scrapers abusivos consumen más CPU que los usuarios legítimos en git.kernel.org

Konstantin Ryabitsev reporta que git.kernel.org dedica más CPU a generar HTML para scrapers que a otras peticiones legítimas, incluidas las clonaciones de git.

2 min de lecturaSimon Willison0 vistas

El problema de los scrapers abusivos no es nuevo, pero pocas veces se cuantifica tan claramente como lo ha hecho Konstantin Ryabitsev, administrador de la infraestructura de git.kernel.org, el repositorio oficial del kernel de Linux.

En un post en people.kernel.org, Ryabitsev desvela que la "radiación de fondo" de robots que arañan las páginas HTML del sitio supera con mucho al tráfico legítimo: "gastamos más ciclos de CPU renderizando commits para scrapers que en cualquier otro tipo de acceso legítimo, incluidas las clonaciones de git". Y añade que, en cinco nodos geo-distribuidos, hay 14 núcleos de CPU dedicados exclusivamente a generar esas páginas para los bots.

Kernel.org es un punto crítico del desarrollo de Linux. Miles de desarrolladores y sistemas de integración continua clonan repositorios cada día. Pero los scrapers no van a por el código: quieren las vistas HTML con el historial de commits, las diffs y los parches. Esas vistas se construyen dinámicamente y consumen recursos. Y muchos bots las recorren sin límite, ignorando robots.txt y las políticas de uso.

Ryabitsev lo describe como un problema estructural de la web moderna: la "radiación de fondo" de robots que consumen recursos sin permiso. No es exclusivo de kernel.org; cualquier servicio público que genere HTML dinámico está expuesto. Simon Willison, creador de Datasette, una herramienta que sirve grandes cantidades de páginas rastreables, confiesa que le preocupa lo mismo en su propio proyecto.

La discusión ha llegado a Hacker News, donde otros administradores comparten experiencias similares. Algunos proponen medidas como CAPTCHAs o autenticación, pero eso iría en contra del carácter abierto de estos servicios. Otros sugieren endurecer el control de tráfico mediante técnicas como las pruebas de trabajo o listas negras colaborativas. Por ahora, no hay una solución mágica.

Si administras un servicio web público, vale la pena revisar tus métricas: dedicar más CPU a los bots que a tus usuarios reales es más común de lo que parece.