TRAWL sube de HTTP a navegador solo cuando la web lo bloquea de verdad
El scraper self-hosted empieza cada petición como HTTP plano y escala por niveles: sesión cacheada, navegador nuevo y, como último recurso, ruta residencial.
TRAWL es un scraper self-hosted que arranca cada petición como HTTP plano y solo sube de nivel cuando el destino se lo impide. El orden de escalada es concreto: HTTP, sesión de navegador ya resuelta, navegador Camoufox nuevo y, en último lugar, una ruta residencial. El proyecto es código abierto y su autor lo ha publicado en el repositorio.
Quien haya montado FlareSolverr para un puñado de sitios detrás de Cloudflare probablemente esté manteniendo un navegador entero en marcha para peticiones que nunca lo necesitaron. Eso es exactamente lo que el autor dice haberse encontrado al construirlo, y el cambio de planteamiento es el que da sentido a la herramienta: la ruta residencial deja de ser el valor por defecto y pasa a ser el último escalón de una cadena que, en la mayoría de los casos, ni se recorre.
Un navegador caliente, no una granja
Las versiones anteriores mantenían varios navegadores precargados. Tenía su lógica si se mira solo la concurrencia, porque resolver un reto en paralelo sale más rápido con procesos ya listos. El problema es que ese default se diseñó pensando en máquinas grandes, y la mayoría de despliegues reales de esto no lo son. En un NAS donde el grueso del tráfico muere en la capa HTTP, tener navegadores esperando es memoria tirada.
El default actual es un único navegador caliente, y el pool se amplía solo si de verdad hace falta esa concurrencia. El autor no publica cifras de consumo ni comparativas, así que la mejora hay que tomarla como descripción de diseño, no como benchmark.
El resto del trabajo que menciona es el aburrido y suele ser el que decide si esto se puede operar: reciclado de navegadores, diagnóstico de memoria del contenedor, sesiones en Redis o en memoria, mejores logs y, sobre todo, poder averiguar por qué una petición concreta acabó escalando. Saber qué escalón se activó y por qué es media herramienta cuando algo se atasca a las tres de la mañana.
La pregunta que queda abierta es de infraestructura, no de scraping. Mantener sesiones de navegador contra sitios con protección anti-bot es un consumo de CPU y RAM que mucha gente descubre tarde, cuando ya lo tiene corriendo en un mini PC o en un NAS viejo. Si el escalado es realmente incremental, la diferencia entre este enfoque y dejar un Chromium permanente se nota justo ahí, en el equipo más modesto del rack.
