BookinglyTech News
Redes y nube

Cloudflare separa el entrenamiento de IA de la indexación en buscadores

La compañía cambia su botón único de bloqueo de bots por tres políticas independientes y añade una directiva que deja fuera el entrenamiento sin cortar el rastreo de búsqueda.

2 min de lecturaDev.to0 vistas

Cloudflare ha metido un control nuevo para separar dos cosas que hasta ahora iban pegadas: que un buscador indexe tu web y que un modelo de IA se entrene con ella. La pieza central se llama Disallow AI Training, una directiva que se publica en el robots.txt del sitio y que excluye el entrenamiento mientras los crawlers de uso mixto siguen indexando. Llega dentro de la actualización de la compañía sobre crawlers de uso mixto responsable.

Tres políticas donde antes había un botón

El cambio de fondo es que Cloudflare abandona el interruptor único Block AI Bots. En su lugar hay tres controles separados: Search, para los rastreadores que indexan contenido para motores de búsqueda; Training, para los que recogen material destinado a entrenar modelos; y Agent, para agentes de IA que entran en un sitio a ejecutar tareas. Los nuevos valores por defecto pueden bloquear Training y Agent dejando Search permitido.

El detalle que importa: un rastreador que hace las dos cosas —indexar y recolectar— queda bloqueado si la configuración bloquea el entrenamiento. No se puede usar el acceso de búsqueda como puerta lateral hacia el corpus de entrenamiento. Ese era justo el agujero del botón antiguo: o lo permitías todo, o arriesgabas perder indexación en crawlers de doble uso.

robots.txt sincronizado, y quién lo respeta

Cloudflare también retira Managed Robots.txt y lo sustituye por Bot Preference Sync, que mantiene el robots.txt de la zona alineado con las políticas de bots de IA. Viene activado por defecto para clientes nuevos; los que ya lo eran tendrán una ruta de migración. Sin esa sincronización, alguien cambia el control en el panel y deja el robots.txt diciendo otra cosa, que es exactamente el desajuste que rompe estas políticas. Hay además presets de alta distintos para sitios con publicidad y sin ella, porque no son las mismas decisiones sobre descubrimiento, uso del contenido y acceso automatizado.

Lo demás depende de terceros. Cloudflare afirma que Apple, Google y Microsoft se han comprometido a respetar Disallow AI Training en un plazo determinado. El compromiso y la cifra son suyos, y no hay demo pública del mecanismo. Conviene tener claro qué es esto: una declaración de intenciones legible por máquina, no una barrera técnica. Un rastreador que ignore el robots.txt seguirá entrando igual.

Para quien administra una zona en Cloudflare, el trabajo empieza por revisar la configuración actual de AI Crawl Control y Bot Management, comprobar si el viejo Block AI Bots necesita migración y ver cómo queda el robots.txt después del cambio. Las políticas nuevas sirven para expresar una preferencia de acceso; el tráfico orgánico y la calidad del contenido siguen dependiendo de lo de siempre.