BookinglyTech News
Redes y nube

Cloudflare añade un ajuste para permitir buscadores y bloquear entrenamiento de IA

Cloudflare lanza Disallow AI Training: permite rastreo de buscadores y bloquea el uso del contenido para entrenar modelos. Apple, Google y Microsoft dicen que la respetarán.

2 min de lecturaITHome0 vistas

Cloudflare ha añadido un ajuste llamado Disallow AI Training para que los administradores de sitios puedan seguir permitiendo el rastreo de los buscadores y, al mismo tiempo, bloquear el uso de su contenido para entrenar modelos de IA. La compañía lo presentó ayer y asegura que Apple, Google y Microsoft se han comprometido a respetarlo. La idea es separar dos cosas que hasta ahora iban mezcladas: que Google te indexe no debería obligarte a alimentar un modelo generativo.

Cómo funciona el bloqueo

Cuando el administrador activa la opción, Cloudflare sigue dejando pasar los rastreadores mixtos, esos que sirven tanto para búsqueda como para entrenamiento de IA, pero solo si el sistema los etiqueta como «Accountable», es decir, como responsables. El resto de rastreadores dedicados al entrenamiento de IA quedan bloqueados. Cloudflare advierte de que cortar el paso a esos rastreadores puede afectar al posicionamiento del sitio en los resultados de búsqueda. Es un aviso relevante: si el robot que entrena también indexa, bloquearlo sin matices tiene coste.

La empresa dice que la mayoría de sus clientes no tendrá que cambiar nada. Los que ya habían elegido «Block» o «Block on pages with ads» dentro de la configuración de Training pasarán automáticamente a «Disallow AI Training». Es decir, Cloudflare mantiene la decisión previa y la traslada al nuevo nombre, sin obligar a revisar cada zona.

Qué falta por llegar

El movimiento no depende solo de Cloudflare. Google va a lanzar en las próximas semanas una herramienta de transparencia a nivel de URL para Google-Extended. Apple está desarrollando su propia herramienta de ese tipo, también a nivel de URL. Microsoft planea apoyar a principios de 2027 el uso de robots.txt para rechazar el entrenamiento de IA. Son piezas distintas, pero apuntan al mismo problema: el estándar de robots.txt y las señales de los buscadores no estaban pensados para distinguir entre indexar y entrenar.

Para quien administra infraestructura web, la utilidad práctica está en no tener que elegir entre aparecer en Google y blindar el contenido frente a los modelos. Queda por ver cuántos rastreadores aceptan la etiqueta de «Accountable» y cómo se comportan los que no. También está por comprobar si las herramientas prometidas por Google, Apple y Microsoft llegan con el mismo nivel de control por URL o se quedan en algo más grueso.