Tres de los mayores operadores de rastreadores de internet aceptaron un conjunto de condiciones redactado por un proveedor de red. Cloudflare anunció el 15 de septiembre que Apple, Google y Microsoft cumplen —o se comprometieron a cumplir en fechas concretas— una categoría que llama Accountable, y junto con ella lanzó una opción que permite a un sitio rechazar el entrenamiento de modelos de IA sin salir del buscador.
Claves del anuncio
- El 17% de los sitios que usan Cloudflare ya bloquea el entrenamiento de IA, mientras que menos del 1% bloquea la búsqueda: una brecha sobre la que los rastreadores de uso mixto impedían actuar.
- Obtener la categoría Accountable exige mecanismos de exclusión para entrenamiento y para resúmenes, informes a nivel de URL sobre qué se utilizó y la garantía de que rechazar el entrenamiento no moverá el posicionamiento en búsquedas.
- La compatibilidad de Microsoft con robots.txt llegará a comienzos de 2027, así que hasta entonces la nueva opción no le comunica nada a Bing.
El dilema que crearon los rastreadores de uso mixto
Un rastreador de uso mixto descarga una página una sola vez y la destina a dos fines: construir un índice de búsqueda y entrenar un modelo. Los medios no tenían forma de separar ambos usos. Cerrarle la puerta al rastreador para proteger el contenido del entrenamiento también borraba las páginas del buscador, que para un negocio sostenido por publicidad o suscripciones es la mitad cara del trato.
Las cifras muestran hasta qué punto la preferencia está desequilibrada. Casi nadie renuncia a la búsqueda, y aproximadamente uno de cada seis sitios ha buscado algún mecanismo contra el entrenamiento. La nueva opción de Cloudflare, Disallow AI Training, escribe una directiva de no entrenamiento en robots.txt mediante Bot Preference Sync y deja que Applebot, Bingbot y Googlebot sigan indexando.
Por qué un archivo no bastaba
Publicar una directiva y que se respete son cosas distintas. Un robots.txt no puede identificar quién descarga una página, ni determinar con qué propósito, ni detener a un rastreador que lo ignore. Situado delante del origen, Cloudflare sí puede hacer las tres cosas y luego publicar en su servicio Radar lo que cada operador hizo en realidad: ahí reside la capacidad de exigir cumplimiento en la que se apoya esta categoría.
Los rastreadores dedicados solo al entrenamiento nunca fueron el caso difícil. Amazon, Anthropic, Meta y OpenAI operan bots separados para búsqueda y entrenamiento, de modo que bloquear el segundo no cuesta visibilidad. Esos operadores también figuran como Accountable.
Dónde está cada operador
Google respeta un Disallow sobre Google-Extended, ofrece un interruptor para resultados generativos en su portal para webmasters y afirma que sus herramientas de transparencia por URL llegarán en semanas. Apple respeta Applebot-Extended y lee nosnippet para los resúmenes, pero todavía no tiene herramienta de inspección y le mostró a Cloudflare una en desarrollo prevista para el año que viene. Ambas compañías sostienen que rechazar el entrenamiento no afecta el posicionamiento.
Microsoft es el hueco. Bing admite hoy la etiqueta NOARCHIVE, y su tratamiento de una preferencia de no entrenamiento vía robots.txt está previsto para comienzos de 2027. A quienes quieran quedar fuera del entrenamiento de Bing antes de esa fecha se les remite a NOARCHIVE o a las herramientas de retirada de contenido.
El próximo debate son los resúmenes, no el entrenamiento
Cloudflare separa las dos preguntas de forma deliberada. El entrenamiento decide si un contenido puede alimentar un modelo; la generación de resúmenes decide si alguien llega a visitar el sitio. Sus propios datos vuelven concreta esa tensión: más de la mitad de los consumidores lee los resúmenes de búsqueda, y esos lectores tienen más de un 40% de probabilidad adicional de dejar de buscar después; sin embargo, quienes sí llegan desde una búsqueda con IA convierten entre tres y cinco veces más que el tráfico de búsqueda tradicional.
Un sí o un no para todo el sitio resulta demasiado tosco para ese equilibrio, así que el objetivo declarado para comienzos del año próximo es poder controlar cuánto contenido puede tomar un resumen, configurado una sola vez en la red y no operador por operador, y expresado mediante el estándar emergente ai-prefs.
Para Cloudflare, que viene sosteniendo que la web debe reconstruirse en torno al tráfico de agentes y no al tráfico humano, escribir las reglas que después firman Apple, Google y Microsoft es la victoria más duradera. Los controles ya están activos en todos los planes.
Preguntas frecuentes
¿Rechazar el entrenamiento de IA saca mi sitio de la Búsqueda de Google?
No. Los rastreadores de uso mixto considerados Accountable, como Googlebot y Applebot, siguen rastreando para la búsqueda con la nueva opción, y tanto Google como Apple afirmaron que excluirse del entrenamiento no afecta el posicionamiento. Elegir Block, en cambio, detiene por completo a esos rastreadores, búsqueda incluida.
¿Qué rastreadores detiene Disallow AI Training?
Todos los rastreadores de entrenamiento salvo los de uso mixto con categoría Accountable, incluidos los bots dedicados solo al entrenamiento de Amazon, Anthropic, Meta y OpenAI. Bloquearlos no acarrea penalización en búsqueda, porque cada empresa opera un rastreador aparte para indexar.
¿La opción está disponible en los planes gratuitos?
Sí. Cloudflare afirma que los controles alcanzan a todos los clientes en todos los planes y se configuran por dominio en los ajustes de seguridad. A los dominios incorporados desde el 15 de septiembre se les ofrecen configuraciones predefinidas que varían según si el sitio muestra publicidad.






