Apple, Google y Microsoft firman las reglas de rastreo de Cloudflare

Una nueva opción para rechazar el entrenamiento de IA elimina la disyuntiva entre aparecer en búsquedas y alimentar modelos

|4 min de lectura0
The entrance to a Cloudflare office, where the company drafted the crawler conditions Apple, Google and Microsoft have now agreed to meet
The entrance to a Cloudflare office, where the company drafted the crawler conditions Apple, Google and Microsoft have now agreed to meet

Tres de los mayores operadores de rastreadores de internet aceptaron un conjunto de condiciones redactado por un proveedor de red. Cloudflare anunció el 15 de septiembre que Apple, Google y Microsoft cumplen —o se comprometieron a cumplir en fechas concretas— una categoría que llama Accountable, y junto con ella lanzó una opción que permite a un sitio rechazar el entrenamiento de modelos de IA sin salir del buscador.

Claves del anuncio

  • El 17% de los sitios que usan Cloudflare ya bloquea el entrenamiento de IA, mientras que menos del 1% bloquea la búsqueda: una brecha sobre la que los rastreadores de uso mixto impedían actuar.
  • Obtener la categoría Accountable exige mecanismos de exclusión para entrenamiento y para resúmenes, informes a nivel de URL sobre qué se utilizó y la garantía de que rechazar el entrenamiento no moverá el posicionamiento en búsquedas.
  • La compatibilidad de Microsoft con robots.txt llegará a comienzos de 2027, así que hasta entonces la nueva opción no le comunica nada a Bing.

El dilema que crearon los rastreadores de uso mixto

Un rastreador de uso mixto descarga una página una sola vez y la destina a dos fines: construir un índice de búsqueda y entrenar un modelo. Los medios no tenían forma de separar ambos usos. Cerrarle la puerta al rastreador para proteger el contenido del entrenamiento también borraba las páginas del buscador, que para un negocio sostenido por publicidad o suscripciones es la mitad cara del trato.

Las cifras muestran hasta qué punto la preferencia está desequilibrada. Casi nadie renuncia a la búsqueda, y aproximadamente uno de cada seis sitios ha buscado algún mecanismo contra el entrenamiento. La nueva opción de Cloudflare, Disallow AI Training, escribe una directiva de no entrenamiento en robots.txt mediante Bot Preference Sync y deja que Applebot, Bingbot y Googlebot sigan indexando.

Por qué un archivo no bastaba

Publicar una directiva y que se respete son cosas distintas. Un robots.txt no puede identificar quién descarga una página, ni determinar con qué propósito, ni detener a un rastreador que lo ignore. Situado delante del origen, Cloudflare sí puede hacer las tres cosas y luego publicar en su servicio Radar lo que cada operador hizo en realidad: ahí reside la capacidad de exigir cumplimiento en la que se apoya esta categoría.

Los rastreadores dedicados solo al entrenamiento nunca fueron el caso difícil. Amazon, Anthropic, Meta y OpenAI operan bots separados para búsqueda y entrenamiento, de modo que bloquear el segundo no cuesta visibilidad. Esos operadores también figuran como Accountable.

Dónde está cada operador

Google respeta un Disallow sobre Google-Extended, ofrece un interruptor para resultados generativos en su portal para webmasters y afirma que sus herramientas de transparencia por URL llegarán en semanas. Apple respeta Applebot-Extended y lee nosnippet para los resúmenes, pero todavía no tiene herramienta de inspección y le mostró a Cloudflare una en desarrollo prevista para el año que viene. Ambas compañías sostienen que rechazar el entrenamiento no afecta el posicionamiento.

Microsoft es el hueco. Bing admite hoy la etiqueta NOARCHIVE, y su tratamiento de una preferencia de no entrenamiento vía robots.txt está previsto para comienzos de 2027. A quienes quieran quedar fuera del entrenamiento de Bing antes de esa fecha se les remite a NOARCHIVE o a las herramientas de retirada de contenido.

El próximo debate son los resúmenes, no el entrenamiento

Cloudflare separa las dos preguntas de forma deliberada. El entrenamiento decide si un contenido puede alimentar un modelo; la generación de resúmenes decide si alguien llega a visitar el sitio. Sus propios datos vuelven concreta esa tensión: más de la mitad de los consumidores lee los resúmenes de búsqueda, y esos lectores tienen más de un 40% de probabilidad adicional de dejar de buscar después; sin embargo, quienes sí llegan desde una búsqueda con IA convierten entre tres y cinco veces más que el tráfico de búsqueda tradicional.

Un sí o un no para todo el sitio resulta demasiado tosco para ese equilibrio, así que el objetivo declarado para comienzos del año próximo es poder controlar cuánto contenido puede tomar un resumen, configurado una sola vez en la red y no operador por operador, y expresado mediante el estándar emergente ai-prefs.

Para Cloudflare, que viene sosteniendo que la web debe reconstruirse en torno al tráfico de agentes y no al tráfico humano, escribir las reglas que después firman Apple, Google y Microsoft es la victoria más duradera. Los controles ya están activos en todos los planes.

Preguntas frecuentes

¿Rechazar el entrenamiento de IA saca mi sitio de la Búsqueda de Google?

No. Los rastreadores de uso mixto considerados Accountable, como Googlebot y Applebot, siguen rastreando para la búsqueda con la nueva opción, y tanto Google como Apple afirmaron que excluirse del entrenamiento no afecta el posicionamiento. Elegir Block, en cambio, detiene por completo a esos rastreadores, búsqueda incluida.

¿Qué rastreadores detiene Disallow AI Training?

Todos los rastreadores de entrenamiento salvo los de uso mixto con categoría Accountable, incluidos los bots dedicados solo al entrenamiento de Amazon, Anthropic, Meta y OpenAI. Bloquearlos no acarrea penalización en búsqueda, porque cada empresa opera un rastreador aparte para indexar.

¿La opción está disponible en los planes gratuitos?

Sí. Cloudflare afirma que los controles alcanzan a todos los clientes en todos los planes y se configuran por dominio en los ajustes de seguridad. A los dominios incorporados desde el 15 de septiembre se les ofrecen configuraciones predefinidas que varían según si el sitio muestra publicidad.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Universal Music firma con ElevenLabs su primer acuerdo con un gran sello para una plataforma de remezclas con licencia
Tech & Business

Universal Music firma con ElevenLabs su primer acuerdo con un gran sello para una plataforma de remezclas con licencia

UMG y ElevenLabs construirán una plataforma de consumo para remezclas y mezclas combinadas a partir de catálogo con licencia, el primer acuerdo de la empresa de audio con un gran sello.

Seung Junghace 6 días
La Corte Suprema de Nuevo México multa con 5.000 dólares a un abogado por los testigos falsos de ChatGPT
Tech & Business

La Corte Suprema de Nuevo México multa con 5.000 dólares a un abogado por los testigos falsos de ChatGPT

La Corte Suprema de Nuevo México multó con 5.000 dólares al abogado Stephen Aarons y lo declaró en desacato después de que ChatGPT inventara testigos y testimonio policial en una apelación.

Seung Junghace 6 días
Moonshot AI apunta a 2.000 millones de dólares tras triplicar ingresos con Kimi K3
Tech & Business

Moonshot AI apunta a 2.000 millones de dólares tras triplicar ingresos con Kimi K3

Moonshot AI dijo a sus inversores que apunta a 2.000 millones de dólares de ingresos anualizados a cierre de año, después de que Kimi K3 llevara su ritmo por encima de los 1.000 millones en agosto.

Seung Junghace 6 días
El acuerdo de ChatGPT de un dólar en Washington expira. Su relevo factura por token
Tech & Business

El acuerdo de ChatGPT de un dólar en Washington expira. Su relevo factura por token

El nuevo acuerdo de OpenAI con la GSA, de 27 meses, exime la licencia de 15 dólares por puesto y reduce a la mitad las tarifas por token, pero cobra por consumo desde el 1 de octubre.

Seung Junghace 5 días
Un modelo de 30B superó a uno de 550B en la propia planificación fabril de Nvidia
Tech & Business

Un modelo de 30B superó a uno de 550B en la propia planificación fabril de Nvidia

Nvidia y Palantir publicaron una brecha de 86,7% frente a 55,5% a favor de un modelo de 30B ajustado sobre uno general de 550B en su propia asignación de materiales.

Seung Junghace 5 días
Nvidia gastó 27.000 millones de dólares sin presentar una sola notificación de fusión. El Departamento de Justicia quiere saber por qué
Tech & Business

Nvidia gastó 27.000 millones de dólares sin presentar una sola notificación de fusión. El Departamento de Justicia quiere saber por qué

Las autoridades antimonopolio abrieron el primer examen serio de la estructura que reemplazó a la adquisición en la industria de la IA: Nvidia recibió un requerimiento formal de información del Departamento de Justicia.

Seung Junghace 5 días