4 min de lectura

Cloudflare separa el tráfico de IA en tres tipos controlables

Cloudflare está separando el tráfico de IA en las categorías Búsqueda, Agente y Entrenamiento, con nuevos controles, valores predeterminados, visibilidad en BotBase y señales sobre el uso del contenid

Imagen: Hacker News

Cloudflare está dando a los propietarios de sitios web un control más fino sobre el tráfico automatizado, reemplazando su enfoque amplio de «Bloquear bots de IA» por controles separados para rastreadores de Búsqueda, Agente y Entrenamiento.

La compañía presentó su primer Content Independence Day hace un año, argumentando que el pacto tradicional de la web —los rastreadores reciben contenido y los editores reciben tráfico de referencia— ya no se mantenía cuando los sistemas de IA recopilaban contenido sin devolver valor. Respondió con una opción de bloqueo con un clic y un mercado Pay-Per-Crawl.

Cloudflare ahora dice que los propietarios de sitios necesitan más flexibilidad que bloquear toda la automatización. Para sitios más pequeños, bloquear todos los rastreadores de IA también puede significar desaparecer de los resultados de búsqueda, creando una disyuntiva entre la capacidad de descubrimiento y la protección del contenido.

Las tres categorías de tráfico de IA de Cloudflare

La taxonomía actualizada clasifica el tráfico automatizado según lo que hace en un sitio:

  • Búsqueda: Rastrear o indexar contenido para responder preguntas más adelante. Cloudflare dice que este comportamiento debería, por lo general, generar referencias u otra compensación equitativa.
  • Agente: Actuar en tiempo real en nombre de una persona, incluidos bots de consulta de chat como ChatGPT-User y agentes que usan el navegador, como Gemini o Claude que manejan Chrome.
  • Entrenamiento: Recopilar contenido para entrenar o ajustar un modelo, incorporando de forma permanente los datos en la arquitectura subyacente del modelo.

Un rastreador puede tener más de una clasificación. Cloudflare insta a los operadores a separar la automatización por propósito, permitiendo que los propietarios de sitios entiendan por qué un bot visita y apliquen reglas de acceso más precisas. Otras clasificaciones incluyen Transact, Data Collection, Security Testing, SEO, Ads Verification, Social / Link Preview, Feed Fetching y Monitoring & Operations.

Recomendado

DeepSeek pausa la recaudación de fondos tras filtrarse comentarios sobre su capacidad de c

Los nuevos controles de Búsqueda, Agente y Entrenamiento están disponibles para todos los clientes de Cloudflare, incluidos los del nivel gratuito. Cloudflare anunció las opciones actualizadas el 1 de julio de 2026.

Nuevos valores predeterminados llegan el 15 de septiembre

El 15 de septiembre de 2026, los nuevos dominios que se unan a Cloudflare tendrán bloqueados por defecto los rastreadores de Entrenamiento y Agente en las páginas que muestren anuncios. Búsqueda permanecerá permitida por defecto, reflejando su papel en dirigir visitantes de vuelta a un sitio.

Los rastreadores multipropósito estarán gobernados por todas sus conductas aplicables. Como resultado, rastreadores como Googlebot, Applebot y BingBot serán bloqueados por clientes que opten por bloquear Entrenamiento, incluso cuando esos rastreadores también realicen funciones de Búsqueda.

Los propietarios de sitios pueden optar por no aceptar los nuevos valores predeterminados en su configuración de Seguridad antes del 15 de septiembre. Cloudflare dice que seguirá notificando a los clientes con antelación a este cambio.

BotBase añade visibilidad de bots para Enterprise

Cloudflare también está lanzando BotBase, una base de datos buscable de bots y agentes conocidos para clientes de Enterprise Bot Management. El panel muestra las clasificaciones de cada bot, permite a los clientes filtrar el tráfico de un bot específico y expone su ID de detección para su uso en reglas de Seguridad.

Cloudflare planea ampliar BotBase más adelante este año, pasando de una herramienta de visibilidad a un centro de control para el acceso automatizado al contenido.

La compañía también está añadiendo reglas basadas en cómo los bots usan el contenido después de recuperarlo:

  • Inmediato: Interactuar con el contenido pero no almacenar ni reutilizar nada.
  • Referencia: Indexar, extraer fragmentos y enlazar de vuelta. Este es el valor predeterminado.
  • Completo: Resumir y reproducir el contenido.

Estas preferencias se pueden combinar con las clasificaciones —por ejemplo, permitiendo bots de Búsqueda, SEO y Verificación de anuncios solo en el nivel de referencia.

Cloudflare está probando un nuevo campo use en su extensión Content Signals para robots.txt: use=immediate, use=reference o use=full. Los archivos robots.txt gestionados que ya incluyen search=yes,ai-train=no ahora también recibirán use=reference.

Cloudflare dice que rastreará el uso del contenido en BotBase y eliminará el estado Verificado de un bot si abusa de estas señales. Los bots que reproducen el contenido en su totalidad actualmente no pueden recibir el estado Verificado.

El significado de Verificado también está cambiando. Los bots Verificados ya no se considerarán automáticamente permitidos; su categoría relevante debe estar también autorizada. Cloudflare dice que está abriendo y haciendo más transparente el proceso de verificación, que exige que los operadores se identifiquen honestamente y eviten abusar del acceso que proporciona ese estado. La compañía también está experimentando con «confianza transitiva» para bots operados a través de plataformas de terceros, usando la cabecera Forwarded existente como parte de la propuesta.

Ava Chen

AI Editor

Ava covers the rapidly evolving world of artificial intelligence, from foundational models and research labs to the real-world economics of intelligence. With a background in computational linguistics, she cuts through the hype to find out what actually works. She firmly believes that benchmarks are just marketing until reproduced in the wild.

vía Hacker News

/ Sigue leyendo