Las tres familias de crawlers de IA que conviene distinguir
Cloudflare AI Audit, actualizado el 1 de julio de 2026, clasifica los bots de IA en tres categorías con intenciones muy distintas: los crawlers de búsqueda (GPTBot, PerplexityBot, Amazonbot) alimentan las respuestas de IA y los buscadores generativos; los crawlers de entrenamiento (CCBot, Common Crawl, ClaudeBot en modo scraping) recopilan contenido para construir o afinar modelos; los agentes autónomos manejan navegadores sin sesión humana para realizar tareas por cuenta de un tercero. Tratar estas tres poblaciones de forma idéntica lleva a decisiones subóptimas: bloquear los crawlers de búsqueda elimina la visibilidad en las respuestas de IA, mientras que bloquear los agentes autónomos protege frente a la automatización no solicitada.
Por qué diferenciar estas tres familias
- Visibilidad frente a exposición — permitir los crawlers de búsqueda aumenta las probabilidades de ser citado en las respuestas de IA; bloquear los crawlers de entrenamiento protege el contenido de mayor valor.
- Control granular — robots.txt por User-agent permite una política por familia sin cortar la indexación SEO clásica.
- Superficie de ataque de los agentes — un agente autónomo puede hacer scraping de un formulario o desencadenar acciones; su bloqueo a nivel de WAF es independiente del resto.
- Respeto de la intención editorial — algunos contenidos (guías, tutoriales) están reservados a los lectores humanos y no deben alimentar un corpus de entrenamiento sin acuerdo.
- Carga del servidor — los crawlers de entrenamiento suelen ser agresivos y no respetan Crawl-delay; identificarlos permite limitarlos a nivel de red.
- Auditabilidad — Cloudflare AI Audit registra el tráfico por categoría, lo que hace que la decisión sea visible y reversible.
robots.txt: la primera línea de defensa
El archivo robots.txt es la declaración de intenciones más legible. Los crawlers bien configurados (GPTBot, PerplexityBot, Amazonbot) lo respetan. Los crawlers de entrenamiento menos escrupulosos (CCBot) lo respetan de forma variable. Los agentes autónomos por lo general lo ignoran. Por eso robots.txt debe completarse con reglas activas a nivel de red que cubran los comportamientos no conformes.
Auditoría y configuración paso a paso
Auditar el tráfico con Cloudflare AI Audit
En el panel de Cloudflare, abra Security > Bots > AI Audit. La interfaz muestra el volumen por categoría (búsqueda, entrenamiento, agentes) y por user-agent. Identifique los bots presentes y su peso real antes de configurar nada.
Declarar la política por familia en robots.txt
Añada bloques específicos: User-agent: GPTBot / Allow: / para los crawlers de búsqueda que quiera conservar; User-agent: CCBot / Disallow: / para los crawlers de entrenamiento que quiera bloquear; User-agent: * para la regla por defecto de SEO clásico. Cada user-agent declarado tiene prioridad sobre *.
Crear una regla WAF de Cloudflare para los agentes autónomos
En Security > WAF > Custom Rules, cree una regla dirigida a cf.bot_management.js_check_failed combinada con una puntuación de bot baja para los agentes que no respetan robots.txt. Elija la acción Block o Challenge según la tolerancia de su cliente.
Bloquear en el WAF los crawlers de entrenamiento reticentes
Para CCBot y los bots sin user-agent fiable, añada una regla WAF sobre http.user_agent contains "CCBot" con acción Block. Cloudflare AI Audit facilita la lista exacta de los user-agents vistos en la zona.
Comprobar que la indexación SEO clásica se conserva
Tras el despliegue, compruebe en Cloudflare Analytics que Googlebot, Bingbot y los crawlers SEO habituales no se ven afectados. Consulte Google Search Console para detectar cualquier error de rastreo introducido por las nuevas reglas.
No bloquearlo todo: los crawlers de búsqueda tienen valor
GPTBot (OpenAI), PerplexityBot y Amazonbot alimentan las respuestas de los buscadores generativos. Un sitio bloqueado para estos crawlers no aparece en los resúmenes de IA de ChatGPT ni de Perplexity. Para los sitios de clientes orientados a la captación, es una visibilidad que no conviene sacrificar. La estrategia recomendada: permitir los crawlers de búsqueda, bloquear los crawlers de entrenamiento y filtrar los agentes autónomos en el WAF.
Sitios de clientes sin Cloudflare: qué hacer
En los sitios alojados sin Cloudflare como proxy, robots.txt sigue siendo la única palanca declarativa. Complételo con directivas User-agent por cada bot conocido. En el servidor, configure Nginx o Apache para devolver un 403 a los user-agents más agresivos mediante reglas en el bloque server. En un VPS con acceso root, fail2ban puede leer los logs de acceso y banear por IP los crawlers que ignoran robots.txt.