Tutorial

Crawlers de IA: retomar el control de los sitios de sus clientes

Seguridad y monitorización4 min de lectura5 pasos

Desde julio de 2026, Cloudflare AI Audit clasifica los crawlers de IA en tres categorías distintas: búsqueda, entrenamiento y agentes autónomos. Bloquear todos los bots de IA sin distinción puede penalizar la indexación en los resultados de los buscadores con IA, mientras que permitirlo todo expone el contenido a ser capturado para entrenar modelos. Así puede calibrar su estrategia para cada familia.

Contenido· Las tres familias de crawlers de IA que conviene distinguir1/6
  1. 01Las tres familias de crawlers de IA que conviene distinguir
  2. 02Por qué diferenciar estas tres familias
  3. 03robots.txt: la primera línea de defensa
  4. 04Auditoría y configuración paso a paso
  5. 05No bloquearlo todo: los crawlers de búsqueda tienen valor
  6. 06Sitios de clientes sin Cloudflare: qué hacer

Las tres familias de crawlers de IA que conviene distinguir

Cloudflare AI Audit, actualizado el 1 de julio de 2026, clasifica los bots de IA en tres categorías con intenciones muy distintas: los crawlers de búsqueda (GPTBot, PerplexityBot, Amazonbot) alimentan las respuestas de IA y los buscadores generativos; los crawlers de entrenamiento (CCBot, Common Crawl, ClaudeBot en modo scraping) recopilan contenido para construir o afinar modelos; los agentes autónomos manejan navegadores sin sesión humana para realizar tareas por cuenta de un tercero. Tratar estas tres poblaciones de forma idéntica lleva a decisiones subóptimas: bloquear los crawlers de búsqueda elimina la visibilidad en las respuestas de IA, mientras que bloquear los agentes autónomos protege frente a la automatización no solicitada.

Por qué diferenciar estas tres familias

  • Visibilidad frente a exposición — permitir los crawlers de búsqueda aumenta las probabilidades de ser citado en las respuestas de IA; bloquear los crawlers de entrenamiento protege el contenido de mayor valor.
  • Control granular — robots.txt por User-agent permite una política por familia sin cortar la indexación SEO clásica.
  • Superficie de ataque de los agentes — un agente autónomo puede hacer scraping de un formulario o desencadenar acciones; su bloqueo a nivel de WAF es independiente del resto.
  • Respeto de la intención editorial — algunos contenidos (guías, tutoriales) están reservados a los lectores humanos y no deben alimentar un corpus de entrenamiento sin acuerdo.
  • Carga del servidor — los crawlers de entrenamiento suelen ser agresivos y no respetan Crawl-delay; identificarlos permite limitarlos a nivel de red.
  • Auditabilidad — Cloudflare AI Audit registra el tráfico por categoría, lo que hace que la decisión sea visible y reversible.

robots.txt: la primera línea de defensa

El archivo robots.txt es la declaración de intenciones más legible. Los crawlers bien configurados (GPTBot, PerplexityBot, Amazonbot) lo respetan. Los crawlers de entrenamiento menos escrupulosos (CCBot) lo respetan de forma variable. Los agentes autónomos por lo general lo ignoran. Por eso robots.txt debe completarse con reglas activas a nivel de red que cubran los comportamientos no conformes.

Auditoría y configuración paso a paso

  1. Auditar el tráfico con Cloudflare AI Audit

    En el panel de Cloudflare, abra Security > Bots > AI Audit. La interfaz muestra el volumen por categoría (búsqueda, entrenamiento, agentes) y por user-agent. Identifique los bots presentes y su peso real antes de configurar nada.

  2. Declarar la política por familia en robots.txt

    Añada bloques específicos: User-agent: GPTBot / Allow: / para los crawlers de búsqueda que quiera conservar; User-agent: CCBot / Disallow: / para los crawlers de entrenamiento que quiera bloquear; User-agent: * para la regla por defecto de SEO clásico. Cada user-agent declarado tiene prioridad sobre *.

  3. Crear una regla WAF de Cloudflare para los agentes autónomos

    En Security > WAF > Custom Rules, cree una regla dirigida a cf.bot_management.js_check_failed combinada con una puntuación de bot baja para los agentes que no respetan robots.txt. Elija la acción Block o Challenge según la tolerancia de su cliente.

  4. Bloquear en el WAF los crawlers de entrenamiento reticentes

    Para CCBot y los bots sin user-agent fiable, añada una regla WAF sobre http.user_agent contains "CCBot" con acción Block. Cloudflare AI Audit facilita la lista exacta de los user-agents vistos en la zona.

  5. Comprobar que la indexación SEO clásica se conserva

    Tras el despliegue, compruebe en Cloudflare Analytics que Googlebot, Bingbot y los crawlers SEO habituales no se ven afectados. Consulte Google Search Console para detectar cualquier error de rastreo introducido por las nuevas reglas.

No bloquearlo todo: los crawlers de búsqueda tienen valor

GPTBot (OpenAI), PerplexityBot y Amazonbot alimentan las respuestas de los buscadores generativos. Un sitio bloqueado para estos crawlers no aparece en los resúmenes de IA de ChatGPT ni de Perplexity. Para los sitios de clientes orientados a la captación, es una visibilidad que no conviene sacrificar. La estrategia recomendada: permitir los crawlers de búsqueda, bloquear los crawlers de entrenamiento y filtrar los agentes autónomos en el WAF.

Sitios de clientes sin Cloudflare: qué hacer

En los sitios alojados sin Cloudflare como proxy, robots.txt sigue siendo la única palanca declarativa. Complételo con directivas User-agent por cada bot conocido. En el servidor, configure Nginx o Apache para devolver un 403 a los user-agents más agresivos mediante reglas en el bloque server. En un VPS con acceso root, fail2ban puede leer los logs de acceso y banear por IP los crawlers que ignoran robots.txt.

Proteja los sitios de sus clientes

ServOrbit acompaña a las agencias en la gestión centralizada del alojamiento y la seguridad de sus clientes. Descubra cómo simplificar la supervisión y la protección de su parque.

¿Necesita ayuda?

Consulte nuestro centro de ayuda y nuestra FAQ, o contacte con nuestro equipo: llamada, WhatsApp o correo electrónico. Soporte en francés, inglés y árabe.

Escribir por WhatsAppse abre en una pestaña nueva