[{"data":1,"prerenderedAt":137},["ShallowReactive",2],{"seo-verification":3,"blog-crawlers-de-ia-proteger-los-sitios-de-clientes-es":6},{"google":4,"bing":5},"EycwPY2XMyTkVzas3n1ygeNJFGAH513qrMjfDljzsMQ","",{"key":7,"data":8},"blog-crawlers-de-ia-proteger-los-sitios-de-clientes-es",{"id":9,"slug":10,"slugs":11,"title":15,"excerpt":16,"readTime":17,"views":18,"isPinned":19,"publishedAt":20,"updatedAt":21,"category":22,"categories":28,"featuredImage":30,"bgImage":31,"posterImage":32,"relatedSolution":30,"intro":33,"sections":34,"ctaTitle":78,"ctaBody":79,"ctaButton":80,"ctaUrl":81,"relatedPosts":82},201,"crawlers-de-ia-proteger-los-sitios-de-clientes",{"fr":12,"en":13,"ar":14,"es":10},"crawlers-ia-search-training-agent","ai-crawlers-taking-back-control-over-your-clients-sites","زواحف-الذكاء-الاصطناعي-استعادة-السيطرة-على-مواقع-عملائكم","Crawlers de IA: retomar el control de los sitios de sus clientes","Cloudflare distingue tres familias de crawlers de IA. Cómo configurar robots.txt y las reglas de Cloudflare para proteger los sitios de sus clientes.",4,0,false,"2026-08-01T00:00:00+00:00","2026-09-07T11:26:10+00:00",{"id":23,"name":24,"slug":25,"color":26,"icon":27},8,"Seguridad y monitorización","securite-monitoring","bg-rose-500\u002F10 text-rose-400","security",[29],{"id":23,"name":24,"slug":25,"color":26,"icon":27},null,"\u002Fblog\u002Fcovers\u002Fbg.svg","\u002Fblog\u002Fcovers\u002Fcrawlers-ia-search-training-agent-poster.svg","Desde julio de 2026, Cloudflare AI Audit clasifica los crawlers de IA en tres categorías distintas: búsqueda, entrenamiento y agentes autónomos. Bloquear todos los bots de IA sin distinción puede penalizar la indexación en los resultados de los buscadores con IA, mientras que permitirlo todo expone el contenido a ser capturado para entrenar modelos. Así puede calibrar su estrategia para cada familia.",[35,39,49,52,71,75],{"type":36,"title":37,"body":38},"h2","Las tres familias de crawlers de IA que conviene distinguir","Cloudflare AI Audit, actualizado el 1 de julio de 2026, clasifica los bots de IA en tres categorías con intenciones muy distintas: los crawlers de búsqueda (GPTBot, PerplexityBot, Amazonbot) alimentan las respuestas de IA y los buscadores generativos; los crawlers de entrenamiento (CCBot, Common Crawl, ClaudeBot en modo scraping) recopilan contenido para construir o afinar modelos; los agentes autónomos manejan navegadores sin sesión humana para realizar tareas por cuenta de un tercero. Tratar estas tres poblaciones de forma idéntica lleva a decisiones subóptimas: bloquear los crawlers de búsqueda elimina la visibilidad en las respuestas de IA, mientras que bloquear los agentes autónomos protege frente a la automatización no solicitada.",{"type":40,"title":41,"items":42},"ul","Por qué diferenciar estas tres familias",[43,44,45,46,47,48],"**Visibilidad frente a exposición** — permitir los crawlers de búsqueda aumenta las probabilidades de ser citado en las respuestas de IA; bloquear los crawlers de entrenamiento protege el contenido de mayor valor.","**Control granular** — robots.txt por User-agent permite una política por familia sin cortar la indexación SEO clásica.","**Superficie de ataque de los agentes** — un agente autónomo puede hacer scraping de un formulario o desencadenar acciones; su bloqueo a nivel de WAF es independiente del resto.","**Respeto de la intención editorial** — algunos contenidos (guías, tutoriales) están reservados a los lectores humanos y no deben alimentar un corpus de entrenamiento sin acuerdo.","**Carga del servidor** — los crawlers de entrenamiento suelen ser agresivos y no respetan Crawl-delay; identificarlos permite limitarlos a nivel de red.","**Auditabilidad** — Cloudflare AI Audit registra el tráfico por categoría, lo que hace que la decisión sea visible y reversible.",{"type":36,"title":50,"body":51},"robots.txt: la primera línea de defensa","El archivo robots.txt es la declaración de intenciones más legible. Los crawlers bien configurados (GPTBot, PerplexityBot, Amazonbot) lo respetan. Los crawlers de entrenamiento menos escrupulosos (CCBot) lo respetan de forma variable. Los agentes autónomos por lo general lo ignoran. Por eso robots.txt debe completarse con reglas activas a nivel de red que cubran los comportamientos no conformes.",{"type":53,"title":54,"steps":55},"steps","Auditoría y configuración paso a paso",[56,59,62,65,68],{"title":57,"body":58},"Auditar el tráfico con Cloudflare AI Audit","En el panel de Cloudflare, abra Security > Bots > AI Audit. La interfaz muestra el volumen por categoría (búsqueda, entrenamiento, agentes) y por user-agent. Identifique los bots presentes y su peso real antes de configurar nada.",{"title":60,"body":61},"Declarar la política por familia en robots.txt","Añada bloques específicos: User-agent: GPTBot \u002F Allow: \u002F para los crawlers de búsqueda que quiera conservar; User-agent: CCBot \u002F Disallow: \u002F para los crawlers de entrenamiento que quiera bloquear; User-agent: * para la regla por defecto de SEO clásico. Cada user-agent declarado tiene prioridad sobre *.",{"title":63,"body":64},"Crear una regla WAF de Cloudflare para los agentes autónomos","En Security > WAF > Custom Rules, cree una regla dirigida a cf.bot_management.js_check_failed combinada con una puntuación de bot baja para los agentes que no respetan robots.txt. Elija la acción Block o Challenge según la tolerancia de su cliente.",{"title":66,"body":67},"Bloquear en el WAF los crawlers de entrenamiento reticentes","Para CCBot y los bots sin user-agent fiable, añada una regla WAF sobre http.user_agent contains \"CCBot\" con acción Block. Cloudflare AI Audit facilita la lista exacta de los user-agents vistos en la zona.",{"title":69,"body":70},"Comprobar que la indexación SEO clásica se conserva","Tras el despliegue, compruebe en Cloudflare Analytics que Googlebot, Bingbot y los crawlers SEO habituales no se ven afectados. Consulte Google Search Console para detectar cualquier error de rastreo introducido por las nuevas reglas.",{"type":72,"title":73,"body":74},"tip","No bloquearlo todo: los crawlers de búsqueda tienen valor","GPTBot (OpenAI), PerplexityBot y Amazonbot alimentan las respuestas de los buscadores generativos. Un sitio bloqueado para estos crawlers no aparece en los resúmenes de IA de ChatGPT ni de Perplexity. Para los sitios de clientes orientados a la captación, es una visibilidad que no conviene sacrificar. La estrategia recomendada: permitir los crawlers de búsqueda, bloquear los crawlers de entrenamiento y filtrar los agentes autónomos en el WAF.",{"type":36,"title":76,"body":77},"Sitios de clientes sin Cloudflare: qué hacer","En los sitios alojados sin Cloudflare como proxy, robots.txt sigue siendo la única palanca declarativa. Complételo con directivas User-agent por cada bot conocido. En el servidor, configure Nginx o Apache para devolver un 403 a los user-agents más agresivos mediante reglas en el bloque server. En un VPS con acceso root, fail2ban puede leer los logs de acceso y banear por IP los crawlers que ignoran robots.txt.","Proteja los sitios de sus clientes","ServOrbit acompaña a las agencias en la gestión centralizada del alojamiento y la seguridad de sus clientes. Descubra cómo simplificar la supervisión y la protección de su parque.","Soluciones para agencias","\u002Fsolutions\u002Fagences",[83,102,120],{"id":84,"slug":85,"slugs":86,"title":90,"excerpt":91,"readTime":92,"views":18,"isPinned":19,"publishedAt":93,"updatedAt":21,"category":94,"categories":99,"featuredImage":30,"bgImage":31,"posterImage":101,"relatedSolution":30},165,"powered-by-cloudflare-su-sitio-servorbit-protegido",{"fr":87,"en":88,"ar":89,"es":85},"pourquoi-votre-site-est-plus-rapide-protege","powered-by-cloudflare-your-servorbit-site-starts-protected","مدعوم-بـ-cloudflare-موقعك-على-servorbit-ينطلق-أفضل-حماية","Powered by Cloudflare: su sitio ServOrbit mejor protegido","ServOrbit usa Cloudflare para DNS, CDN, HTTPS y protección de red básica, sin prometer ninguna alianza implícita.",2,"2026-07-05T00:00:00+00:00",{"id":95,"name":96,"slug":97,"color":98,"icon":97},9,"Noticias","actualites","bg-sky-500\u002F10 text-sky-400",[100],{"id":95,"name":96,"slug":97,"color":98,"icon":97},"\u002Fblog\u002Fcovers\u002Fpourquoi-votre-site-est-plus-rapide-protege-poster.svg",{"id":103,"slug":104,"slugs":105,"title":109,"excerpt":110,"readTime":17,"views":111,"isPinned":19,"publishedAt":112,"updatedAt":21,"category":113,"categories":114,"featuredImage":30,"bgImage":31,"posterImage":116,"relatedSolution":117},108,"proteger-vps-con-crowdsec",{"fr":106,"en":107,"ar":108,"es":104},"securiser-vps-crowdsec","securing-your-vps-with-crowdsec","تأمين-خادمك-الافتراضي-vps-باستخدام-crowdsec","Proteger su VPS con CrowdSec","Despliegue CrowdSec en su VPS para bloquear los ataques gracias a una detección de comportamiento y a una blocklist comunitaria compartida.",1,"2026-03-04T00:00:00+00:00",{"id":23,"name":24,"slug":25,"color":26,"icon":27},[115],{"id":23,"name":24,"slug":25,"color":26,"icon":27},"\u002Fblog\u002Fcovers\u002Fsecuriser-vps-crowdsec-poster.svg",{"categorySlug":118,"appSlug":119},"ciberseguridad-bastion","crowdsec",{"id":121,"slug":122,"slugs":123,"title":127,"excerpt":128,"readTime":17,"views":18,"isPinned":19,"publishedAt":129,"updatedAt":21,"category":130,"categories":131,"featuredImage":30,"bgImage":31,"posterImage":133,"relatedSolution":134},105,"supervisar-vps-con-uptime-kuma",{"fr":124,"en":125,"ar":126,"es":122},"superviser-vps-uptime-kuma","monitoring-your-vps-with-uptime-kuma","مراقبة-خادمك-الافتراضي-vps-باستخدام-uptime-kuma","Supervisar su VPS con Uptime Kuma","Despliegue Uptime Kuma en su VPS para supervisar sus sitios y servicios en self-hosted, con alertas y página de estado pública.","2026-03-07T00:00:00+00:00",{"id":23,"name":24,"slug":25,"color":26,"icon":27},[132],{"id":23,"name":24,"slug":25,"color":26,"icon":27},"\u002Fblog\u002Fcovers\u002Fsuperviser-vps-uptime-kuma-poster.svg",{"categorySlug":135,"appSlug":136},"monitorizacion-observabilidad","uptime-kuma",1789665014520]