الفئات الثلاث من زواحف الذكاء الاصطناعي
يصنّف Cloudflare AI Audit المحدَّث في 1 يوليو 2026 البوتات في ثلاث فئات: زواحف البحث (GPTBot وPerplexityBot وAmazonbot) تغذّي الإجابات الاصطناعية؛ زواحف التدريب (CCBot وCommon Crawl) تجمع المحتوى لبناء النماذج؛ والوكلاء المستقلون يشغّلون المتصفحات دون جلسة بشرية.
لماذا يهمّ التمييز بين هذه الفئات
- **الظهور مقابل الكشف** — يعزّز السماح لزواحف البحث فرص الاستشهاد بالموقع في إجابات الذكاء الاصطناعي.
- **تحكم دقيق** — يتيح robots.txt عبر User-agent وضع سياسة لكل فئة.
- **سطح هجوم الوكلاء** — قد يكشط الوكيل المستقل نموذجًا أو يشغّل إجراءات.
- **النية التحريرية** — بعض المحتوى مخصص للقراء البشريين ولا ينبغي أن يغذّي مجموعة تدريب.
- **حمل الخادم** — زواحف التدريب شرسة ولا تحترم Crawl-delay.
- **قابلية التدقيق** — يتتبّع Cloudflare AI Audit الحركة حسب الفئة.
robots.txt: خط الدفاع الأول
ملف robots.txt أكثر إعلانات النية قابلية للقراءة. تحترمه الزواحف المهيّئة جيدًا. أما الوكلاء المستقلون فيتجاهلونه عمومًا. لذا يجب تكملته بقواعد نشطة على مستوى الشبكة.
التدقيق والضبط خطوة بخطوة
تدقيق الحركة عبر Cloudflare AI Audit
في لوحة تحكم Cloudflare، افتح Security > Bots > AI Audit. تعرض الواجهة الحجم حسب الفئة وحسب user-agent.
الإعلان عن السياسة لكل فئة في robots.txt
أضيفوا User-agent: GPTBot / Allow: / لزواحف البحث؛ وUser-agent: CCBot / Disallow: / لزواحف التدريب.
إنشاء قاعدة WAF في Cloudflare للوكلاء المستقلين
في Security > WAF > Custom Rules، أنشئوا قاعدة تستهدف cf.bot_management.js_check_failed مع نتيجة بوت منخفضة.
حجب زواحف التدريب على مستوى WAF
لـ CCBot، أضيفوا قاعدة WAF على http.user_agent contains "CCBot" بإجراء Block.
التحقّق من الحفاظ على فهرسة محركات البحث
بعد النشر، تحققوا في Cloudflare Analytics من عدم تأثر Googlebot وBingbot.
لا تحجبوا كل شيء: لزواحف البحث قيمة
GPTBot وPerplexityBot وAmazonbot يغذّون إجابات محركات البحث التوليدية. موقع محجوب أمامها لا يظهر في ملخصات ChatGPT أو Perplexity.
مواقع العملاء بدون Cloudflare
للمواقع بدون Cloudflare، يبقى robots.txt الرافعة الوحيدة. على VPS بصلاحيات root، يمكن لـ fail2ban قراءة سجلات الوصول وحجب الزواحف التي تتجاهل robots.txt.