لماذا يحدث هذا
- قاعدة
Disallow: /من بيئة اختبار تصل إلى الإنتاج - حجب شامل قُصد به إبقاء موقع ما قبل الإطلاق بعيدًا عن محركات البحث لا يُزال بعد الإطلاق. - قاعدة مخصصة لزاحف عدواني واحد تُطبَّق على كل شيء. يحجب فريق كل الزواحف لإيقاف جهة مسيئة واحدة، فيحجب معها كل وكيل ذكاء اصطناعي شرعي.
- قوائم حجب قديمة تسبق زواحف الذكاء الاصطناعي الحالية. ملف robots.txt كُتب قبل سنوات ضد قائمة ثابتة من "البوتات السيئة" يشمل الآن دون قصد وكلاء مستخدم للذكاء الاصطناعي جدد لم يفكر أحد في استثنائهم.
- إدراج مسارات حساسة في robots.txt وكأنه أداة للتحكم بالوصول. يضيف فريق
Disallow: /admin-backup/بنية إخفاء الدليل، دون إدراك أن الملف نفسه عام ويُعلن الآن بالضبط أين يجب البحث.
كيفية تحديد المشكلة
تفحص Scanverra ملف robots.txt الخاص بك بثلاث طرق، من الصياغة العامة وصولًا إلى نمطي فشل محددين خاصين بعصر الذكاء الاصطناعي:
- الصياغة وإمكانية الوصول. تشمل درجة SEO في تدقيق الموقع فحص robots.txt القياسي من Lighthouse - يتأكد من أن الملف قابل للوصول فعليًا (وليس استجابة 4xx/5xx) وأن كل توجيه فيه تتعرّف عليه الزواحف، منبّهًا إلى القواعد المشوَّهة كمشكلة SEO.
- حجب شامل لزواحف الذكاء الاصطناعي. فحص منفصل خاص بـ Scanverra يكتشف قاعدة
Disallow: /أوDisallow: /*شاملة تستهدف زواحف ذكاء اصطناعي معروفة - GPTBot وClaudeBot وCCBot وGoogle-Extended وPerplexityBot وما شابهها - ويُدرجها كمشكلة في درجة جاهزية الوكلاء (Agent Readiness) ضمن تدقيق الموقع. - howToRobotsTxt.identifyItem3
ثغرة حقيقية واحدة: لا يؤكد أي من الفحوص الثلاثة أن توجيه Sitemap: لديك يشير فعليًا إلى خريطة موقع حية وفعّالة - بل فقط أن السطر نفسه معترَف به من حيث الصياغة.
كيفية الإصلاح
1. استبدل الحجب الشامل للذكاء الاصطناعي بقواعد محددة، إن كنت تحجب أصلًا
قرّر بوعي أي زواحف ذكاء اصطناعي، إن وُجدت، تريد إبعادها فعلًا - واقصر التقييد على المسارات المحددة المهمة فقط، لا موقعك بأكمله:
1User-agent: GPTBot
2Disallow: /
3
4User-agent: ClaudeBot
5Disallow: /
6
7User-agent: CCBot
8Disallow: /1User-agent: *
2Allow: /
3Disallow: /internal-search/
4
5Sitemap: https://example.com/sitemap.xml2. لا تستخدم robots.txt أبدًا لإخفاء مسارات حساسة
إذا كان مسار ما يحتاج فعلًا للبقاء خاصًا، احمِه بمصادقة أو بوسم noindex على الصفحة نفسها - لا بقاعدة robots.txt عامة تُعلن فقط عن مكانه. أزل أي إدخالات Disallow تشير إلى أدلة إدارية أو نسخ احتياطية أو بيئات اختبار.
3. تأكد من نفاذ الإصلاح
أعد تشغيل تدقيق الموقع بعد تعديل robots.txt - سيعكس فحص "زواحف الذكاء الاصطناعي غير محجوبة" ضمن درجة جاهزية الوكلاء التغيير فورًا لأنه يقرأ الملف الحي في كل عملية فحص.
كيف تكتشف Scanverra هذه المشكلة
تُجري درجة SEO في تدقيق الموقع فحص صياغة وإمكانية وصول قياسيًا لـ robots.txt في كل عملية فحص. إضافة إلى ذلك، يقرأ فحص مخصص لزواحف الذكاء الاصطناعي نفس الملف الحي ويبحث تحديدًا عن حجب شامل من نوع Disallow يستهدف وكلاء مستخدم معروفين للذكاء الاصطناعي، مُظهِرًا ذلك ضمن درجة جاهزية الوكلاء؛ ويكتشف فحص منفصل في فحص الأمان المسارات التي تبدو حساسة والمذكورة في قواعد Disallow. ثلاثة فحوص، كل منها يبحث عن نمط فشل مختلف.