Scanverra

كيفية إصلاح حجب robots.txt لزواحف الذكاء الاصطناعي

ملف robots.txt هو ملف نصي عادي في جذر نطاقك يخبر الزواحف بالمسارات المسموح لها بطلبها. قاعدة Disallow واحدة واسعة النطاق - غالبًا منسوخة من بيئة اختبار أو مكتوبة لإيقاف بوت مسيء واحد - يمكن أن تحجب بصمت كل زاحف ذكاء اصطناعي عن موقعك بأكمله، مقصيةً إياك من نتائج البحث والمساعدات المدعومة بالذكاء الاصطناعي دون أي تحذير.

لماذا يحدث هذا

  • قاعدة Disallow: / من بيئة اختبار تصل إلى الإنتاج - حجب شامل قُصد به إبقاء موقع ما قبل الإطلاق بعيدًا عن محركات البحث لا يُزال بعد الإطلاق.
  • قاعدة مخصصة لزاحف عدواني واحد تُطبَّق على كل شيء. يحجب فريق كل الزواحف لإيقاف جهة مسيئة واحدة، فيحجب معها كل وكيل ذكاء اصطناعي شرعي.
  • قوائم حجب قديمة تسبق زواحف الذكاء الاصطناعي الحالية. ملف robots.txt كُتب قبل سنوات ضد قائمة ثابتة من "البوتات السيئة" يشمل الآن دون قصد وكلاء مستخدم للذكاء الاصطناعي جدد لم يفكر أحد في استثنائهم.
  • إدراج مسارات حساسة في robots.txt وكأنه أداة للتحكم بالوصول. يضيف فريق Disallow: /admin-backup/ بنية إخفاء الدليل، دون إدراك أن الملف نفسه عام ويُعلن الآن بالضبط أين يجب البحث.

كيفية تحديد المشكلة

تفحص Scanverra ملف robots.txt الخاص بك بثلاث طرق، من الصياغة العامة وصولًا إلى نمطي فشل محددين خاصين بعصر الذكاء الاصطناعي:

  • الصياغة وإمكانية الوصول. تشمل درجة SEO في تدقيق الموقع فحص robots.txt القياسي من Lighthouse - يتأكد من أن الملف قابل للوصول فعليًا (وليس استجابة 4xx/5xx) وأن كل توجيه فيه تتعرّف عليه الزواحف، منبّهًا إلى القواعد المشوَّهة كمشكلة SEO.
  • حجب شامل لزواحف الذكاء الاصطناعي. فحص منفصل خاص بـ Scanverra يكتشف قاعدة Disallow: / أو Disallow: /* شاملة تستهدف زواحف ذكاء اصطناعي معروفة - GPTBot وClaudeBot وCCBot وGoogle-Extended وPerplexityBot وما شابهها - ويُدرجها كمشكلة في درجة جاهزية الوكلاء (Agent Readiness) ضمن تدقيق الموقع.
  • howToRobotsTxt.identifyItem3

ثغرة حقيقية واحدة: لا يؤكد أي من الفحوص الثلاثة أن توجيه Sitemap: لديك يشير فعليًا إلى خريطة موقع حية وفعّالة - بل فقط أن السطر نفسه معترَف به من حيث الصياغة.

كيفية الإصلاح

1. استبدل الحجب الشامل للذكاء الاصطناعي بقواعد محددة، إن كنت تحجب أصلًا

قرّر بوعي أي زواحف ذكاء اصطناعي، إن وُجدت، تريد إبعادها فعلًا - واقصر التقييد على المسارات المحددة المهمة فقط، لا موقعك بأكمله:

قبل: يحجب كل زاحف ذكاء اصطناعي عن كل شيءtypescript
1User-agent: GPTBot
2Disallow: /
3
4User-agent: ClaudeBot
5Disallow: /
6
7User-agent: CCBot
8Disallow: /
بعد: يسمح لزواحف الذكاء الاصطناعي، ويبعدها عن مسار داخلي واحد فقطtypescript
1User-agent: *
2Allow: /
3Disallow: /internal-search/
4
5Sitemap: https://example.com/sitemap.xml

2. لا تستخدم robots.txt أبدًا لإخفاء مسارات حساسة

إذا كان مسار ما يحتاج فعلًا للبقاء خاصًا، احمِه بمصادقة أو بوسم noindex على الصفحة نفسها - لا بقاعدة robots.txt عامة تُعلن فقط عن مكانه. أزل أي إدخالات Disallow تشير إلى أدلة إدارية أو نسخ احتياطية أو بيئات اختبار.

3. تأكد من نفاذ الإصلاح

أعد تشغيل تدقيق الموقع بعد تعديل robots.txt - سيعكس فحص "زواحف الذكاء الاصطناعي غير محجوبة" ضمن درجة جاهزية الوكلاء التغيير فورًا لأنه يقرأ الملف الحي في كل عملية فحص.

كيف تكتشف Scanverra هذه المشكلة

تُجري درجة SEO في تدقيق الموقع فحص صياغة وإمكانية وصول قياسيًا لـ robots.txt في كل عملية فحص. إضافة إلى ذلك، يقرأ فحص مخصص لزواحف الذكاء الاصطناعي نفس الملف الحي ويبحث تحديدًا عن حجب شامل من نوع Disallow يستهدف وكلاء مستخدم معروفين للذكاء الاصطناعي، مُظهِرًا ذلك ضمن درجة جاهزية الوكلاء؛ ويكتشف فحص منفصل في فحص الأمان المسارات التي تبدو حساسة والمذكورة في قواعد Disallow. ثلاثة فحوص، كل منها يبحث عن نمط فشل مختلف.

FAQ

Frequently asked questions

هل تتحقق Scanverra من ملف robots.txt بأكمله؟

نعم، على طبقتين. تشمل درجة SEO في تدقيق الموقع فحص صياغة حقيقي لـ robots.txt - توجيهات غير معترف بها، حالة HTTP سيئة عند جلب الملف، ومشاكل تشوّه مشابهة. إضافة إلى ذلك، يعمل فحصان أكثر تحديدًا: هل يحجب بشكل شامل زواحف ذكاء اصطناعي معروفة، وهل تكشف أي قاعدة Disallow مسارات تبدو حساسة (كدليل إداري أو نسخة احتياطية) لأي شخص يقرأ الملف. ما لا يفعله هو التحقق من أن توجيه Sitemap: يشير إلى خريطة موقع حقيقية وفعّالة.

ما زواحف الذكاء الاصطناعي التي يبحث عنها فحص الزاحف المحجوب؟

وكلاء ذكاء اصطناعي معروفون منهم GPTBot وClaudeBot وCCBot وGoogle-Extended وPerplexityBot، من بين آخرين. يبحث الفحص تحديدًا عن Disallow: / أو Disallow: /* شامل يستهدف وكلاء المستخدم هؤلاء، لا عن قيود محددة ومتعمدة على مسارات معينة.

لماذا قد يضر حجب زواحف الذكاء الاصطناعي بموقعي؟

مع تزايد اعتماد البحث والاكتشاف على مساعدات الذكاء الاصطناعي التي تتصفح الويب أو تستشهد به نيابة عن المستخدم، يصبح الموقع الذي يحجب هذه الزواحف بشكل شامل غير مرئي في تلك القناة بأكملها - حتى لو كان يحقق ترتيبًا جيدًا في البحث التقليدي. إنها تكلفة رؤية لا يدرك معظم الفرق أنهم تحمّلوها إلا بعد الإشارة إليها.

أليس إدراج المسارات الحساسة في robots.txt مفترضًا أن يخفيها؟

لا - هذا سوء فهم شائع. robots.txt ملف عام يمكن لأي شخص طلبه على yoursite.com/robots.txt. قاعدة Disallow لا تقيّد الوصول، بل تطلب فقط من الزواحف حسنة السلوك عدم فهرسة المسار - فإدراج /admin-backup/ فيه يمنح أي شخص يقرأ الملف خريطة تحدد بالضبط أين يبحث.

كيف أُبعد زواحف الذكاء الاصطناعي فعليًا عن مسارات محددة دون حجبها كليًا؟

استهدف وكيل المستخدم والمسار المحددين بدلًا من قاعدة شاملة - انظر مثال الكود أدناه. بهذه الطريقة يمكنك، على سبيل المثال، إبعاد GPTBot عن مسار نتائج بحث داخلي دون حجبه عن بقية موقعك.

Free - no sign-up required

تحقق مما إذا كنت تحجب زواحف الذكاء الاصطناعي

شغّل تدقيق موقع مجاني وشاهد درجة جاهزية الوكلاء لديك، بما في ذلك ما إذا كان robots.txt يحجب وكلاء الذكاء الاصطناعي.

Run free audit