وفقاً لتحليل أجري في عام 2026، فإن 44.9% من أفضل 107 مواقع إلكترونية تحظر زاحف ذكاء اصطناعي واحدًا على الأقل. لا تقتصر المخاطرة على فقدان حركة المرور فحسب، بل تكمن في الاختفاء المحتمل من القنوات الجديدة التي يحصل المستخدمون من خلالها على المعلومات اليوم.
نطاق المشكلة
لطالما كان ملف robots.txt هو الملف الأساسي لإخبار Googlebot وزواحف البحث التقليدية الأخرى بالصفحات التي يجب فهرستها. والآن، يتحكم ملف مماثل في زواحف الذكاء الاصطناعي — وهي وكلاء برمجيات يقرأون محتوى الويب لإنشاء إجابات لأدوات مثل ChatGPT وClaude وPerplexity. ووجدت الدراسة أن 44.9% من المواقع التي تم فحصها منعت عمدًا واحدًا على الأقل من هذه الروبوتات. ويتصدر GPTBot، وهو الزاحف الذي تستخدمه نماذج OpenAI، قائمة الوكلاء المحظورين.
وتأتي حصة مفاجئة من عمليات الحظر من إعدادات "النقرة الواحدة" في خدمات مثل Cloudflare، حيث قد يمنع أصحاب المواقع وصول الذكاء الاصطناعي عن غير قصد أثناء محاولتهم تشديد الأمن.
ماذا تعني "قابلية الزحف للذكاء الاصطناعي" حقًا
قابلية الزحف هي قدرة الروبوت على جلب صفحة ما. بالنسبة للذكاء الاصطناعي، تحدد قابلية الزحف ما إذا كان النموذج قادرًا على استقاء أحدث الحقائق حول علامة تجارية أو منتج أو خدمة عندما يطرح المستخدم سؤالًا. إذا لم يكن الموقع قابلًا للزحف، فلن يجد الذكاء الاصطناعي مصدرًا للاستشهاد به، وبالتالي تختفي العلامة التجارية من موجز الإجابات.
ركزت استراتيجيات تحسين محركات البحث (SEO) القديمة على زحف Googlebot إلى الصفحات حتى يمكن ترتيبها في قائمة من الروابط. أما قابلية الزحف للذكاء الاصطناعي فتغير الهدف: فبدلاً من الترتيب، تكون النتيجة توصية داخل إجابة حوارية.
روبوتات التدريب مقابل روبوتات الإجابة
لا تخدم جميع زواحف الذكاء الاصطناعي الغرض نفسه.
- روبوتات التدريب (Training bots) – تشمل الأمثلة GPTBot وClaudeBot وGoogle-Extended. تقوم هذه الروبوتات بمسح مساحات واسعة من الويب لتغذية مجموعات البيانات الضخمة التي تشغل النماذج اللغوية الأساسية. يمكن لأصحاب المواقع حظر هذه الروبوتات إذا أرادوا إبقاء المحتوى المملوك لهم بعيدًا عن تدريب النماذج المستقبلية.
- روبوتات الإجابة (Answer bots) – تشمل الأمثلة OAI-SearchBot وClaude-SearchBot وPerplexityBot. تعمل هذه الروبوتات في الوقت الفعلي، حيث تجلب مقتطفات محددة للإجابة على استفسار المستخدم. إن حظر روبوت الإجابة يعني أن محتوى الموقع لن يظهر أبدًا في رد حواري، حتى لو كانت الصفحة نفسها لا تزال مفهرسة بواسطة محركات البحث التقليدية.
ويظهر التحليل أن العديد من المواقع تخلط بين الاثنين، مما يؤدي في النهاية إلى تطبيق قاعدة "حظر جميع برامج الذكاء الاصطناعي" بشكل شامل، وهو ما يضر بالظهور دون حماية أي ملكية فكرية حقيقية.
لماذا يتم حظر الروبوتات الخاطئة
تفسر مجموعة من العوامل هذا الخطأ في الإعداد:
- إعدادات الأمان الافتراضية – غالبًا ما تطبق المنصات التي توفر مفتاح تبديل واحد لـ "حظر الذكاء الاصطناعي" هذا على كل زاحف معروف، بما في ذلك روبوتات الإجابة التي قد يرغب الموقع في الوصول إليها بالفعل.
- نقص الوعي – يعرف معظم مسؤولي المواقع ملف robots.txt الخاص بـ Googlebot، ولكن التوجيهات الأحدث الخاصة بالذكاء الاصطناعي أقل شيوعًا.
- الخوف من إساءة استخدام البيانات – يخشى المالكون أن تقوم روبوتات التدريب بدمج محتواهم في النماذج المستقبلية، وهو قلق مشروع لا ينطبق على روبوتات الإجابة التي تجلب البيانات فقط عند الطلب.
كيفية تحقيق التوازن الصحيح
- تعديل ملف robots.txt – اسمح صراحةً لروبوتات الإجابة التي تريد الوصول إليها. سطر مثل
User-agent: OAI-SearchBot\nAllow: /يسمح لروبوت الإجابة الخاص بـ OpenAI بالزحف إلى الموقع بالكامل مع استمرار حظر الوكلاء الآخرين. - اتخاذ قرار بشأن بيانات التدريب – إذا كانت حماية المواد المملوكة أولوية، فاحتفظ بقاعدة
Disallowلـ GPTBot وClaudeBot ووكلاء التدريب المماثلين. - اعتماد llms.txt – يسمح هذا المعيار الناشئ للناشرين بتسليط الضوء على أهم الصفحات لاستهلاك الذكاء الاصطناعي، مما يسرع عملية الاكتشاف لروبوتات الإجابة.
- مراجعة إعدادات الطرف الثالث – راجع أي تكوين للأمن أو لشبكة توصيل المحتوى (CDN) قد يكون قد حظر زواحف الذكاء الاصطناعي تلقائيًا، وقم بتعديل القواعد يدويًا.
المقايضة التي يجب عليك موازنتها
إن السماح لروبوتات الإجابة يحسن من ظهور العلامة التجارية في المحادثات التي يقودها الذكاء الاصطناعي، ولكنه يعني أيضًا إمكانية إعادة إنتاج المحتوى حرفيًا في الإجابات الموجهة للمستخدم. أما حظر روبوتات التدريب فيحمي البيانات من أن تُدمج في أوزان النماذج المستقبلية، ومع ذلك فإنه لا يمنع روبوتات الإجابة من جلب نفس الصفحات العامة.
إذا كانت القيمة الأساسية للشركة هي التحكم الصارم في ملكيتها الفكرية، فقد يكون الحظر المشدد مبررًا، ولكن التكلفة هي تراجع التواجد في القنوات التي يبدأ منها العديد من المستخدمين أبحاثهم الآن. وعلى العكس من ذلك، فإن موقع التجارة الإلكترونية الذي يزدهر من خلال اكتشاف المنتجات سيستفيد على الأرجح من قابلية الزحف للذكاء الاصطناعي أكثر مما سيستفيد من المخاطرة الهامشية لبعض المقتطفات المقتبسة.
ما يجب مراقبته لاحقًا
- اعتماد ملف llms.txt – مع اكتساب هذا المعيار لزخم متزايد، قد تصبح الأدوات التي تقوم بتحليله الطريقة الأساسية التي تحدد من خلالها روبوتات الإجابة المدعومة بالذكاء الاصطناعي المحتوى عالي القيمة.
- تحولات في سياسات مزودي خدمات الذكاء الاصطناعي – قد تعمل OpenAI وAnthropic وغيرهما على تحسين سياسات الزحف الخاصة بهم، مما قد يوفر آليات اختيار (opt-in) أكثر دقة.
- التوجيهات القانونية بشأن بيانات تدريب الذكاء الاصطناعي – قد تؤثر النقاشات المستمرة حول ما إذا كان يمكن استخدام المحتوى العام الذي يتم كشطه لتدريب النماذج على عدد المواقع التي تختار حظر روبوتات التدريب بشكل كامل.
الخلاصة: إذا أرادت علامة تجارية أن تظل مرئية في الوقت الذي يتجه فيه المستخدمون بشكل متزايد إلى طرح الأسئلة بدلاً من كتابة الكلمات المفتاحية، فيجب عليها جعل موقعها قابلاً للزحف من قبل الذكاء الاصطناعي. الخطوة الأولى هي تعديل بسيط لملف robots.txt؛ والثانية هي اتخاذ قرار واضح بشأن البيانات التي ترغب في مشاركتها مع الجيل القادم من البحث. إن تجاهل التمييز بين روبوتات التدريب وروبوتات الإجابة قد يجعل الشركة غير مرئية في ذات المساحة التي تعيد تشكيل كيفية العثور على المعلومات.
