ثلث محتوى الويب بعد ظهور ChatGPT يظهر علامات على تأليف الذكاء الاصطناعي

كشفت دراسة رائدة أجراها مركز "Pew Research" عن تحول هائل في المشهد الرقمي، حيث أظهرت أن جزءاً كبيراً من محتوى الويب الجديد يتم إنشاؤه بواسطة الذكاء الاصطناعي. ومع دمج النماذج اللغوية الكبيرة (LLMs) في سير عمل المحتوى، بدأت الحدود بين النصوص التي يكتبها البشر وتلك التي تنتجها الآلات تتلاشى بسرعة.

الطفرة في المحتوى المُنشأ بواسطة الذكاء الاصطناعي

لقياس تأثير الذكاء الاصطناعي التوليدي على الإنترنت، قام مركز "Pew Research" بتحليل ما يقرب من 500,000 صفحة ويب باللغة الإنجليزية باستخدام أرشيف الويب "Common Crawl". ومن خلال استخدام تقنية الكشف الخاصة بـ "Open Pangram"، سعت الدراسة إلى التمييز بين النصوص التي ألفها البشر وتلك التي تمت بمساعدة الذكاء الاصطناعي.

وبينما أظهرت عينة عشوائية مكونة من 10,000 صفحة من يوليو 2026 معدل تأليف بالذكاء الاصطناعي بنسبة 10%، إلا أن هذا الرقم كان منحرفاً بسبب تضمين المحتوى القديم المنشور قبل طفرة الذكاء الاصطناعي التوليدي. ومع ذلك، عندما قام الباحثون بتصفية مجموعة البيانات لتشمل فقط الصفحات المنشورة بعد إطلاق ChatGPT في نوفمبر 2022، ارتفعت الأرقام بشكل كبير. ووجدت الدراسة أن أكثر من الثلث (35%) من جميع صفحات الويب المنشورة في هذا العصر الحديث تظهر عليها علامات واضحة على أنها كُتبت أو "عُدلت بشكل جوهري" بواسطة الذكاء الاصطناعي.

التفاوت بين النطاقات و"حلقة البوتات"

إن انتشار محتوى الذكاء الاصطناعي ليس موحداً عبر الويب. فقد سلطت الدراسة الضوء على تباين صارخ بين نطاقات المستوى الأعلى (TLDs) المختلفة، مما يشير إلى أن المصالح التجارية هي التي تقود التبني الأكثر عدوانية لأدوات الكتابة بالذكاء الاصطناعي.

ووفقاً للبيانات، تظهر عناوين URL ذات النطاق .com معدل تأليف بالذكاء الاصطناعي أعلى بنحو 10 أضعاف من المواقع الأكاديمية أو الحكومية. وتحديداً، أظهرت نطاقات .edu و .gov معدلاً ضئيلاً للتأليف بالذكاء الاصطناعي بنسبة 1% فقط، بينما بلغت نسبة نطاقات .org حوالي 4.6%. ويشير هذا الاتجاه نحو ويب تجاري تُعطى فيه الأولوية للسرعة والنطاق الواسع — اللذين يتم تحقيقهما غالباً من خلال النماذج اللغوية الكبيرة (LLMs) — على حساب الإشراف التحريري التقليدي.

تأتي هذه الطفرة في محتوى الذكاء الاصطناعي بالتزامن مع علامة فارقة مثيرة للقلق أبلغت عنها شركة "Cloudflare": حيث تجاوزت حركة مرور البوتات (bot traffic) رسمياً حركة مرور البشر على الويب. وهذا يخلق "حلقة تغذية راجعة" محتملة لما يسمى بـ "الإنترنت الميت" (dead internet)، حيث تقوم البوتات بشكل متزايد بتصفح وكشط المحتوى الذي كُتب هو نفسه بواسطة بوتات أخرى.

العلامات اللغوية وتحديات الكشف

حددت الدراسة أيضاً أنماطاً لغوية محددة تعمل بمثابة "علامات دالة" على النصوص المُنشأة بواسطة الذكاء الاصطناعي. ومع ازدياد تطور النماذج اللغوية الكبيرة (LLMs)، أصبحت بصماتها الأسلوبية أكثر قابلية للتنبؤ. لاحظ الباحثون انتشاراً متزايداً لهياكل نحوية محددة، مثل:

  • الاستخدام المكثف للشرطات الطويلة (em dashes) وفواصل أكسفورد (Oxford commas).
  • أنماط صياغة إيقاعية مثل "ليس X، بل Y".
  • ميول أسلوبية محددة مُحسّنة من أجل سهولة القراءة ولكنها تفتقر إلى اللمسة البشرية الدقيقة.

وبينما تقر الدراسة بأن أدوات الكشف عن الذكاء الاصطناعي مثل "Pangram" ليست معصومة من الخطأ ويمكن أن تعاني من نتائج إيجابية خاطئة، إلا أن حجم البيانات يشير إلى أن هذه النتائج دقيقة من حيث الاتجاه العام. وبالنسبة للمطورين والمؤسسين، يسلط هذا الضوء على تحدٍ حاسم: فمع تشبع الويب بالبيانات الاصطناعية، يصبح الحفاظ على جودة مجموعات التدريب للنماذج المستقبلية أمراً صعباً بشكل متزايد.

أهم الاستنتاجات

  • تحول هائل في إنشاء المحتوى: تظهر 35% من صفحات الويب المنشورة منذ إطلاق ChatGPT علامات واضحة على التأليف بالذكاء الاصطناعي أو التحرير المكثف بواسطة الذكاء الاصطناعي.
  • الهيمنة التجارية: تُعد نطاقات .com المحرك الرئيسي لمحتوى الذكاء الاصطناعي، حيث تتفوق على نطاقات .edu و .gov بعشرة أضعاف.
  • نظام البوتات البيئي: يتزامن الارتفاع في المحتوى المكتوب بالذكاء الاصطناعي مع تجاوز حركة مرور البوتات لحركة مرور البشر، مما يشير إلى تحول نحو نظام بيئي للويب تهيمن عليه الآلات.