یک‌سوم محتوای وب پس از چت‌جی‌پی‌تی نشانه‌هایی از نویسندگی هوش مصنوعی را نشان می‌دهند

یک مطالعه پیشگامانه توسط Pew Research نشان‌دهنده تغییری عظیم در چشم‌انداز دیجیتال است که فاش می‌کند بخش قابل توجهی از محتوای جدید وب توسط هوش مصنوعی تولید می‌شود. با ادغام مدل‌های زبانی بزرگ (LLMs) در جریان‌های کاری تولید محتوا، مرز بین متن نوشته‌شده توسط انسان و ماشین به سرعت در حال محو شدن است.

افزایش ناگهانی محتوای تولیدشده توسط هوش مصنوعی

برای تعیین میزان تأثیر هوش مصنوعی مولد بر اینترنت، Pew Research با استفاده از آرشیو وب Common Crawl، نزدیک به ۵۰۰,۰۰۰ صفحه وب به زبان انگلیسی را تحلیل کرد. این مطالعه با به‌کارگیری فناوری تشخیص Open Pangram، تلاش کرد تا بین متن نوشته‌شده توسط انسان و متن با کمک هوش مصنوعی تمایز قائل شود.

در حالی که یک نمونه تصادفی از ۱۰,۰۰۰ صفحه مربوط به جولای ۲۰۲۶، نرخ نویسندگی هوش مصنوعی را ۱۰٪ نشان داد، این رقم به دلیل گنجاندن محتواهای قدیمی که پیش از رونق هوش مصنوعی مولد منتشر شده بودند، دچار سوگیری شده بود. با این حال، زمانی که محققان مجموعه داده را فیلتر کردند تا فقط صفحات منتشرشده پس از عرضه ChatGPT در نوامبر ۲۰۲۲ را شامل شود، اعداد به شدت افزایش یافت. این مطالعه نشان داد که بیش از یک‌سوم (۳۵٪) از تمام صفحات وب منتشرشده در این دوران اخیر، نشانه‌های قابل توجهی از نوشته شدن یا «ویرایش اساسی» توسط هوش مصنوعی را نشان می‌دهند.

تفاوت‌های دامنه و «حلقه بات‌ها»

گسترش محتوای هوش مصنوعی در سراسر وب یکنواخت نیست. این مطالعه تضاد شدیدی را بین دامنه‌های سطح بالا (TLDs) مختلف نشان داد که نشان می‌دهد منافع تجاری محرک شدیدترین پذیرش ابزارهای نویسندگی هوش مصنوعی هستند.

طبق داده‌ها، URLهایی با دامنه .com نرخ نویسندگی هوش مصنوعی را تقریباً ۱۰ برابر بیشتر از سایت‌های دانشگاهی یا دولتی نشان می‌دهند. به طور مشخص، دامنه‌های .edu و .gov تنها نرخ ۱٪ نویسندگی هوش مصنوعی را نشان دادند، در حالی که دامنه‌های .org در سطح ۴.۶٪ قرار داشتند. این روند به سمت یک وب تجاری‌سازی‌شده اشاره دارد که در آن سرعت و مقیاس — که اغلب از طریق LLMها به دست می‌آید — بر نظارت تحریریه سنتی اولویت دارد.

این افزایش ناگهانی در محتوای هوش مصنوعی همزمان با یک نقطه عطف نگران‌کننده گزارش‌شده توسط Cloudflare رخ می‌دهد: ترافیک بات‌ها رسماً از ترافیک انسانی وب پیشی گرفته است. این امر یک حلقه بازخورد بالقوه از «اینترنت مرده» ایجاد می‌کند که در آن بات‌ها به طور فزاینده‌ای در حال مرور و استخراج (scraping) محتوایی هستند که خود توسط بات‌های دیگر نوشته شده است.

نشانه‌های زبانی و چالش‌های تشخیص

این مطالعه همچنین الگوهای زبانی خاصی را شناسایی کرد که به عنوان «نشانه‌های» متن تولیدشده توسط هوش مصنوعی عمل می‌کنند. با پیچیده‌تر شدن LLMها، اثر انگشت‌های سبک‌شناختی آن‌ها پیش‌بینی‌پذیرتر شده است. محققان متوجه افزایش شیوع ساختارهای نحوی خاصی شدند، مانند:

  • استفاده گسترده از em dash و ویرگول آکسفورد.
  • الگوهای عبارت‌پردازی ریتمیک مانند "It’s not X, it’s Y."
  • گرایش‌های سبک‌شناختی خاص که برای خوانایی بهینه شده‌اند اما فاقد ظرافت‌های انسانی هستند.

اگرچه این مطالعه اذعان می‌کند که ابزارهای تشخیص هوش مصنوعی مانند Pangram بی‌نقص نیستند و ممکن است دچار مثبت کاذب شوند، اما مقیاس داده‌ها نشان می‌دهد که این یافته‌ها در جهت کلی درست هستند. برای توسعه‌دهندگان و بنیان‌گذاران، این موضوع یک چالش حیاتی را برجسته می‌کند: با اشباع شدن وب از داده‌های مصنوعی، حفظ کیفیت مجموعه‌های آموزشی برای مدل‌های آینده به طور فزاینده‌ای دشوار می‌شود.

نکات کلیدی

  • تغییر عظیم در تولید محتوا: ۳۵٪ از صفحات وب منتشرشده از زمان عرضه ChatGPT، نشانه‌های واضحی از نویسندگی هوش مصنوعی یا ویرایش سنگین توسط هوش مصنوعی را نشان می‌دهند.
  • تسلط تجاری: دامنه‌های .com محرک‌های اصلی محتوای هوش مصنوعی هستند و از دامنه‌های .edu و .gov با ضریب ۱۰ برابر پیشی گرفته‌اند.
  • اکوسیستم بات‌ها: افزایش محتوای نوشته‌شده توسط هوش مصنوعی با پیشی گرفتن ترافیک بات‌ها از ترافیک انسانی همزمان شده است که نشان‌دهنده تغییری به سمت یک اکوسیستم وب تحت سلطه ماشین است.