یکسوم محتوای وب پس از چتجیپیتی نشانههایی از نویسندگی هوش مصنوعی را نشان میدهند
یک مطالعه پیشگامانه توسط Pew Research نشاندهنده تغییری عظیم در چشمانداز دیجیتال است که فاش میکند بخش قابل توجهی از محتوای جدید وب توسط هوش مصنوعی تولید میشود. با ادغام مدلهای زبانی بزرگ (LLMs) در جریانهای کاری تولید محتوا، مرز بین متن نوشتهشده توسط انسان و ماشین به سرعت در حال محو شدن است.
افزایش ناگهانی محتوای تولیدشده توسط هوش مصنوعی
برای تعیین میزان تأثیر هوش مصنوعی مولد بر اینترنت، Pew Research با استفاده از آرشیو وب Common Crawl، نزدیک به ۵۰۰,۰۰۰ صفحه وب به زبان انگلیسی را تحلیل کرد. این مطالعه با بهکارگیری فناوری تشخیص Open Pangram، تلاش کرد تا بین متن نوشتهشده توسط انسان و متن با کمک هوش مصنوعی تمایز قائل شود.
در حالی که یک نمونه تصادفی از ۱۰,۰۰۰ صفحه مربوط به جولای ۲۰۲۶، نرخ نویسندگی هوش مصنوعی را ۱۰٪ نشان داد، این رقم به دلیل گنجاندن محتواهای قدیمی که پیش از رونق هوش مصنوعی مولد منتشر شده بودند، دچار سوگیری شده بود. با این حال، زمانی که محققان مجموعه داده را فیلتر کردند تا فقط صفحات منتشرشده پس از عرضه ChatGPT در نوامبر ۲۰۲۲ را شامل شود، اعداد به شدت افزایش یافت. این مطالعه نشان داد که بیش از یکسوم (۳۵٪) از تمام صفحات وب منتشرشده در این دوران اخیر، نشانههای قابل توجهی از نوشته شدن یا «ویرایش اساسی» توسط هوش مصنوعی را نشان میدهند.
تفاوتهای دامنه و «حلقه باتها»
گسترش محتوای هوش مصنوعی در سراسر وب یکنواخت نیست. این مطالعه تضاد شدیدی را بین دامنههای سطح بالا (TLDs) مختلف نشان داد که نشان میدهد منافع تجاری محرک شدیدترین پذیرش ابزارهای نویسندگی هوش مصنوعی هستند.
طبق دادهها، URLهایی با دامنه .com نرخ نویسندگی هوش مصنوعی را تقریباً ۱۰ برابر بیشتر از سایتهای دانشگاهی یا دولتی نشان میدهند. به طور مشخص، دامنههای .edu و .gov تنها نرخ ۱٪ نویسندگی هوش مصنوعی را نشان دادند، در حالی که دامنههای .org در سطح ۴.۶٪ قرار داشتند. این روند به سمت یک وب تجاریسازیشده اشاره دارد که در آن سرعت و مقیاس — که اغلب از طریق LLMها به دست میآید — بر نظارت تحریریه سنتی اولویت دارد.
این افزایش ناگهانی در محتوای هوش مصنوعی همزمان با یک نقطه عطف نگرانکننده گزارششده توسط Cloudflare رخ میدهد: ترافیک باتها رسماً از ترافیک انسانی وب پیشی گرفته است. این امر یک حلقه بازخورد بالقوه از «اینترنت مرده» ایجاد میکند که در آن باتها به طور فزایندهای در حال مرور و استخراج (scraping) محتوایی هستند که خود توسط باتهای دیگر نوشته شده است.
نشانههای زبانی و چالشهای تشخیص
این مطالعه همچنین الگوهای زبانی خاصی را شناسایی کرد که به عنوان «نشانههای» متن تولیدشده توسط هوش مصنوعی عمل میکنند. با پیچیدهتر شدن LLMها، اثر انگشتهای سبکشناختی آنها پیشبینیپذیرتر شده است. محققان متوجه افزایش شیوع ساختارهای نحوی خاصی شدند، مانند:
- استفاده گسترده از em dash و ویرگول آکسفورد.
- الگوهای عبارتپردازی ریتمیک مانند "It’s not X, it’s Y."
- گرایشهای سبکشناختی خاص که برای خوانایی بهینه شدهاند اما فاقد ظرافتهای انسانی هستند.
اگرچه این مطالعه اذعان میکند که ابزارهای تشخیص هوش مصنوعی مانند Pangram بینقص نیستند و ممکن است دچار مثبت کاذب شوند، اما مقیاس دادهها نشان میدهد که این یافتهها در جهت کلی درست هستند. برای توسعهدهندگان و بنیانگذاران، این موضوع یک چالش حیاتی را برجسته میکند: با اشباع شدن وب از دادههای مصنوعی، حفظ کیفیت مجموعههای آموزشی برای مدلهای آینده به طور فزایندهای دشوار میشود.
نکات کلیدی
- تغییر عظیم در تولید محتوا: ۳۵٪ از صفحات وب منتشرشده از زمان عرضه ChatGPT، نشانههای واضحی از نویسندگی هوش مصنوعی یا ویرایش سنگین توسط هوش مصنوعی را نشان میدهند.
- تسلط تجاری: دامنههای .com محرکهای اصلی محتوای هوش مصنوعی هستند و از دامنههای .edu و .gov با ضریب ۱۰ برابر پیشی گرفتهاند.
- اکوسیستم باتها: افزایش محتوای نوشتهشده توسط هوش مصنوعی با پیشی گرفتن ترافیک باتها از ترافیک انسانی همزمان شده است که نشاندهنده تغییری به سمت یک اکوسیستم وب تحت سلطه ماشین است.
