ChatGPT के बाद वेब सामग्री का एक-तिहाई हिस्सा AI लेखन के संकेत दिखाता है

Pew Research के एक अभूतपूर्व अध्ययन ने डिजिटल परिदृश्य में एक बड़े बदलाव का खुलासा किया है, जिससे पता चला है कि नई वेब सामग्री का एक बड़ा हिस्सा आर्टिफिशियल इंटेलिजेंस (AI) द्वारा तैयार किया जा रहा है। जैसे-जैसे Large Language Models (LLMs) कंटेंट वर्कफ़्लो का हिस्सा बनते जा रहे हैं, मानव और मशीन द्वारा निर्मित टेक्स्ट के बीच की सीमा तेजी से धुंधली होती जा रही है।

AI-जनरेटेड कंटेंट में उछाल

इंटरनेट पर जनरेटिव AI के प्रभाव को मापने के लिए, Pew Research ने Common Crawl वेब आर्काइव का उपयोग करके लगभग 5,00,000 अंग्रेजी भाषा के वेब पेजों का विश्लेषण किया। Open Pangram की डिटेक्शन तकनीक का उपयोग करते हुए, इस अध्ययन का उद्देश्य मानव-लिखित और AI-सहायता प्राप्त टेक्स्ट के बीच अंतर करना था।

हालांकि जुलाई 2026 के 10,000 पेजों के एक रैंडम सैंपल में AI लेखन की दर 10% दिखाई दी, लेकिन इस आंकड़े में जनरेटिव AI के उछाल से पहले प्रकाशित पुराने कंटेंट के शामिल होने के कारण विसंगति थी। हालांकि, जब शोधकर्ताओं ने डेटासेट को फ़िल्टर करके केवल नवंबर 2022 में ChatGPT के लॉन्च के बाद प्रकाशित पेजों को शामिल किया, तो ये संख्याएं काफी बढ़ गईं। अध्ययन में पाया गया कि इस हालिया युग में प्रकाशित सभी वेब पेजों में से एक-तिहाई से अधिक (35%) में AI द्वारा लिखे जाने या "काफी हद तक संपादित" (substantially edited) किए जाने के महत्वपूर्ण संकेत मिलते हैं।

डोमेन में असमानता और "बॉट लूप"

वेब पर AI कंटेंट का प्रसार एक समान नहीं है। अध्ययन ने विभिन्न टॉप-लेवल डोमेन (TLDs) के बीच एक गहरा अंतर दिखाया है, जो यह सुझाव देता है कि व्यावसायिक हित AI लेखन उपकरणों को अपनाने में सबसे अधिक आक्रामक भूमिका निभा रहे हैं।

डेटा के अनुसार, .com डोमेन वाले URLs में AI लेखन की दर शैक्षणिक या सरकारी साइटों की तुलना में लगभग 10 गुना अधिक है। विशेष रूप से, .edu और .gov डोमेन में AI लेखन की दर मात्र 1% थी, जबकि .org डोमेन में यह 4.6% थी। यह रुझान एक व्यवसायीकृत वेब की ओर इशारा करता है जहाँ पारंपरिक संपादकीय निरीक्षण के बजाय गति और पैमाने (जो अक्सर LLMs के माध्यम से प्राप्त किए जाते हैं) को प्राथमिकता दी जा रही है।

AI कंटेंट में यह उछाल Cloudflare द्वारा रिपोर्ट किए गए एक चिंताजनक मील के पत्थर के साथ आया है: बॉट ट्रैफिक ने आधिकारिक तौर पर मानव वेब ट्रैफिक को पीछे छोड़ दिया है। यह एक संभावित "dead internet" फीडबैक लूप बनाता है, जहाँ बॉट्स तेजी से उस कंटेंट को ब्राउज़ और स्क्रैप कर रहे हैं जो खुद अन्य बॉट्स द्वारा लिखा गया था।

भाषाई संकेत और डिटेक्शन की चुनौतियां

अध्ययन ने कुछ विशिष्ट भाषाई पैटर्न की भी पहचान की है जो AI-जनरेटेड टेक्स्ट के लिए "संकेत" (tells) के रूप में काम करते हैं। जैसे-जैसे LLMs अधिक परिष्कृत होते जा रहे हैं, उनके शैलीगत निशान (stylistic fingerprints) अधिक अनुमानित होते जा रहे हैं। शोधकर्ताओं ने विशिष्ट वाक्य संरचनाओं की बढ़ती व्यापकता पर ध्यान दिया, जैसे:

  • em dashes और Oxford commas का व्यापक उपयोग।
  • "It’s not X, it’s Y" जैसे लयबद्ध वाक्यांश पैटर्न।
  • पठनीयता के लिए अनुकूलित विशिष्ट शैलीगत प्रवृत्तियाँ, लेकिन जिनमें मानवीय सूक्ष्मता (human nuance) की कमी है।

हालांकि अध्ययन यह स्वीकार करता है कि Pangram जैसे AI डिटेक्शन टूल अचूक नहीं हैं और उनमें false positives की समस्या हो सकती है, लेकिन डेटा का पैमाना बताता है कि ये निष्कर्ष दिशात्मक रूप से सटीक हैं। डेवलपर्स और संस्थापकों (founders) के लिए, यह एक महत्वपूर्ण चुनौती को रेखांकित करता है: जैसे-जैसे वेब सिंथेटिक डेटा से भरता जा रहा है, भविष्य के मॉडलों के लिए ट्रेनिंग सेट्स की गुणवत्ता बनाए रखना तेजी से कठिन होता जा रहा है।

मुख्य निष्कर्ष

  • कंटेंट निर्माण में बड़ा बदलाव: ChatGPT के लॉन्च के बाद से प्रकाशित 35% वेब पेज AI लेखन या भारी AI संपादन के स्पष्ट संकेत दिखाते हैं।
  • व्यावसायिक प्रभुत्व: .com डोमेन AI कंटेंट के प्राथमिक चालक हैं, जो .edu और .gov डोमेन से 10 गुना अधिक हैं।
  • बॉट इकोसिस्टम: AI-लिखित कंटेंट में वृद्धि बॉट ट्रैफिक द्वारा मानव ट्रैफिक को पीछे छोड़ने के साथ मेल खाती है, जो मशीन-प्रधान वेब इकोसिस्टम की ओर बदलाव का संकेत देती है।