AI क्रॉलर्स तुमच्या ट्रॅफिकच्या आकड्यांमध्ये वाढ करत आहेत, आणि नेहमीचा सोपा मार्ग—User-Agent हेडर तपासणे—याला पकडू शकत नाही.

एका आठ दिवसांच्या लॉग तपासणीत (log sweep) ४६८ मूळ लेख मिळवल्याचे (genuine article fetches) आढळले, परंतु ९९१ विनंत्या अशा होत्या ज्यांनी AI बॉट्स असल्याचे भासवले, पण प्रत्यक्षात त्या .env किंवा .git सारख्या फाइल्स शोधण्याचा प्रयत्न करत होत्या. याचे कारण काय? कोणीही HTTP विनंतीमध्ये GPTBot किंवा ChatGPT-User सारखी स्वतः घोषित केलेली User-Agent स्ट्रिंग समाविष्ट करू शकते.

हे मेट्रिक का महत्त्वाचे आहे

वेबसाइट्स "AI ट्रॅफिक" मधील वाढ ही सुसंगततेचे लक्षण मानतात. जाहिरात दर (ad rates) ठरवण्यासाठी, सर्व्हर रिसोर्सेसचे वाटप करण्यासाठी आणि गुंतवणूकदारांना अभिमान सांगण्यासाठी ते या आकड्यांचा वापर करतात. जेव्हा रिपोर्ट केलेल्या AI हिट्सपैकी अर्धे केवळ गोंधळ (noise) असतात, तेव्हा बजेटचा अपव्यय होतो आणि डॅशबोर्ड दिशाभूल करणारे ठरतात.

दावे आणि वास्तव वेगळे करणारे दोन फिल्टर्स

१. Cloudflare चे verifiedBotCategory – Cloudflare हे फील्ड तेव्हाच भरते जेव्हा ते रिव्हर्स DNS द्वारे विनंतीचा (request) IP एखाद्या ज्ञात बॉट डोमेनशी जोडते. जर हेडरमध्ये "GPTBot" असे असेल पण IP शोधण्यात अपयश आले, तर ती विनंती "unverified" श्रेणीत जाते. २. Sitemap क्रॉस-चेक – एखादा बॉट तुमच्या आशयाचा (content) खरोखर वाचन तेव्हाच करतो जेव्हा विनंती केलेली URL तुमच्या XML sitemap मध्ये दिसते. Sitemap मध्ये नसलेल्या पाथसाठी (paths) केलेल्या विनंत्या लेख इंडेक्स करण्याऐवजी बहुधा त्रुटी (vulnerabilities) शोधण्यासाठी असतात.

एकाच आठ दिवसांच्या नमुन्यावर दोन्ही फिल्टर्स लागू केल्यावर धक्कादायक आकडेवारी समोर आली:

  • ChatGPT-User – ३९% विनंत्यांची पडताळणी यशस्वी झाली.
  • GPTBot – १३% पडताळणी यशस्वी झाली.
  • PerplexityBot – ०% पडताळणी यशस्वी झाली.
  • Google-Extended – ०% पडताळणी यशस्वी झाली; ही स्ट्रिंग कोणत्याही अधिकृत Google क्रॉलरशी संबंधित नाही.

पडताळणी झालेल्या कॉल्समध्येही, अनेक बॉट्सनी केवळ robots.txt किंवा स्वतः sitemap मिळवला, तुम्हाला महत्त्वाचे असलेले लेख (article pages) नाही.

डेव्हलपर्स आज काय करू शकतात

  • तुमच्या ॲनालिटिक्स पाइपलाइनमध्ये Cloudflare बॉट व्हेरिफिकेशन सक्षम करा. verifiedBotCategory हे फील्ड विनंतीच्या हेडरमध्ये दिसते आणि ते तुमच्या स्वतःच्या लॉग्ससोबत साठवले जाऊ शकते.
  • अद्ययावत (up-to-date) sitemap ठेवा आणि प्रत्येक येणाऱ्या विनंतीचा पाथ (path) त्यामध्ये अस्तित्वात आहे की नाही, याची स्वयंचलित तपासणी करा, जेणेकरून तुम्ही त्याला 'कंटेंट व्ह्यू' म्हणून मोजू शकाल.
  • non-GET पद्धती आणि सामान्य डेव्हलपमेंट फाइल्स (.env, .git, .bak) लक्ष्य करणाऱ्या विनंत्या फिल्टर करा. त्या बहुधा घातक स्कॅन्स (malicious scans) असतात.

प्रतिवाद (The counter-point)

काही लोकांचा असा युक्तिवाद आहे की रिव्हर्स DNS तपासणीमध्ये फेरफार (spoofing) होऊ शकतो आणि एखाद्या बॉटचा कायदेशीर उद्देश sitemap मध्ये अद्याप सूचीबद्ध नसलेले नवीन URLs शोधणे असू शकतो. या चिंता रास्त आहेत: एखादा हॅकर DNS रेकॉर्डशी छेडछाड करू शकतो आणि नवीन कंटेंट पुढील जनरेशन सायकलपर्यंत सध्याच्या sitemap मध्ये नसेल.

यावर व्यावहारिक प्रतिसाद म्हणजे पडताळणीला (verification) पूर्णतः खात्री करण्याऐवजी एक 'कॉन्फिडन्स स्कोअर' (confidence score) म्हणून मानणे. "खरे AI ट्रॅफिक" म्हणून तुम्ही काय मोजता याची मर्यादा वाढवण्यासाठी DNS पडताळणी, sitemap उपस्थिती आणि विनंती-पद्धती (request-method) तपासणी यांचा एकत्रित वापर करा. जर एखादी विनंती तीनपैकी दोन तपासण्यांमध्ये उत्तीर्ण झाली, तर तिला थेट काढून टाकण्याऐवजी मॅन्युअल रिव्ह्यूसाठी फ्लॅग करा.

पुढे काय पाहावे

  • Cloudflare च्या verification API मधील बदलverifiedBotCategory लॉजिकमध्ये होणाऱ्या कोणत्याही बदलामुळे पडताळणीच्या दरात बदल होऊ शकतो.
  • नवीन स्वतःची ओळख सांगणाऱ्या बॉट्सचे आगमन – तुमच्या लॉग्समध्ये दिसणाऱ्या User-Agent स्ट्रिंग्सवर लक्ष ठेवा; अचानक झालेली वाढ एखाद्या नवीन स्कॅनरचे संकेत असू शकते जो AI क्रॉलरचा बनाव करत आहे.
  • Sitemap जनरेशनची वारंवारता – जास्त अंतराने sitemap तयार केल्यास कायदेशीर क्रॉलर्स चुकीच्या पद्धतीने वर्गीकृत होण्याची शक्यता वाढते.

निष्कर्ष साधा आहे: User-Agent स्ट्रिंगला पुरावा मानणे थांबवा. DNS पडताळणी आणि sitemap व्हॅलिडेशनचा स्तर वापरा, आणि तुम्हाला तुमचा आशय प्रत्यक्षात कोण वाचत आहे याचे स्पष्ट चित्र दिसेल.

Source: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo