AI క్రాలర్లు మీ ట్రాఫిక్ గణాంకాలను పెంచుతున్నాయి, మరియు సాధారణ షార్ట్కట్—User-Agent హెడర్ను తనిఖీ చేయడం—దీనిని పట్టుకోలేదు.
ఇటీవలి ఎనిమిది రోజుల లాగ్ స్వీప్ 468 అసలైన ఆర్టికల్ ఫెచ్లను కనుగొంది, కానీ 991 రిక్వెస్ట్లు AI బాట్లుగా నటించాయి, కానీ నిజానికి .env లేదా .git వంటి ఫైల్ల కోసం వెతుకుతున్నాయి. దీనికి కారణం? ఎవరైనా HTTP రిక్వెస్ట్లో GPTBot లేదా ChatGPT-User వంటి స్వయంగా ప్రకటించుకున్న User-Agent స్ట్రింగ్ను చేర్చవచ్చు.
ఈ మెట్రిక్ ఎందుకు ముఖ్యం
వెబ్సైట్లు "AI ట్రాఫిక్" పెరుగుదలను ప్రాముఖ్యతగా భావిస్తాయి. వారు ప్రకటనల ధరలను (ad rates) సమర్థించుకోవడానికి, సర్వర్ వనరులను కేటాయించడానికి మరియు ఇన్వెస్టర్లకు గొప్పలు చెప్పుకోవడానికి ఈ సంఖ్యలను ఉపయోగిస్తారు. నివేదించబడిన AI హిట్స్లో సగం కేవలం నాయిస్ (noise) అయినప్పుడు, బడ్జెట్లు వృధా అవుతాయి మరియు డ్యాష్బోర్డ్లు తప్పుదారి పట్టిస్తాయి.
వాస్తవానికి మరియు వాదనకు మధ్య తేడాను చూపే రెండు ఫిల్టర్లు
- Cloudflare’s
verifiedBotCategory– రివర్స్ DNS ద్వారా రిక్వెస్ట్ యొక్క IPని తెలిసిన బాట్ డొమైన్కు అనుసంధానించిన తర్వాత మాత్రమే Cloudflare ఈ ఫీల్డ్ను నింపుతుంది. హెడర్ "GPTBot" అని చెప్పినప్పటికీ, IP లుకప్ విఫలమైతే, ఆ రిక్వెస్ట్ "unverified" విభాగంలోకి వెళ్తుంది. - Sitemap cross-check – అభ్యర్థించిన URL మీ XML sitemapలో కనిపించినప్పుడు మాత్రమే ఒక బాట్ నిజంగా మీ కంటెంట్ను చదువుతుంది. సైట్మ్యాప్లో లేని పాత్ల కోసం చేసే రిక్వెస్ట్లు ఆర్టికల్లను ఇండెక్స్ చేయడం కంటే లోపాలను (vulnerabilities) వెతకడానికే ఎక్కువ అవకాశం ఉంది.
అదే ఎనిమిది రోజుల నమూనాకు రెండు ఫిల్టర్లను వర్తింపజేయగా ఈ క్రింది గణాంకాలు వచ్చాయి:
- ChatGPT-User – 39% రిక్వెస్ట్లు వెరిఫికేషన్ను దాటాయి.
- GPTBot – 13% వెరిఫై అయ్యాయి.
- PerplexityBot – 0% వెరిఫై అయ్యాయి.
- Google-Extended – 0% వెరిఫై అయ్యాయి; ఈ స్ట్రింగ్ ఏ అధికారిక Google క్రాలర్కు సంబంధించినది కాదు.
వెరిఫై చేయబడిన కాల్స్లో కూడా, చాలా బాట్లు కేవలం robots.txt లేదా సైట్మ్యాప్ను మాత్రమే ఫెచ్ చేశాయి, మీరు ఆశించే ఆర్టికల్ పేజీలను కాదు.
డెవలపర్లు ఈరోజు ఏమి చేయవచ్చు
- మీ అనలిటిక్స్ పైప్లైన్లో Cloudflare bot verificationను ఎనేబుల్ చేయండి.
verifiedBotCategoryఫీల్డ్ రిక్వెస్ట్ హెడర్లలో కనిపిస్తుంది మరియు దానిని మీ స్వంత లాగ్లతో పాటు నిల్వ చేయవచ్చు. - అప్డేటెడ్ సైట్మ్యాప్ను నిర్వహించండి మరియు ప్రతి ఇన్కమింగ్ రిక్వెస్ట్ పాత్ కంటెంట్ వ్యూగా లెక్కించబడటానికి ముందు అది అక్కడ ఉందో లేదో తనిఖీ చేసే ప్రక్రియను ఆటోమేట్ చేయండి.
- non-GET మెథడ్స్ మరియు సాధారణ డెవలప్మెంట్ ఫైల్లను (
.env,.git,.bak) లక్ష్యంగా చేసుకునే రిక్వెస్ట్లను ఫిల్టర్ చేయండి. అవి దాదాపు ఎల్లప్పుడూ మాలీషియస్ స్కాన్లే.
వ్యతిరేక వాదన
రివర్స్ DNS తనిఖీలను స్పూఫ్ (spoof) చేయవచ్చని మరియు సైట్మ్యాప్లో ఇంకా జాబితా చేయబడని కొత్త URLలను కనుగొనడం బాట్ యొక్క చట్టబద్ధమైన ఉద్దేశ్యం కావచ్చు అని కొందరు వాదిస్తారు. ఆ ఆందోళనలు సరైనవే: ఒక పట్టుదల గల అటాకర్ DNS రికార్డును రాజీ చేయవచ్చు (compromise), మరియు తదుపరి జనరేషన్ సైకిల్ వరకు కొత్త కంటెంట్ సహజంగానే ప్రస్తుత సైట్మ్యాప్లో ఉండదు.
దీనికి ఆచరణాత్మక స్పందన ఏమిటంటే, వెరిఫికేషన్ను సంపూర్ణమైన గేట్గా కాకుండా ఒక కాన్ఫిడెన్స్ స్కోర్గా పరిగణించడం. "నిజమైన AI ట్రాఫిక్"గా మీరు దేనిని లెక్కించాలో దాని ప్రమాణాన్ని పెంచడానికి DNS వెరిఫికేషన్, సైట్మ్యాప్ ఉనికి మరియు రిక్వెస్ట్-మెథడ్ తనిఖీలను కలపండి. ఒక రిక్వెస్ట్ మూడు తనిఖీలలో రెండు పాస్ అయితే, దానిని నేరుగా పక్కన పెట్టేయకుండా మాన్యువల్ రివ్యూ కోసం ఫ్లాగ్ చేయండి.
తదుపరి ఏమి గమనించాలి
- Cloudflare’s verification APIలో మార్పులు –
verifiedBotCategoryలాజిక్లో ఏ మార్పు జరిగినా వెరిఫికేషన్ రేట్లు మారవచ్చు. - కొత్త స్వయంగా గుర్తించబడే బాట్ల ఆవిర్భావం – మీ లాగ్లలో కనిపించే User-Agent స్ట్రింగ్లను గమనించండి; అకస్మాత్తుగా పెరిగిన సంఖ్య AI క్రాలర్గా నటిస్తున్న కొత్త స్కానర్ను సూచించవచ్చు.
- Sitemap generation frequency – ఎక్కువ సమయ వ్యవధి ఉండటం వల్ల చట్టబద్ధమైన క్రాలర్లు తప్పుగా వర్గీకరించబడే అవకాశం పెరుగుతుంది.
ముగింపు సులభం: User-Agent స్ట్రింగ్ను నిరూపణగా పరిగణించడం ఆపండి. DNS వెరిఫికేషన్ మరియు సైట్మ్యాప్ వాలిడేషన్ను జోడించండి, అప్పుడు మీ కంటెంట్ను నిజంగా ఎవరు చదువుతున్నారో మీకు స్పష్టమైన చిత్రం కనిపిస్తుంది.
Source: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo
