AI క్రాలర్లు మీ ట్రాఫిక్ గణాంకాలను పెంచుతున్నాయి, మరియు సాధారణ షార్ట్‌కట్—User-Agent హెడర్‌ను తనిఖీ చేయడం—దీనిని పట్టుకోలేదు.

ఇటీవలి ఎనిమిది రోజుల లాగ్ స్వీప్ 468 అసలైన ఆర్టికల్ ఫెచ్‌లను కనుగొంది, కానీ 991 రిక్వెస్ట్‌లు AI బాట్‌లుగా నటించాయి, కానీ నిజానికి .env లేదా .git వంటి ఫైల్‌ల కోసం వెతుకుతున్నాయి. దీనికి కారణం? ఎవరైనా HTTP రిక్వెస్ట్‌లో GPTBot లేదా ChatGPT-User వంటి స్వయంగా ప్రకటించుకున్న User-Agent స్ట్రింగ్‌ను చేర్చవచ్చు.

ఈ మెట్రిక్ ఎందుకు ముఖ్యం

వెబ్‌సైట్‌లు "AI ట్రాఫిక్" పెరుగుదలను ప్రాముఖ్యతగా భావిస్తాయి. వారు ప్రకటనల ధరలను (ad rates) సమర్థించుకోవడానికి, సర్వర్ వనరులను కేటాయించడానికి మరియు ఇన్వెస్టర్లకు గొప్పలు చెప్పుకోవడానికి ఈ సంఖ్యలను ఉపయోగిస్తారు. నివేదించబడిన AI హిట్స్‌లో సగం కేవలం నాయిస్ (noise) అయినప్పుడు, బడ్జెట్‌లు వృధా అవుతాయి మరియు డ్యాష్‌బోర్డ్‌లు తప్పుదారి పట్టిస్తాయి.

వాస్తవానికి మరియు వాదనకు మధ్య తేడాను చూపే రెండు ఫిల్టర్లు

  1. Cloudflare’s verifiedBotCategory – రివర్స్ DNS ద్వారా రిక్వెస్ట్ యొక్క IPని తెలిసిన బాట్ డొమైన్‌కు అనుసంధానించిన తర్వాత మాత్రమే Cloudflare ఈ ఫీల్డ్‌ను నింపుతుంది. హెడర్ "GPTBot" అని చెప్పినప్పటికీ, IP లుకప్ విఫలమైతే, ఆ రిక్వెస్ట్ "unverified" విభాగంలోకి వెళ్తుంది.
  2. Sitemap cross-check – అభ్యర్థించిన URL మీ XML sitemapలో కనిపించినప్పుడు మాత్రమే ఒక బాట్ నిజంగా మీ కంటెంట్‌ను చదువుతుంది. సైట్‌మ్యాప్‌లో లేని పాత్‌ల కోసం చేసే రిక్వెస్ట్‌లు ఆర్టికల్‌లను ఇండెక్స్ చేయడం కంటే లోపాలను (vulnerabilities) వెతకడానికే ఎక్కువ అవకాశం ఉంది.

అదే ఎనిమిది రోజుల నమూనాకు రెండు ఫిల్టర్లను వర్తింపజేయగా ఈ క్రింది గణాంకాలు వచ్చాయి:

  • ChatGPT-User – 39% రిక్వెస్ట్‌లు వెరిఫికేషన్‌ను దాటాయి.
  • GPTBot – 13% వెరిఫై అయ్యాయి.
  • PerplexityBot – 0% వెరిఫై అయ్యాయి.
  • Google-Extended – 0% వెరిఫై అయ్యాయి; ఈ స్ట్రింగ్ ఏ అధికారిక Google క్రాలర్‌కు సంబంధించినది కాదు.

వెరిఫై చేయబడిన కాల్స్‌లో కూడా, చాలా బాట్‌లు కేవలం robots.txt లేదా సైట్‌మ్యాప్‌ను మాత్రమే ఫెచ్ చేశాయి, మీరు ఆశించే ఆర్టికల్ పేజీలను కాదు.

డెవలపర్లు ఈరోజు ఏమి చేయవచ్చు

  • మీ అనలిటిక్స్ పైప్‌లైన్‌లో Cloudflare bot verificationను ఎనేబుల్ చేయండి. verifiedBotCategory ఫీల్డ్ రిక్వెస్ట్ హెడర్‌లలో కనిపిస్తుంది మరియు దానిని మీ స్వంత లాగ్‌లతో పాటు నిల్వ చేయవచ్చు.
  • అప్‌డేటెడ్ సైట్‌మ్యాప్‌ను నిర్వహించండి మరియు ప్రతి ఇన్కమింగ్ రిక్వెస్ట్ పాత్ కంటెంట్ వ్యూగా లెక్కించబడటానికి ముందు అది అక్కడ ఉందో లేదో తనిఖీ చేసే ప్రక్రియను ఆటోమేట్ చేయండి.
  • non-GET మెథడ్స్ మరియు సాధారణ డెవలప్‌మెంట్ ఫైల్‌లను (.env, .git, .bak) లక్ష్యంగా చేసుకునే రిక్వెస్ట్‌లను ఫిల్టర్ చేయండి. అవి దాదాపు ఎల్లప్పుడూ మాలీషియస్ స్కాన్‌లే.

వ్యతిరేక వాదన

రివర్స్ DNS తనిఖీలను స్పూఫ్ (spoof) చేయవచ్చని మరియు సైట్‌మ్యాప్‌లో ఇంకా జాబితా చేయబడని కొత్త URLలను కనుగొనడం బాట్ యొక్క చట్టబద్ధమైన ఉద్దేశ్యం కావచ్చు అని కొందరు వాదిస్తారు. ఆ ఆందోళనలు సరైనవే: ఒక పట్టుదల గల అటాకర్ DNS రికార్డును రాజీ చేయవచ్చు (compromise), మరియు తదుపరి జనరేషన్ సైకిల్ వరకు కొత్త కంటెంట్ సహజంగానే ప్రస్తుత సైట్‌మ్యాప్‌లో ఉండదు.

దీనికి ఆచరణాత్మక స్పందన ఏమిటంటే, వెరిఫికేషన్‌ను సంపూర్ణమైన గేట్‌గా కాకుండా ఒక కాన్ఫిడెన్స్ స్కోర్‌గా పరిగణించడం. "నిజమైన AI ట్రాఫిక్"గా మీరు దేనిని లెక్కించాలో దాని ప్రమాణాన్ని పెంచడానికి DNS వెరిఫికేషన్, సైట్‌మ్యాప్ ఉనికి మరియు రిక్వెస్ట్-మెథడ్ తనిఖీలను కలపండి. ఒక రిక్వెస్ట్ మూడు తనిఖీలలో రెండు పాస్ అయితే, దానిని నేరుగా పక్కన పెట్టేయకుండా మాన్యువల్ రివ్యూ కోసం ఫ్లాగ్ చేయండి.

తదుపరి ఏమి గమనించాలి

  • Cloudflare’s verification APIలో మార్పులుverifiedBotCategory లాజిక్‌లో ఏ మార్పు జరిగినా వెరిఫికేషన్ రేట్లు మారవచ్చు.
  • కొత్త స్వయంగా గుర్తించబడే బాట్‌ల ఆవిర్భావం – మీ లాగ్‌లలో కనిపించే User-Agent స్ట్రింగ్‌లను గమనించండి; అకస్మాత్తుగా పెరిగిన సంఖ్య AI క్రాలర్‌గా నటిస్తున్న కొత్త స్కానర్‌ను సూచించవచ్చు.
  • Sitemap generation frequency – ఎక్కువ సమయ వ్యవధి ఉండటం వల్ల చట్టబద్ధమైన క్రాలర్‌లు తప్పుగా వర్గీకరించబడే అవకాశం పెరుగుతుంది.

ముగింపు సులభం: User-Agent స్ట్రింగ్‌ను నిరూపణగా పరిగణించడం ఆపండి. DNS వెరిఫికేషన్ మరియు సైట్‌మ్యాప్ వాలిడేషన్‌ను జోడించండి, అప్పుడు మీ కంటెంట్‌ను నిజంగా ఎవరు చదువుతున్నారో మీకు స్పష్టమైన చిత్రం కనిపిస్తుంది.

Source: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo