AI க்ராலர்கள் உங்கள் டிராஃபிக் எண்ணிக்கையைத் தவறாக உயர்த்துகின்றன, மேலும் வழக்கமான குறுக்குவழியான—User-Agent ஹெடரைச் சரிபார்ப்பது—இதைக் கண்டறியாது.

சமீபத்திய எட்டு நாட்களுக்கான லாக் ஆய்வு (log sweep), 468 உண்மையான கட்டுரைத் தரவுகளைக் (article fetches) கண்டறிந்தது, ஆனால் 991 கோரிக்கைகள் AI பாட்கள் போலத் நடித்து, உண்மையில் .env அல்லது .git போன்ற கோப்புகளைத் தேடுகின்றன. இதற்குக் காரணம் என்ன? யார் வேண்டுமானாலும் ஒரு HTTP கோரிக்கையில் GPTBot அல்லது ChatGPT-User போன்ற ஒரு சுய-அறிவிக்கப்பட்ட User-Agent சரத்தைச் (string) சேர்க்க முடியும்.

ஏன் இந்த அளவீடு முக்கியமானது

இணையதளங்கள் "AI டிராஃபிக்" அதிகரிப்பைப் பொருத்தமானத் தொடர்பின் (relevance) அறிகுறியாகக் கருதுகின்றன. விளம்பரக் கட்டணங்களை நியாயப்படுத்தவும், சர்வர் வளங்களை ஒதுக்கீடு செய்யவும் மற்றும் முதலீட்டாளர்களிடம் பெருமை பேசவும் அவர்கள் இந்த எண்களைப் பயன்படுத்துகின்றனர். அறிக்கையிடப்படும் AIத் தொடர்புகளில் பாதி வெறும் தேவையற்ற இரைச்சலாக (noise) இருக்கும்போது, பட்ஜெட்டுகள் திசைமாறுகின்றன மற்றும் டேஷ்போர்டுகள் தவறான தகவல்களைத் தருகின்றன.

உண்மைக்கும் கூற்றுக்கும் இடையிலான வேறுபாட்டைத் தீர்மானிக்கும் இரண்டு வடிகட்டிகள்

  1. Cloudflare-இன் verifiedBotCategory – Cloudflare இந்தத் புலத்தை (field) ஒரு கோரிக்கையின் IP-ஐ reverse DNS மூலம் ஒரு அறியப்பட்ட பாட் டொமைனுடன் (bot domain) இணைத்த பின்னரே நிரப்புகிறது. ஹெடரில் "GPTBot" என்று இருந்தாலும், IP சரிபார்ப்பில் தோல்வியடைந்தால், அந்த கோரிக்கை "சரிபார்க்கப்படாத" (unverified) பிரிவில் சேரும்.
  2. Sitemap குறுக்குச் சரிபார்ப்பு – ஒரு பாட் உங்கள் உள்ளடக்கத்தை உண்மையாகவே வாசிக்க வேண்டுமானால், கோரப்பட்ட URL உங்கள் XML sitemap-இல் இருக்க வேண்டும். sitemap-இல் இல்லாத பாதைகளுக்கான (paths) கோரிக்கைகள், கட்டுரைகளைத் தேடுவதை விட, பாதுகாப்பு ஓட்டைகளைத் (vulnerabilities) தேடுவதற்கே அதிக வாய்ப்புள்ளது.

ஒரே எட்டு நாள் மாதிரியில் இந்த இரண்டு வடிகட்டிகளையும் பயன்படுத்தியபோது வெளிவந்த எண்கள் அதிர்ச்சியளிக்கின்றன:

  • ChatGPT-User – 39% கோரிக்கைகள் சரிபார்க்கப்பட்டன.
  • GPTBot – 13% சரிபார்க்கப்பட்டன.
  • PerplexityBot – 0% சரிபார்க்கப்பட்டன.
  • Google-Extended – 0% சரிபார்க்கப்பட்டன; இந்தச் சரம் எந்தவொரு அதிகாரப்பூர்வ கூகுள் க்ராலருடனும் பொருந்தவில்லை.

சரிபார்க்கப்பட்ட அழைப்புகளுக்கு இடையிலும், பல பாட்கள் robots.txt அல்லது sitemap-ஐ மட்டுமே தரவிறக்கம் செய்தன, நீங்கள் எதிர்பார்க்கும் கட்டுரைப் பக்கங்களை அல்ல.

டெவலப்பர்கள் இன்று என்ன செய்யலாம்

  • உங்கள் அனலிட்டிக்ஸ் பைப்லைனில் (analytics pipeline) Cloudflare பாட் சரிபார்ப்பைச் செயல்படுத்தவும். verifiedBotCategory புலம் கோரிக்கை ஹெடர்களில் தோன்றும் மற்றும் அதை உங்கள் சொந்த லாக்ஸுடன் சேர்த்துச் சேமிக்க முடியும்.
  • புதுப்பிக்கப்பட்ட sitemap-ஐப் பராமரிக்கவும் மற்றும் ஒரு கோரிக்கையை உள்ளடக்கப் பார்வையாக (content view) எண்ணுவதற்கு முன், அதன் பாதை sitemap-இல் உள்ளதா என்பதைத் தானியக்க முறையில் சரிபார்க்கவும்.
  • non-GET முறைகள் மற்றும் வழக்கமான டெவலப்மென்ட் கோப்புகளை (.env, .git, .bak) இலக்கு வைக்கும் கோரிக்கைகளைத் தவிர்க்கவும். அவை பெரும்பாலும் தீய நோக்கத்துடன் செய்யப்படும் ஸ்கேன்களாகவே (malicious scans) இருக்கும்.

மாற்றுக்கருத்து

Reverse DNS சரிபார்ப்புகளை ஏமாற்ற (spoof) முடியும் என்றும், sitemap-இல் இன்னும் பட்டியலிடப்படாத புதிய URL-களைக் கண்டறிவதே ஒரு பாட்டின் சரியான நோக்கமாகவும் இருக்கலாம் என்றும் சிலர் வாதிடுகின்றனர். அந்த கவலைகள் நியாயமானவை: ஒரு விடாப்பிடியான தாக்குபவர் DNS பதிவைச் சிதைக்கக்கூடும், மேலும் புதிய உள்ளடக்கங்கள் அடுத்த உருவாக்கச் சுழற்சி (generation cycle) வரும் வரை தற்போதைய sitemap-இல் இருக்காது.

இதற்கான நடைமுறை ரீதியான பதில் என்னவென்றால், சரிபார்ப்பை ஒரு முழுமையான நுழைவாயிலாகக் கருதாமல், ஒரு நம்பிக்கைப் புள்ளியாக (confidence score) கருதுவதாகும். DNS சரிபார்ப்பு, sitemap இருப்பு மற்றும் கோரிக்கை முறை (request-method) ஆகியவற்றை இணைப்பதன் மூலம், நீங்கள் "உண்மையான AI டிராஃபிக்" என்று எதைக் கணக்கிடுகிறீர்கள் என்பதற்கான தரநிலையை உயர்த்தலாம். ஒரு கோரிக்கை மூன்று சோதனைகளில் இரண்டைத் தாண்டினால், அதைத் தூக்கி எறியாமல், மேனுவல் ஆய்விற்காக (manual review) அடையாளக் குறியிடுங்கள்.

அடுத்து எவற்றைக் கவனிக்க வேண்டும்

  • Cloudflare-இன் சரிபார்ப்பு API-இல் ஏற்படும் மாற்றங்கள்verifiedBotCategory தர்க்கத்தில் (logic) ஏற்படும் எந்தவொரு மாற்றமும் சரிபார்ப்பு விகிதங்களை மாற்றக்கூடும்.
  • புதிய சுய-அடையாள பாட்கள் தோன்றுதல் – உங்கள் லாக்ஸில் தோன்றும் User-Agent சரங்களைக் கவனியுங்கள்; திடீர் அதிகரிப்பு என்பது ஒரு புதிய ஸ்கேனர் AI க்ராலராகத் தன்னைத் தற்காத்துக் கொள்வதைக் குறிக்கலாம்.
  • Sitemap உருவாக்கப்படும் இடைவெளிகள் – நீண்ட இடைவெளிகள், முறையான க்ராலர்கள் தவறாக வகைப்படுத்தப்படுவதற்கான வாய்ப்பை அதிகரிக்கின்றன.

இதன் சுருக்கம் எளிமையானது: User-Agent சரத்தை ஒரு ஆதாரமாகப் பார்ப்பதை நிறுத்துங்கள். DNS சரிபார்ப்பு மற்றும் sitemap சரிபார்ப்பைச் சேர்த்துப் பயன்படுத்துங்கள், அப்போதுதான் உங்கள் உள்ளடக்கத்தை உண்மையில் யார் வாசிக்கிறார்கள் என்ற தெளிவான பிம்பத்தைப் பெற முடியும்.

Source: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo