AI ക്രോളറുകൾ നിങ്ങളുടെ ട്രാഫിക് കണക്കുകൾ വർദ്ധിപ്പിക്കുന്നു, സാധാരണയായി ഉപയോഗിക്കുന്ന ഒരു എളുപ്പവഴിയായ User-Agent ഹെഡർ പരിശോധിക്കുന്നത് ഇതിനെ കണ്ടെത്താൻ സഹായിക്കില്ല.
അടുത്തിടെ നടത്തിയ എട്ട് ദിവസത്തെ ലോഗ് പരിശോധനയിൽ 468 യഥാർത്ഥ ആർട്ടിക്കിൾ ഫെച്ചുകൾ (fetches) കണ്ടെത്തിയപ്പോൾ, 991 റിക്വസ്റ്റുകൾ AI ബോട്ടുകളാണെന്ന് നടിച്ചു .env അല്ലെങ്കിൽ .git പോലുള്ള ഫയലുകൾക്കായി തിരയുകയായിരുന്നു. ഇതിന്റെ കാരണം? ആർക്കും ഒരു HTTP റിക്വസ്റ്റിൽ GPTBot അല്ലെങ്കിൽ ChatGPT-User പോലുള്ള സ്വയം പ്രഖ്യാപിച്ച User-Agent സ്ട്രിംഗ് ഉൾപ്പെടുത്താൻ കഴിയും.
ഈ അളവ് (metric) പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്?
"AI ട്രാഫിക്" വർദ്ധിക്കുന്നത് ഒരു വെബ്സൈറ്റിന്റെ പ്രസക്തിയുടെ അടയാളമായി പലരും കണക്കാക്കുന്നു. പരസ്യ നിരക്കുകൾ നിശ്ചയിക്കാനും, സെർവർ റിസോഴ്സുകൾ വിനിയോഗിക്കാനും, നിക്ഷേപകരോട് അവകാശപ്പെടാനും അവർ ഈ കണക്കുകൾ ഉപയോഗിക്കുന്നു. റിപ്പോർട്ട് ചെയ്യപ്പെടുന്ന AI ഹിറ്റുകളിൽ പകുതിയും വെറും വ്യാജമാണെങ്കിൽ, ബജറ്റുകൾ തെറ്റായ രീതിയിൽ ഉപയോഗിക്കപ്പെടുകയും ഡാഷ്ബോർഡുകൾ തെറ്റായ വിവരങ്ങൾ നൽകുകയും ചെയ്യുന്നു.
അവകാശവാദങ്ങളും യാഥാർത്ഥ്യവും തമ്മിലുള്ള വ്യത്യാസം തിരിച്ചറിയാനുള്ള രണ്ട് ഫിൽട്ടറുകൾ
- Cloudflare-ന്റെ
verifiedBotCategory– റിവേഴ്സ് DNS (reverse DNS) വഴി റിക്വസ്റ്റ് വന്ന IP ഒരു അറിയപ്പെടുന്ന ബോട്ട് ഡൊമെയ്നുമായി ബന്ധപ്പെട്ടിട്ടുണ്ടെന്ന് ഉറപ്പുവരുത്തിയ ശേഷം മാത്രമേ Cloudflare ഈ ഫീൽഡ് പൂരിപ്പിക്കുകയുള്ളൂ. ഹെഡറിൽ “GPTBot” എന്ന് കാണിക്കുന്നുണ്ടെങ്കിലും IP പരിശോധനയിൽ പരാജയപ്പെട്ടാൽ, ആ റിക്വസ്റ്റ് “unverified” വിഭാഗത്തിൽ പെടും. - Sitemap ക്രോസ്-ചെക്ക് – ഒരു ബോട്ട് നിങ്ങളുടെ ഉള്ളടക്കം യഥാർത്ഥത്തിൽ വായിക്കുന്നുണ്ടെങ്കിൽ, ആ റിക്വസ്റ്റ് ചെയ്ത URL നിങ്ങളുടെ XML sitemap-ൽ ഉണ്ടായിരിക്കണം. സൈറ്റ്മാപ്പിൽ ഇല്ലാത്ത പാതകൾക്കായി (paths) വരുന്ന റിക്വസ്റ്റുകൾ ആർട്ടിക്കിളുകൾ ഇൻഡക്സ് ചെയ്യുന്നതിനേക്കാൾ ഉപരിയായി സുരക്ഷാ പിഴവുകൾ (vulnerabilities) തേടാനായിരിക്കാം.
ഒരേ എട്ട് ദിവസത്തെ സാമ്പിളിൽ ഈ രണ്ട് ഫിൽട്ടറുകളും പ്രയോഗിച്ചപ്പോൾ ലഭിച്ച കൃത്യമായ കണക്കുകൾ ഇവയാണ്:
- ChatGPT-User – 39% റിക്വസ്റ്റുകൾ വെരിഫിക്കേഷൻ പാസായി.
- GPTBot – 13% വെരിഫൈഡ്.
- PerplexityBot – 0% വെരിഫൈഡ്.
- Google-Extended – 0% വെരിഫൈഡ്; ഈ സ്ട്രിംഗ് ഔദ്യോഗികമായ ഒരു Google crawler-മായി ബന്ധപ്പെട്ടതല്ല.
വെരിഫൈഡ് ആയ കോളുകൾക്കിടയിൽ പോലും, പല ബോട്ടുകളും robots.txt അല്ലെങ്കിൽ സൈറ്റ്മാപ്പ് മാത്രമാണ് ഫെച്ച് ചെയ്തത്, നിങ്ങൾ ആഗ്രഹിക്കുന്ന ആർട്ടിക്കിൾ പേജുകളല്ല.
ഡെവലപ്പർമാർക്ക് ഇന്ന് ചെയ്യാൻ കഴിയുന്ന കാര്യങ്ങൾ
- നിങ്ങളുടെ അനലിറ്റിക്സ് പൈപ്പ്ലൈനിൽ Cloudflare bot verification പ്രവർത്തനക്ഷമമാക്കുക.
verifiedBotCategoryഫീൽഡ് റിക്വസ്റ്റ് ഹെഡറുകളിൽ ലഭ്യമാണ്, ഇത് നിങ്ങളുടെ ലോഗുകൾക്കൊപ്പം സൂക്ഷിക്കാവുന്നതാണ്. - അപ്ഡേറ്റഡ് ആയ ഒരു sitemap നിലനിർത്തുക, കൂടാതെ ഓരോ ഇൻകമിംഗ് റിക്വസ്റ്റും ഒരു കണ്ടന്റ് വ്യൂ ആയി കണക്കാക്കുന്നതിന് മുമ്പ് അതിന്റെ പാത്ത് സൈറ്റ്മാപ്പിൽ ഉണ്ടോ എന്ന് പരിശോധിക്കുന്ന ഒരു ഓട്ടോമേറ്റഡ് സംവിധാനം ഏർപ്പെടുത്തുക.
- non-GET മെത്തേഡുകളും, സാധാരണ ഡെവലപ്മെന്റ് ഫയലുകൾ (
.env,.git,.bak) ലക്ഷ്യമിടുന്ന റിക്വസ്റ്റുകളും ഫിൽട്ടർ ചെയ്യുക. ഇവ മിക്കവാറും മാലീഷ്യസ് സ്കാനുകൾ (malicious scans) ആയിരിക്കും.
എതിർവാദം (The counter-point)
റിവേഴ്സ് DNS പരിശോധനകൾ വ്യാജമായി നിർമ്മിക്കാൻ (spoof) കഴിയുമെന്നും, സൈറ്റ്മാപ്പിൽ ഇല്ലാത്ത പുതിയ URL-കൾ കണ്ടെത്തുക എന്നതാകാം ഒരു ബോട്ടിന്റെ യഥാർത്ഥ ലക്ഷ്യമെന്നും ചിലർ വാദിക്കുന്നു. ഈ ആശങ്കകൾ ന്യായമാണ്: ഒരു ആക്രമണകാരിക്ക് DNS റെക്കോർഡ് ദുരുപയോഗം ചെയ്യാൻ കഴിഞ്ഞേക്കാം, കൂടാതെ പുതിയ ഉള്ളടക്കങ്ങൾ അടുത്ത ജനറേഷൻ സൈക്കിൾ വരെ സൈറ്റ്മാപ്പിൽ ഉണ്ടാകില്ല.
ഇതിനുള്ള പ്രായോഗികമായ പരിഹാരം, വെരിഫിക്കേഷനെ ഒരു പൂർണ്ണമായ തീരുമാനമായി കാണാതെ ഒരു 'കോൺഫിഡൻസ് സ്കോർ' (confidence score) ആയി കണക്കാക്കുക എന്നതാണ്. യഥാർത്ഥ AI ട്രാഫിക് എന്ന് കണക്കാക്കുന്നതിനുള്ള മാനദണ്ഡം ഉയർത്താൻ DNS വെരിഫിക്കേഷൻ, sitemap സാന്നിധ്യം, റിക്വസ്റ്റ്-മെത്തേഡ് പരിശോധനകൾ എന്നിവ സംയോജിപ്പിക്കുക. ഒരു റിക്വസ്റ്റ് മൂന്ന് പരിശോധനകളിൽ രണ്ടെണ്ണത്തിൽ വിജയിച്ചാൽ, അതിനെ നേരിട്ട് ഒഴിവാക്കുന്നതിന് പകരം മാനുവൽ റിവ്യൂവിനായി അടയാളപ്പെടുത്തുക.
ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
- Cloudflare-ന്റെ വെരിഫിക്കേഷൻ API-യിലെ മാറ്റങ്ങൾ –
verifiedBotCategoryലോജിക്കിൽ വരുന്ന ഏതൊരു മാറ്റവും വെരിഫിക്കേഷൻ നിരക്കുകളെ സ്വാധീനിച്ചേക്കാം. - പുതിയ സ്വയം തിരിച്ചറിയപ്പെടുന്ന ബോട്ടുകളുടെ ആവിർഭാവം – നിങ്ങളുടെ ലോഗുകളിൽ വരുന്ന User-Agent സ്ട്രിംഗുകൾ ശ്രദ്ധിക്കുക; പെട്ടെന്നുണ്ടാകുന്ന വർദ്ധനവ് ഒരു AI ക്രോളർ ആണെന്ന് നടിക്കുന്ന പുതിയ സ്കാനറുകളെ സൂചിപ്പിച്ചേക്കാം.
- Sitemap ജനറേഷൻ ഫ്രീക്വൻസി – സൈറ്റ്മാപ്പ് പുതുക്കുന്ന ഇടവേളകൾ കൂടുമ്പോൾ, യഥാർത്ഥ ക്രോളറുകൾ തെറ്റായി തരംതിരിക്കപ്പെടാനുള്ള സാധ്യത വർദ്ധിക്കുന്നു.
ഇതിലെ പാഠം ലളിതമാണ്: ഒരു User-Agent സ്ട്രിംഗിനെ മാത്രം തെളിവായി കാണുന്നത് നിർത്തുക. DNS വെരിഫിക്കേഷനും സൈറ്റ്മാപ്പ് വാലിഡേഷനും ഉപയോഗിക്കുക, അപ്പോൾ നിങ്ങളുടെ ഉള്ളടക്കം യഥാർത്ഥത്തിൽ ആരാണ് വായിക്കുന്നത് എന്നതിനെക്കുറിച്ച് വ്യക്തമായ ചിത്രം നിങ്ങൾക്ക് ലഭിക്കും.
Source: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo
