AI ક્રોલર્સ તમારા ટ્રાફિકના આંકડા વધારી રહ્યા છે, અને સામાન્ય શોર્ટકટ—User-Agent હેડર તપાસવો—તેને પકડી શકતું નથી.

તાજેતરના આઠ દિવસના લોગ સ્વીપમાં 468 સાચા આર્ટિકલ ફેચ (fetches) સામે 991 એવી વિનંતીઓ મળી આવી જેઓ AI બોટ્સ હોવાનો ડોળ કરતી હતી, પરંતુ વાસ્તવમાં તે .env અથવા .git જેવી ફાઇલો શોધી રહી હતી. આનું કારણ શું છે? કોઈપણ વ્યક્તિ HTTP રિક્વેસ્ટમાં GPTBot અથવા ChatGPT-User જેવી પોતાની જાતે જાહેર કરેલી User-Agent સ્ટ્રિંગ ઉમેરી શકે છે.

આ મેટ્રિક શા માટે મહત્વનું છે

વેબસાઇટ્સ "AI ટ્રાફિક" માં થતા વધારાને પ્રસ્તુતતાના સંકેત તરીકે જુએ છે. તેઓ જાહેરાતના દરોને યોગ્ય ઠેરવવા, સર્વર રિસોર્સિસ ફાળવવા અને રોકાણકારોને બડાઈ મારવા માટે આ આંકડાનો ઉપયોગ કરે છે. જ્યારે અહેવાલ આપેલા AI હિટ્સમાંથી અડધા માત્ર બિનજરૂરી ઘોંઘાટ હોય, ત્યારે બજેટ ખોટી રીતે વપરાય છે અને ડેશબોર્ડ્સ ભ્રામક બની જાય છે.

દાવા અને વાસ્તવિકતાને અલગ કરતા બે ફિલ્ટર્સ

  1. Cloudflare’s verifiedBotCategory – Cloudflare આ ફિલ્ડ ત્યારે જ ભરે છે જ્યારે તે reverse DNS દ્વારા રિક્વેસ્ટના IP ને જાણીતા બોટ ડોમેન સાથે જોડે છે. જો હેડરમાં “GPTBot” લખ્યું હોય પરંતુ IP લુકઅપ નિષ્ફળ જાય, તો રિક્વેસ્ટ “unverified” (અપ્રમાણિત) વિભાગમાં જાય છે.
  2. Sitemap cross-check – બોટ ખરેખર તમારું કન્ટેન્ટ ત્યારે જ વાંચે છે જ્યારે રિક્વેસ્ટ કરેલ URL તમારા XML sitemap માં દેખાય છે. Sitemap માં ન હોય તેવા પાથ માટેની વિનંતીઓ આર્ટિકલ્સ ઇન્ડેક્સ કરવાને બદલે સંભવતઃ નબળાઈઓ (vulnerabilities) શોધવાનો પ્રયાસ કરતી હોય છે.

તે જ આઠ દિવસના સેમ્પલ પર બંને ફિલ્ટર્સ લાગુ કરવાથી આંકડાઓ સ્પષ્ટ રીતે અલગ જોવા મળ્યા:

  • ChatGPT-User – 39% વિનંતીઓ વેરિફિકેશનમાં પાસ થઈ.
  • GPTBot – 13% વેરિફાઇડ.
  • PerplexityBot – 0% વેરિફાઇડ.
  • Google-Extended – 0% વેરિફાઇડ; આ સ્ટ્રિંગ કોઈપણ સત્તાવાર Google ક્રોલર સાથે મેળ ખાતી નથી.

વેરિફાઇડ કોલ્સમાં પણ, ઘણા બોટ્સ માત્ર robots.txt અથવા પોતે sitemap જ ફેચ કરે છે, તમે જે આર્ટિકલ પેજમાં રસ ધરાવો છો તે નહીં.

ડેવલપર્સ આજે શું કરી શકે છે

  • તમારા એનાલિટિક્સ પાઇપલાઇનમાં Cloudflare bot verification સક્ષમ કરો. verifiedBotCategory ફિલ્ડ રિક્વેસ્ટ હેડર્સમાં દેખાય છે અને તેને તમારા પોતાના લોગ્સની સાથે સ્ટોર કરી શકાય છે.
  • અપ-ટુ-ડેટ sitemap જાળવી રાખો અને એ ચેક ઓટોમેટ કરો કે દરેક આવતી રિક્વેસ્ટનો પાથ ત્યાં અસ્તિત્વ ધરાવે છે કે નહીં, તે પહેલાં કે તમે તેને કન્ટેન્ટ વ્યુ તરીકે ગણો.
  • non-GET મેથડ્સ અને સામાન્ય ડેવલપમેન્ટ ફાઇલો (.env, .git, .bak) ને ટાર્ગેટ કરતી રિક્વેસ્ટ્સને ફિલ્ટર કરો. તે લગભગ હંમેશા માલશિયસ (malicious) સ્કેન હોય છે.

સામેની દલીલ

કેટલાક દલીલ કરે છે કે reverse DNS ચેક્સને સ્પોફ (spoof) કરી શકાય છે, અને બોટનો કાયદેસરનો હેતુ હજુ સુધી sitemap માં સૂચિબદ્ધ ન થયેલા નવા URL શોધવાનો હોઈ શકે છે. તે ચિંતાઓ વ્યાજબી છે: એક નિશ્ચિત હુમલાખોર DNS રેકોર્ડ સાથે છેડછાડ કરી શકે છે, અને આગામી જનરેશન સાયકલ સુધી નવું કન્ટેન્ટ કુદરતી રીતે વર્તમાન sitemap માં ગેરહાજર રહેશે.

વ્યવહારુ પ્રતિસાદ એ છે કે વેરિફિકેશનને સંપૂર્ણ માપદંડને બદલે કોન્ફિડન્સ સ્કોર તરીકે ગણવું. “સાચો AI ટ્રાફિક” તરીકે તમે જે ગણો તેના માટેના ધોરણો વધારવા માટે DNS વેરિફિકેશન, sitemap હાજરી અને request-method ચેક્સને સંયોજિત કરો. જો કોઈ રિક્વેસ્ટ ત્રણમાંથી બે ચેક પાસ કરે, તો તેને સીધી રીતે નકારવાને બદલે મેન્યુઅલ રિવ્યુ માટે ફ્લેગ કરો.

આગળ શું ધ્યાન રાખવું

  • Cloudflare’s verification API માં ફેરફારોverifiedBotCategory લોજિકમાં કોઈપણ ફેરફાર વેરિફિકેશન રેટ બદલી શકે છે.
  • નવા સ્વ-ઓળખ ધરાવતા બોટ્સનું આગમન – તમારા લોગ્સમાં દેખાતી User-Agent સ્ટ્રિંગ્સ પર નજર રાખો; અચાનક વધારો એ AI ક્રોલર તરીકે છદ્મવેષ ધારણ કરનાર નવા સ્કેનરનો સંકેત હોઈ શકે છે.
  • Sitemap જનરેશનની આવૃત્તિ – લાંબા અંતરાલને કારણે કાયદેસરના ક્રોલર્સનું ખોટું વર્ગીકરણ થવાની શક્યતા વધી જાય છે.

નિષ્કર્ષ સરળ છે: User-Agent સ્ટ્રિંગને પુરાવા તરીકે લેવાનું બંધ કરો. DNS વેરિફિકેશન અને sitemap વેલિડેશનના સ્તરો ઉમેરો, અને તમે ખરેખર કોણ તમારું કન્ટેન્ટ વાંચી રહ્યું છે તેનું સ્પષ્ટ ચિત્ર જોઈ શકશો.

સ્ત્રોત: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo