AI ਕ੍ਰੌਲਰ ਤੁਹਾਡੇ ਟ੍ਰੈਫਿਕ ਦੇ ਅੰਕੜਿਆਂ ਨੂੰ ਵਧਾ ਰਹੇ ਹਨ, ਅਤੇ ਆਮ ਸ਼ਾਰਟਕੱਟ—User-Agent ਹੈਡਰ ਦੀ ਜਾਂਚ ਕਰਨਾ—ਇਸ ਨੂੰ ਫੜ ਨਹੀਂ ਪਾਉਂਦਾ।
ਹਾਲ ਹੀ ਵਿੱਚ ਅੱਠ ਦਿਨਾਂ ਦੇ ਲੌਗ ਸਵੀਪ (log sweep) ਵਿੱਚ 468 ਅਸਲੀ ਆਰਟੀਕਲ ਫੈਚ (fetches) ਮਿਲੇ, ਪਰ 991 ਅਜਿਹੀਆਂ ਬੇਨਤੀਆਂ ਮਿਲੀਆਂ ਜੋ ਅਸਲ ਵਿੱਚ .env ਜਾਂ .git ਵਰਗੀਆਂ ਫਾਈਲਾਂ ਦੀ ਜਾਂਚ ਕਰ ਰਹੀਆਂ ਸਨ ਪਰ AI ਬੋਟਸ ਹੋਣ ਦਾ ਢੋਂਗ ਕਰ ਰਹੀਆਂ ਸਨ। ਦੋਸ਼ੀ ਕੌਣ ਹੈ? ਕੋਈ ਵੀ HTTP ਰਿਕਵੈਸਟ ਵਿੱਚ GPTBot ਜਾਂ ChatGPT-User ਵਰਗਾ ਸਵੈ-ਘੋਸ਼ਿਤ User-Agent ਸਟ੍ਰਿੰਗ ਪਾ ਸਕਦਾ ਹੈ।
ਇਹ ਮੈਟ੍ਰਿਕ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਵੈੱਬਸਾਈਟਾਂ "AI ਟ੍ਰੈਫਿਕ" ਵਿੱਚ ਵਾਧੇ ਨੂੰ ਪ੍ਰਸੰਗਿਕਤਾ (relevance) ਦੇ ਸੰਕੇਤ ਵਜੋਂ ਮੰਨਦੀਆਂ ਹਨ। ਉਹ ਇਸ਼ਤਿਹਾਰਾਂ ਦੀਆਂ ਦਰਾਂ ਨੂੰ ਜਾਇਜ਼ ठहराਉਣ, ਸਰਵਰ ਸਰੋਤਾਂ ਨੂੰ ਵੰਡਣ ਅਤੇ ਨਿਵੇਸ਼ਕਾਂ ਨੂੰ ਦਿਖਾਵਾ ਕਰਨ ਲਈ ਇਹਨਾਂ ਅੰਕੜਿਆਂ ਦੀ ਵਰਤੋਂ ਕਰਦੀਆਂ ਹਨ। ਜਦੋਂ ਰਿਪੋਰਟ ਕੀਤੇ ਗਏ AI ਹਿੱਟਸ ਵਿੱਚੋਂ ਅੱਧੇ ਸਿਰਫ਼ ਸ਼ੋਰ (noise) ਹੁੰਦੇ ਹਨ, ਤਾਂ ਬਜਟ ਗਲਤ ਹੋ ਜਾਂਦੇ ਹਨ ਅਤੇ ਡੈਸ਼ਬੋਰਡ ਭਰਮਾਊਹੀ ਹੋ ਜਾਂਦੇ ਹਨ।
ਦੋ ਫਿਲਟਰ ਜੋ ਦਾਅਵੇ ਨੂੰ ਹਕੀਕਤ ਤੋਂ ਵੱਖ ਕਰਦੇ ਹਨ
- Cloudflare ਦਾ
verifiedBotCategory– Cloudflare ਇਸ ਫੀਲਡ ਨੂੰ ਉਦੋਂ ਹੀ ਭਰਦਾ ਹੈ ਜਦੋਂ ਇਹ reverse DNS ਰਾਹੀਂ ਰਿਕਵੈਸਟ ਦੇ IP ਨੂੰ ਕਿਸੇ ਜਾਣੇ-ਪਛਾਣੇ ਬੋਟ ਡੋਮੇਨ ਨਾਲ ਜੋੜਦਾ ਹੈ। ਜੇਕਰ ਹੈਡਰ "GPTBot" ਕਹਿੰਦਾ ਹੈ ਪਰ IP ਲੁੱਕਅੱਪ (lookup) ਫੇਲ ਹੋ ਜਾਂਦਾ ਹੈ, ਤਾਂ ਰਿਕਵੈਸਟ "unverified" ਬੱਕਟ ਵਿੱਚ ਚਲੀ ਜਾਂਦੀ ਹੈ। - Sitemap cross-check – ਇੱਕ ਬੋਟ ਤੁਹਾਡੇ ਕੰਟੈਂਟ ਨੂੰ ਸਿਰਫ਼ ਉਦੋਂ ਹੀ ਸੱਚਮੁੱਚ ਪੜ੍ਹਦਾ ਹੈ ਜਦੋਂ ਮੰਗੀ ਗਈ URL ਤੁਹਾਡੇ XML sitemap ਵਿੱਚ ਦਿਖਾਈ ਦਿੰਦੀ ਹੈ। Sitemap ਵਿੱਚ ਨਾ ਹੋਣ ਵਾਲੇ ਪਾਥ (paths) ਲਈ ਕੀਤੀਆਂ ਗਈਆਂ ਰਿਕਵੈਸਟਾਂ ਆਰਟੀਕਲ ਇੰਡੈਕਸ ਕਰਨ ਦੀ ਬਜਾਏ ਸੰਭਾਵਤ ਤੌਰ 'ਤੇ ਕਮਜ਼ੋਰੀਆਂ (vulnerabilities) ਦੀ ਭਾਲ ਕਰਦੀਆਂ ਹਨ।
ਉਸੇ ਅੱਠ ਦਿਨਾਂ ਦੇ ਨਮੂਨੇ 'ਤੇ ਦੋਵੇਂ ਫਿਲਟਰ ਲਾਗੂ ਕਰਨ 'ਤੇ ਇਹ ਸਪੱਸ਼ਟ ਅੰਕੜੇ ਸਾਹਮਣੇ ਆਏ:
- ChatGPT-User – 39% ਰਿਕਵੈਸਟਾਂ ਵੈਰੀਫਿਕੇਸ਼ਨ ਵਿੱਚੋਂ ਲੰਘ ਗਈਆਂ।
- GPTBot – 13% ਵੈਰੀਫਾਈਡ।
- PerplexityBot – 0% ਵੈਰੀਫਾਈਡ।
- Google-Extended – 0% ਵੈਰੀਫਾਈਡ; ਇਹ ਸਟ੍ਰਿੰਗ ਕਿਸੇ ਵੀ ਅਧਿਕਾਰਤ Google ਕ੍ਰੌਲਰ ਨਾਲ ਮੇਲ ਨਹੀਂ ਖਾਂਦੀ।
ਵੈਰੀਫਾਈਡ ਕਾਲਾਂ ਵਿੱਚ ਵੀ, ਬਹੁਤ ਸਾਰੇ ਬੋਟਸ ਨੇ ਸਿਰਫ਼ robots.txt ਜਾਂ sitemap ਨੂੰ ਹੀ ਫੈਚ ਕੀਤਾ, ਉਹ ਆਰਟੀਕਲ ਪੇਜ ਨਹੀਂ ਜਿਨ੍ਹਾਂ ਦੀ ਤੁਹਾਨੂੰ ਚਿੰਤਾ ਹੈ।
ਡਿਵੈਲਪਰ ਅੱਜ ਕੀ ਕਰ ਸਕਦੇ ਹਨ
- ਆਪਣੇ ਐਨਾਲਿਟਿਕਸ ਪਾਈਪਲਾਈਨ ਵਿੱਚ Cloudflare bot verification ਨੂੰ ਚਾਲੂ ਕਰੋ।
verifiedBotCategoryਫੀਲਡ ਰਿਕਵੈਸਟ ਹੈਡਰਾਂ ਵਿੱਚ ਦਿਖਾਈ ਦਿੰਦੀ ਹੈ ਅਤੇ ਇਸਨੂੰ ਤੁਹਾਡੇ ਆਪਣੇ ਲੌਗਸ ਦੇ ਨਾਲ ਸਟੋਰ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ। - ਇੱਕ ਅੱਪ-ਟੂ-ਡੇਟ sitemap ਬਣਾਈ ਰੱਖੋ ਅਤੇ ਇੱਕ ਅਜਿਹੀ ਚੈੱਕਿੰਗ ਨੂੰ ਆਟੋਮੇਟ ਕਰੋ ਕਿ ਹਰ ਆਉਣ ਵਾਲੀ ਰਿਕਵੈਸਟ ਦਾ ਪਾਥ ਇਸ ਵਿੱਚ ਮੌਜੂਦ ਹੈ ਜਾਂ ਨਹੀਂ, ਇਸ ਤੋਂ ਪਹਿਲਾਂ ਕਿ ਤੁਸੀਂ ਇਸਨੂੰ ਕੰਟੈਂਟ ਵਿਊ ਵਜੋਂ ਗਿਣੋ।
- non-GET ਮੈਥਡਸ ਅਤੇ ਉਹਨਾਂ ਰਿਕਵੈਸਟਾਂ ਨੂੰ ਫਿਲਟਰ ਕਰੋ ਜੋ ਆਮ ਡਿਵੈਲਪਮੈਂਟ ਫਾਈਲਾਂ (
.env,.git,.bak) ਨੂੰ ਨਿਸ਼ਾਨਾ ਬਣਾਉਂਦੀਆਂ ਹਨ। ਉਹ ਲਗਭਗ ਹਮੇਸ਼ਾ ਮੈਲੀਸ਼ੀਅਸ (malicious) ਸਕੈਨ ਹੁੰਦੇ ਹਨ।
ਵਿਰੋਧੀ ਪੱਖ
ਕੁਝ ਲੋਕਾਂ ਦਾ ਤਰਕ ਹੈ ਕਿ reverse DNS ਚੈੱਕ ਨੂੰ ਸਪੂਫ (spoof) ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ, ਅਤੇ ਇੱਕ ਬੋਟ ਦਾ ਜਾਇਜ਼ ਉਦੇਸ਼ ਉਹਨਾਂ ਨਵੀਆਂ URLs ਨੂੰ ਲੱਭਣਾ ਹੋ ਸਕਦਾ ਹੈ ਜੋ ਅਜੇ ਤੱਕ sitemap ਵਿੱਚ ਸੂਚੀਬੱਧ ਨਹੀਂ ਹਨ। ਉਹ ਚਿੰਤਾਵਾਂ ਜਾਇਜ਼ ਹਨ: ਇੱਕ ਦ੍ਰਿੜਤਾਵਾਨ ਹਮਲਾਵਰ DNS ਰਿਕਾਰਡ ਨਾਲ ਛੇੜਛਾੜ ਕਰ ਸਕਦਾ ਹੈ, ਅਤੇ ਨਵਾਂ ਕੰਟੈਂਟ ਅਗਲੇ ਜਨਰੇਸ਼ਨ ਚੱਕਰ ਤੱਕ ਮੌਜੂਦਾ sitemap ਵਿੱਚ ਕੁਦਰਤੀ ਤੌਰ 'ਤੇ ਗੈਰ-ਮੌਜੂਦ ਹੋਵੇਗਾ।
ਵਿਵਹਾਰਕ ਜਵਾਬ ਇਹ ਹੈ ਕਿ ਵੈਰੀਫਿਕੇਸ਼ਨ ਨੂੰ ਇੱਕ ਪੂਰਨ ਗੇਟ (absolute gate) ਦੀ ਬਜਾਏ ਇੱਕ ਕੌਨਫੀਡੈਂਸ ਸਕੋਰ (confidence score) ਵਜੋਂ ਲਿਆ ਜਾਵੇ। DNS ਵੈਰੀਫਿਕੇਸ਼ਨ, sitemap ਦੀ ਮੌਜੂਦਗੀ, ਅਤੇ ਰਿਕਵੈਸਟ-ਮੈਥਡ ਚੈੱਕਾਂ ਨੂੰ ਜੋੜੋ ਤਾਂ ਜੋ ਤੁਸੀਂ ਜਿਸ ਨੂੰ "ਅਸਲੀ AI ਟ੍ਰੈਫਿਕ" ਮੰਨਦੇ ਹੋ, ਉਸ ਦਾ ਮਿਆਰ ਵਧਾਇਆ ਜਾ ਸਕੇ। ਜੇਕਰ ਕੋਈ ਰਿਕਵੈਸਟ ਤਿੰਨ ਵਿੱਚੋਂ ਦੋ ਚੈੱਕ ਪਾਸ ਕਰਦੀ ਹੈ, ਤਾਂ ਇਸਨੂੰ ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਰੱਦ ਕਰਨ ਦੀ ਬਜਾਏ ਮੈਨੂਅਲ ਰਿਵਿਊ ਲਈ ਫਲੈਗ ਕਰੋ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
- Cloudflare ਦੇ verification API ਵਿੱਚ ਬਦਲਾਅ –
verifiedBotCategoryਲੌਜਿਕ ਵਿੱਚ ਕੋਈ ਵੀ ਤਬਦੀਲੀ ਵੈਰੀਫਿਕੇਸ਼ਨ ਦਰਾਂ ਨੂੰ ਬਦਲ ਸਕਦੀ ਹੈ। - ਨਵੇਂ ਸਵੈ-ਪਛਾਣੇ ਗਏ ਬੋਟਸ ਦਾ ਉਭਾਰ – ਆਪਣੇ ਲੌਗਸ ਵਿੱਚ ਦਿਖਾਈ ਦੇਣ ਵਾਲੀਆਂ User-Agent ਸਟ੍ਰਿੰਗਾਂ 'ਤੇ ਨਜ਼ਰ ਰੱਖੋ; ਅਚਾਨਕ ਵਾਧਾ ਇੱਕ ਨਵੇਂ ਸਕੈਨਰ ਦਾ ਸੰਕੇਤ ਹੋ ਸਕਦਾ ਹੈ ਜੋ AI ਕ੍ਰੌਲਰ ਦਾ ਰੂਪ ਧਾਰ ਰਿਹਾ ਹੋਵੇ।
- Sitemap ਬਣਾਉਣ ਦੀ ਬਾਰੰਬਾਰਤਾ – ਲੰਬੇ ਅੰਤਰ ਇਸ ਗੱਲ ਦੀ ਸੰਭਾਵਨਾ ਵਧਾਉਂਦੇ ਹਨ ਕਿ ਜਾਇਜ਼ ਕ੍ਰੌਲਰਾਂ ਨੂੰ ਗਲਤ ਤਰੀਕੇ ਨਾਲ ਕਲਾਸੀਫਾਈ ਕੀਤਾ ਜਾ ਸਕਦਾ ਹੈ।
ਸਿੱਟਾ ਸਧਾਰਨ ਹੈ: User-Agent ਸਟ੍ਰਿੰਗ ਨੂੰ ਸਬੂਤ ਵਜੋਂ ਮੰਨਣਾ ਬੰਦ ਕਰੋ। DNS ਵੈਰੀਫਿਕੇਸ਼ਨ ਅਤੇ sitemap ਵੈਲੀਡੇਸ਼ਨ ਦੀਆਂ ਪਰਤਾਂ ਲਗਾਓ, ਅਤੇ ਤੁਸੀਂ ਦੇਖੋਗੇ ਕਿ ਅਸਲ ਵਿੱਚ ਤੁਹਾਡਾ ਕੰਟੈਂਟ ਕੌਣ ਪੜ੍ਹ ਰਿਹਾ ਹੈ।
ਸਰੋਤ: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo
