AI ಕ್ರಾಲರ್‌ಗಳು ನಿಮ್ಮ ಟ್ರಾಫಿಕ್ ಸಂಖ್ಯೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತಿವೆ, ಮತ್ತು ಸಾಮಾನ್ಯ ಶಾರ್ಟ್‌ಕಟ್—User-Agent ಹೆಡರ್ ಅನ್ನು ಪರಿಶೀಲಿಸುವುದು—ಇದನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಸಾಧ್ಯವಾಗುತ್ತಿಲ್ಲ.

ಇತ್ತೀಚಿನ ಎಂಟು ದಿನಗಳ ಲಾಗ್ ಪರಿಶೀಲನೆಯಲ್ಲಿ 468 ನೈಜ ಲೇಖನಗಳ ಫೆಚ್‌ಗಳು (fetches) ಕಂಡುಬಂದವು, ಆದರೆ 991 ವಿನಂತಿಗಳು AI ಬಾಟ್‌ಗಳಂತೆ ನಟಿಸುತ್ತಿದ್ದವು, ವಾಸ್ತವದಲ್ಲಿ ಅವು .env ಅಥವಾ .git ನಂತಹ ಫೈಲ್‌ಗಳಿಗಾಗಿ ಹುಡುಕಾಟ ನಡೆಸುತ್ತಿದ್ದವು. ಇದಕ್ಕೆ ಕಾರಣವೇನು? ಯಾರೇ ಆದರೂ HTTP ವಿನಂತಿಯಲ್ಲಿ GPTBot ಅಥವಾ ChatGPT-User ನಂತಹ ಸ್ವಯಂ-ಘೋಷಿತ User-Agent ಸ್ಟ್ರಿಂಗ್ ಅನ್ನು ಸೇರಿಸಬಹುದು.

ಈ ಮೆಟ್ರಿಕ್ ಏಕೆ ಮುಖ್ಯವಾಗುತ್ತದೆ

ವೆಬ್‌ಸೈಟ್‌ಗಳು "AI ಟ್ರಾಫಿಕ್" ಹೆಚ್ಚಳವನ್ನು ಪ್ರಸ್ತುತತೆಯ ಸಂಕೇತವೆಂದು ಪರಿಗಣಿಸುತ್ತವೆ. ಅವರು ಜಾಹೀರಾತು ದರಗಳನ್ನು ಸಮರ್ಥಿಸಲು, ಸರ್ವರ್ ಸಂಪನ್ಮೂಲಗಳನ್ನು ಹಂಚಿಕೆ ಮಾಡಲು ಮತ್ತು ಹೂಡಿಕೆದಾರರಿಗೆ ಹೆಮ್ಮೆಯಿಂದ ಹೇಳಿಕೊಳ್ಳಲು ಈ ಸಂಖ್ಯೆಗಳನ್ನು ಬಳಸುತ್ತಾರೆ. ವರದಿಯಾದ AI ವಿನಂತಿಗಳಲ್ಲಿ ಅರ್ಧದಷ್ಟು ಕೇವಲ ಶಬ್ದಮಾತ್ರೆಯಾಗಿದ್ದಾಗ (noise), ಬಜೆಟ್‌ಗಳು ವ್ಯರ್ಥವಾಗುತ್ತವೆ ಮತ್ತು ಡ್ಯಾಶ್‌ಬೋರ್ಡ್‌ಗಳು ದಾರಿತಪ್ಪಿಸುವಂತಾಗುತ್ತವೆ.

ವಾದ ಮತ್ತು ವಾಸ್ತವವನ್ನು ಪ್ರತ್ಯೇಕಿಸುವ ಎರಡು ಫಿಲ್ಟರ್‌ಗಳು

  1. Cloudflare ನ verifiedBotCategory – ರಿವರ್ಸ್ DNS ಮೂಲಕ ವಿನಂತಿಯ IP ಅನ್ನು ತಿಳಿದಿರುವ ಬಾಟ್ ಡೊಮೇನ್‌ಗೆ ಗುರುತಿಸಿದ ನಂತರವೇ Cloudflare ಈ ಫೀಲ್ಡ್ ಅನ್ನು ತುಂಬುತ್ತದೆ. ಹೆಡರ್ "GPTBot" ಎಂದು ಹೇಳಿದ್ದರೂ, IP ನೋಟアップ (lookup) ವಿಫಲವಾದರೆ, ಆ ವಿನಂತಿಯು "unverified" ವಿಭಾಗಕ್ಕೆ ಸೇರುತ್ತದೆ.
  2. Sitemap ಕ್ರಾಸ್-ಚೆಕ್ – ವಿನಂತಿಸಿದ URL ನಿಮ್ಮ XML sitemap ನಲ್ಲಿ ಕಂಡುಬಂದಾಗ ಮಾತ್ರ ಬಾಟ್ ನಿಜವಾಗಿಯೂ ನಿಮ್ಮ ವಿಷಯವನ್ನು ಓದುತ್ತದೆ. ಸೈಟ್‌ಮ್ಯಾಪ್‌ನಲ್ಲಿ ಇಲ್ಲದ ಪಾತ್‌ಗಳಿಗಾಗಿ ಬರುವ ವಿನಂತಿಗಳು ಲೇಖನಗಳನ್ನು ಇಂಡೆಕ್ಸ್ ಮಾಡುವ ಬದಲು ದೌರ್ಬಲ್ಯಗಳನ್ನು ಹುಡುಕುವ ಸಾಧ್ಯತೆ ಹೆಚ್ಚು.

ಒಂದೇ ಎಂಟು ದಿನಗಳ ಮಾದರಿಗೆ ಈ ಎರಡೂ ಫಿಲ್ಟರ್‌ಗಳನ್ನು ಅನ್ವಯಿಸಿದಾಗ ಕಟುವಾದ ಅಂಕಿಅಂಶಗಳು ಕಂಡುಬಂದವು:

  • ChatGPT-User – 39% ವಿನಂತಿಗಳು ದೃಢೀಕರಣವನ್ನು ಪಾಸು ಮಾಡಿದೆ.
  • GPTBot – 13% ದೃಢೀಕರಿಸಲ್ಪಟ್ಟಿದೆ.
  • PerplexityBot – 0% ದೃಢೀಕರಿಸಲ್ಪಟ್ಟಿದೆ.
  • Google-Extended – 0% ದೃಢೀಕರಿಸಲ್ಪಟ್ಟಿದೆ; ಈ ಸ್ಟ್ರಿಂಗ್ ಯಾವುದೇ ಅಧಿಕೃತ Google ಕ್ರಾಲರ್‌ಗೆ ಸಂಬಂಧಿಸಿಲ್ಲ.

ದೃಢೀಕರಿಸಲ್ಪಟ್ಟ ಕರೆಗಳ ನಡುವೆಯೂ, ಅನೇಕ ಬಾಟ್‌ಗಳು ಕೇವಲ robots.txt ಅಥವಾ ಸೈಟ್‌ಮ್ಯಾಪ್ ಅನ್ನು ಮಾತ್ರ ಫೆಚ್ ಮಾಡಿದವು, ನೀವು ಕಾಳಜಿ ವಹಿಸುವ ಲೇಖನದ ಪುಟಗಳನ್ನು ಅಲ್ಲ.

ಡೆವಲಪರ್‌ಗಳು ಇಂದು ಏನು ಮಾಡಬಹುದು

  • ನಿಮ್ಮ ಅನಾಲಿಟಿಕ್ಸ್ ಪೈಪ್‌ಲೈನ್‌ನಲ್ಲಿ Cloudflare ಬಾಟ್ ದೃಢೀಕರಣವನ್ನು (bot verification) ಸಕ್ರಿಯಗೊಳಿಸಿ. verifiedBotCategory ಫೀಲ್ಡ್ ವಿನಂತಿ ಹೆಡರ್‌ಗಳಲ್ಲಿ ಕಾಣಿಸಿಕೊಳ್ಳುತ್ತದೆ ಮತ್ತು ಅದನ್ನು ನಿಮ್ಮ ಸ್ವಂತ ಲಾಗ್‌ಗಳೊಂದಿಗೆ ಸಂಗ್ರಹಿಸಬಹುದು.
  • ಅಪ್-ಟು-ಡೇಟ್ ಸೈಟ್‌ಮ್ಯಾಪ್ ಅನ್ನು ನಿರ್ವಹಿಸಿ ಮತ್ತು ಪ್ರತಿಯೊಂದು ಒಳಬರುವ ವಿನಂತಿಯ ಪಾತ್ (path) ಅಲ್ಲಿ ಇದೆಯೇ ಎಂದು ಸ್ವಯಂಚಾಲಿತವಾಗಿ ಪರಿಶೀಲಿಸುವ ವ್ಯವಸ್ಥೆಯನ್ನು ಮಾಡಿ, ನಂತರವಷ್ಟೇ ಅದನ್ನು ಕಂಟೆಂಟ್ ವ್ಯೂ ಎಂದು ಪರಿಗಣಿಸಿ.
  • Non-GET ವಿಧಾನಗಳನ್ನು ಮತ್ತು ಸಾಮಾನ್ಯ ಡೆವಲಪ್‌ಮೆಂಟ್ ಫೈಲ್‌ಗಳನ್ನು (.env, .git, .bak) ಗುರಿಯಾಗಿಸಿಕೊಂಡ ವಿನಂತಿಗಳನ್ನು ಫಿಲ್ಟರ್ ಮಾಡಿ. ಅವುಗಳು ಬಹುತೇಕ ಯಾವಾಗಲೂ ದುರುದ್ದೇಶಪೂರಿತ ಸ್ಕ್ಯಾನ್‌ಗಳಾಗಿರುತ್ತವೆ.

ವಿರೋಧಾತ್ಮಕ ವಾದ

ರಿವರ್ಸ್ DNS ಪರಿசோதனೆಗಳನ್ನು ಸ್ಪೂಫ್ (spoof) ಮಾಡಬಹುದು ಮತ್ತು ಬಾಟ್‌ನ ಕಾನೂನುಬದ್ಧ ಉದ್ದೇಶವು ಸೈಟ್‌ಮ್ಯಾಪ್‌ನಲ್ಲಿ ಇನ್ನೂ ಪಟ್ಟಿ ಮಾಡದ ಹೊಸ URLಗಳನ್ನು ಕಂಡುಹಿಡಿಯುವುದಾಗಿ ಕೆಲವರು ವಾದಿಸುತ್ತಾರೆ. ಆ ಆತಂಕಗಳು ಸಮಂಜಸವಾಗಿವೆ: ಒಬ್ಬ ನಿರ್ಧರಿಸಿದ ದಾಳಿಗಾರನು DNS ರೆಕಾರ್ಡ್ ಅನ್ನು ಕಬಳಿಸಬಹುದು ಮತ್ತು ಮುಂದಿನ ಜನरेशन ಸೈಕಲ್‌ನವರೆಗೆ ಹೊಸ ವಿಷಯವು ಪ್ರಸ್ತುತ ಸೈಟ್‌ಮ್ಯಾಪ್‌ನಲ್ಲಿ ಇರುವುದಿಲ್ಲ.

ಇದಕ್ಕೆ ಪ್ರಾಯೋಗಿಕ ಪ್ರತಿಕ್ರಿಯೆಯೆಂದರೆ, ದೃಢೀಕರಣವನ್ನು ಸಂಪೂರ್ಣ ನಿರ್ಣಯಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ ಒಂದು ಕಾನ್ಫಿಡೆನ್ಸ್ ಸ್ಕೋರ್ (confidence score) ಎಂದು ಪರಿಗಣಿಸುವುದು. "ನೈಜ AI ಟ್ರಾಫಿಕ್" ಎಂದು ನೀವು ಪರಿಗಣಿಸುವ ಮಾನದಂಡವನ್ನು ಹೆಚ್ಚಿಸಲು DNS ದೃಢೀಕರಣ, ಸೈಟ್‌ಮ್ಯಾಪ್ ಉಪಸ್ಥಿತಿ ಮತ್ತು ವಿನಂತಿ-ವಿಧಾನ (request-method) ಪರಿசோதனೆಗಳನ್ನು ಸಂಯೋಜಿಸಿ. ಒಂದು ವಿನಂತಿಯು ಮೂರು ಪರಿசோதனೆಗಳಲ್ಲಿ ಎರಡನ್ನು ಪಾಸು ಮಾಡಿದರೆ, ಅದನ್ನು ನೇರವಾಗಿ ತಿರಸ್ಕರಿಸುವ ಬದಲು ಮ್ಯಾನುಯಲ್ ರಿವ್ಯೂಗಾಗಿ (manual review) ಗುರುತಿಸಿ.

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

  • Cloudflare ನ ದೃಢೀಕರಣ API ನಲ್ಲಿನ ಬದಲಾವಣೆಗಳುverifiedBotCategory ಲಾಜಿಕ್‌ನಲ್ಲಿ ಯಾವುದೇ ಬದಲಾವಣೆಯು ದೃಢೀಕರಣ ದರಗಳನ್ನು ಬದಲಿಸಬಹುದು.
  • ಹೊಸ ಸ್ವಯಂ-ಗುರುತಿಸಲ್ಪಟ್ಟ ಬಾಟ್‌ಗಳ ಉಗಮ – ನಿಮ್ಮ ಲಾಗ್‌ಗಳಲ್ಲಿ ಕಾಣಿಸಿಕೊಳ್ಳುವ User-Agent ಸ್ಟ್ರಿಂಗ್‌ಗಳನ್ನು ಗಮನಿಸಿ; ಹಠಾತ್ ಏರಿಕೆಯು AI ಕ್ರಾಲರ್ ಆಗಿ ನಟಿಸುತ್ತಿರುವ ಹೊಸ ಸ್ಕ್ಯಾನರ್ ಅನ್ನು ಸೂಚಿಸಬಹುದು.
  • Sitemap ಜನರೇಟ್ ಮಾಡುವ ಆವರ್ತನ – ಹೆಚ್ಚಿನ ಸಮಯದ ಅಂತರವು ಕಾನೂನುಬದ್ಧ ಕ್ರಾಲರ್‌ಗಳು ತಪ್ಪಾಗಿ ವರ್ಗೀಕರಿಸಲ್ಪಡುವ ಸಾಧ್ಯತೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ.

ಸರಳವಾದ ತೀರ್ಮಾನವೇನೆಂದರೆ: User-Agent ಸ್ಟ್ರಿಂಗ್ ಅನ್ನು ಪುರಾವೆಯೆಂದು ಪರಿಗಣಿಸುವುದನ್ನು ನಿಲ್ಲಿಸಿ. DNS ದೃಢೀಕರಣ ಮತ್ತು ಸೈಟ್‌ಮ್ಯಾಪ್ ವ್ಯಾಲಿಡೇಶನ್ ಅನ್ನು ಬಳಸಿಕೊಳ್ಳಿ, ಆಗ ಯಾರು ನಿಜವಾಗಿಯೂ ನಿಮ್ಮ ವಿಷಯವನ್ನು ಓದುತ್ತಿದ್ದಾರೆ ಎಂಬ ಸ್ಪಷ್ಟ ಚಿತ್ರಣ ನಿಮಗೆ ಸಿಗುತ್ತದೆ.

Source: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo