AI tarayıcıları trafik sayılarınızı şişiriyor ve alışılagelmiş kısa yol olan User-Agent başlığını kontrol etmek bunu yakalamaya yetmiyor.

Yakın zamanda yapılan sekiz günlük bir log taraması, 468 gerçek makale erişiminin yanı sıra, aslında .env veya .git gibi dosyaları araştıran ancak AI botu gibi davranan 991 istek ortaya çıkardı. Suçlu mu? Herkes bir HTTP isteğine GPTBot veya ChatGPT-User gibi kendi beyan ettiği bir User-Agent dizisi ekleyebilir.

Metrik neden önemli

Web siteleri, "AI trafiğindeki" artışı bir alaka düzeyi göstergesi olarak kabul eder. Bu sayıları reklam oranlarını gerekçelendirmek, sunucu kaynaklarını tahsis etmek ve yatırımcılara gururla anlatmak için kullanırlar. Rapor edilen AI etkileşimlerinin yarısı sadece gürültüden ibaret olduğunda, bütçeler boşa gider ve paneller yanıltıcı hale gelir.

İddia ile gerçekliği ayıran iki filtre

  1. Cloudflare’in verifiedBotCategory alanı – Cloudflare bu alanı, yalnızca isteğin IP adresini ters DNS (reverse DNS) yoluyla bilinen bir bot alan adıyla eşleştirebildiğinde doldurur. Eğer başlıkta "GPTBot" yazıyor ancak IP sorgulaması başarısız oluyorsa, istek "doğrulanmamış" kategorisine düşer.
  2. Site haritası (Sitemap) çapraz kontrolü – Bir bot, içeriğinizi ancak talep edilen URL XML site haritanızda göründüğünde gerçekten okuyor demektir. Site haritasında bulunmayan yollara yapılan istekler, makaleleri dizine eklemekten ziyade muhtemelen güvenlik açıklarını araştırıyordur.

Her iki filtre de aynı sekiz günlük örnekleme uygulandığında çarpıcı rakamlar ortaya çıkardı:

  • ChatGPT-User – İsteklerin %39'u doğrulamadan geçti.
  • GPTBot – %13 doğrulandı.
  • PerplexityBot – %0 doğrulandı.
  • Google-Extended – %0 doğrulandı; bu dizgi herhangi bir resmi Google tarayıcısıyla eşleşmiyor.

Doğrulanmış çağrılar arasında bile birçok bot, sizin önem verdiğiniz makale sayfalarını değil, yalnızca robots.txt dosyasını veya site haritasının kendisini çekti.

Geliştiriciler bugün ne yapabilir

  • Analitik iş akışınızda Cloudflare bot doğrulamasını etkinleştirin. verifiedBotCategory alanı istek başlıklarında görünür ve kendi loglarınızla birlikte saklanabilir.
  • Güncel bir site haritası tutun ve her gelen isteğin yolunun, onu bir içerik görüntülemesi olarak saymadan önce orada olup olmadığını kontrol eden bir süreci otomatize edin.
  • GET dışındaki yöntemleri ve tipik geliştirme dosyalarını (.env, .git, .bak) hedefleyen istekleri filtreleyin. Bunlar neredeyse her zaman kötü niyetli taramalardır.

Karşı görüş

Bazıları, ters DNS kontrollerinin taklit edilebileceğini (spoofing) ve bir botun meşru amacının henüz site haritasında listelenmemiş yeni URL'leri keşfetmek olabileceğini savunuyor. Bu endişeler haklıdır: Kararlı bir saldırgan bir DNS kaydını ele geçirebilir ve yeni içerikler, bir sonraki oluşturma döngüsüne kadar doğal olarak mevcut site haritasında yer almayacaktır.

Pragmatik yaklaşım, doğrulamayı mutlak bir engel yerine bir güven puanı olarak değerlendirmektir. "Gerçek AI trafiği" olarak saydığınız şeyin çıtasını yükseltmek için DNS doğrulaması, site haritası varlığı ve istek yöntemi kontrollerini birleştirin. Eğer bir istek üç kontrolden ikisini geçiyorsa, onu doğrudan reddetmek yerine manuel inceleme için işaretleyin.

Bir sonraki adımda neye dikkat edilmeli

  • Cloudflare'in doğrulama API'sindeki değişikliklerverifiedBotCategory mantığındaki herhangi bir değişiklik doğrulama oranlarını değiştirebilir.
  • Yeni kendini tanımlayan botların ortaya çıkışı – Loglarınızda görünen User-Agent dizgelerini takip edin; ani bir artış, bir AI tarayıcısı kılığına girmiş yeni bir tarayıcıya işaret edebilir.
  • Site haritası oluşturma sıklığı – Daha uzun aralıklar, meşru tarayıcıların yanlış sınıflandırılma olasılığını artırır.

Çıkarılması gereken ders basit: Bir User-Agent dizgisini kanıt olarak görmeyi bırakın. DNS doğrulaması ve site haritası doğrulamasını katmanlandırın; böylece içeriğinizi gerçekte kimin okuduğuna dair daha net bir tablo göreceksiniz.

Kaynak: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo