AI-Crawler blähen Ihre Traffic-Zahlen auf, und die übliche Abkürzung – das Überprüfen des User-Agent-Headers – erkennt dies nicht.
Eine aktuelle, acht Tage umfassende Log-Analyse deckte 468 echte Artikelabrufe auf, aber auch 991 Anfragen, die vorgaben, AI-Bots zu sein, während sie in Wirklichkeit nach Dateien wie .env oder .git suchten. Der Übeltäter? Jeder kann einen selbst deklarierten User-Agent-String wie GPTBot oder ChatGPT-User in eine HTTP-Anfrage einfügen.
Warum diese Kennzahl wichtig ist
Websites interpretieren einen Anstieg des „AI-Traffics“ als Zeichen von Relevanz. Sie nutzen diese Zahlen, um Werbetarife zu rechtfertigen, Serverressourcen zuzuweisen und gegenüber Investoren anzugeben. Wenn die Hälfte der gemeldeten AI-Zugriffe lediglich Rauschen ist, werden Budgets verschwendet und Dashboards werden irreführend.
Die zwei Filter, die Anspruch von der Realität trennen
- Cloudflares
verifiedBotCategory– Cloudflare füllt dieses Feld erst aus, wenn die IP der Anfrage via Reverse DNS einer bekannten Bot-Domain zugeordnet werden kann. Wenn der Header „GPTBot“ sagt, die IP-Suche jedoch fehlschlägt, landet die Anfrage in der Kategorie „unverified“. - Sitemap-Abgleich – Ein Bot liest Ihre Inhalte erst dann wirklich, wenn die angeforderte URL in Ihrer XML-Sitemap erscheint. Anfragen für Pfade, die nicht in der Sitemap enthalten sind, suchen wahrscheinlich eher nach Schwachstellen als nach der Indizierung von Artikeln.
Die Anwendung beider Filter auf dieselbe acht Tage umfassende Stichprobe ergab deutliche Zahlen:
- ChatGPT-User – 39 % der Anfragen bestanden die Verifizierung.
- GPTBot – 13 % verifiziert.
- PerplexityBot – 0 % verifiziert.
- Google-Extended – 0 % verifiziert; der String entspricht keinem offiziellen Google-Crawler.
Selbst bei den verifizierten Aufrufen riefen viele Bots nur robots.txt oder die Sitemap selbst ab, nicht aber die Artikelseiten, die für Sie von Bedeutung sind.
Was Entwickler heute tun können
- Aktivieren Sie die Cloudflare-Bot-Verifizierung in Ihrer Analytics-Pipeline. Das Feld
verifiedBotCategoryerscheint in den Request-Headern und kann zusammen mit Ihren eigenen Logs gespeichert werden. - Pflegen Sie eine aktuelle Sitemap und automatisieren Sie eine Prüfung, ob der Pfad jeder eingehenden Anfrage dort existiert, bevor Sie ihn als Seitenaufruf zählen.
- Filtern Sie Nicht-GET-Methoden heraus sowie Anfragen, die auf typische Entwicklungsdateien (
.env,.git,.bak) abzielen. Dabei handelt es sich fast immer um böswillige Scans.
Der Gegenpunkt
Einige argumentieren, dass Reverse-DNS-Prüfungen gefälscht werden können und dass der legitime Zweck eines Bots darin bestehen kann, neue URLs zu entdecken, die noch nicht in der Sitemap aufgeführt sind. Diese Bedenken sind berechtigt: Ein entschlossener Angreifer könnte einen DNS-Eintrag manipulieren, und neue Inhalte werden naturgemäß bis zum nächsten Generierungszyklus nicht in der aktuellen Sitemap vorhanden sein.
Die pragmatische Antwort besteht darin, die Verifizierung eher als Konfidenzwert denn als absolutes Ausschlusskriterium zu betrachten. Kombinieren Sie DNS-Verifizierung, das Vorhandensein in der Sitemap und Prüfungen der Request-Methode, um die Hürde für das, was Sie als „echten AI-Traffic“ zählen, zu erhöhen. Wenn eine Anfrage zwei von drei Prüfungen besteht, markieren Sie sie für eine manuelle Überprüfung, anstatt sie sofort zu verwerfen.
Worauf Sie als Nächstes achten sollten
- Änderungen an der Cloudflare-Verifizierungs-API – jede Änderung an der
verifiedBotCategory-Logik könnte die Verifizierungsraten verschieben. - Auftauchen neuer, selbstidentifizierter Bots – achten Sie auf die User-Agent-Strings, die in Ihren Logs erscheinen; ein plötzlicher Anstieg kann auf einen neuen Scanner hindeuten, der sich als AI-Crawler tarnt.
- Häufigkeit der Sitemap-Generierung – längere Intervalle erhöhen die Wahrscheinlichkeit, dass legitime Crawler falsch klassifiziert werden.
Das Fazit ist einfach: Hören Sie auf, einen User-Agent-String als Beweis zu betrachten. Schichten Sie DNS-Verifizierung und Sitemap-Validierung übereinander, und Sie werden ein klareres Bild davon erhalten, wer tatsächlich Ihre Inhalte liest.
Source: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo
