Les robots d'IA gonflent vos chiffres de trafic, et le raccourci habituel — vérifier l'en-tête User-Agent — ne permet pas de les détecter.
Un récent balayage des journaux sur huit jours a révélé 468 récupérations d'articles authentiques, mais 991 requêtes qui prétendaient être des bots d'IA alors qu'elles cherchaient en réalité des fichiers comme .env ou .git. Le coupable ? N'importe qui peut insérer une chaîne User-Agent auto-déclarée telle que GPTBot ou ChatGPT-User dans une requête HTTP.
Pourquoi cette métrique est importante
Les sites web considèrent une augmentation du « trafic IA » comme un signe de pertinence. Ils utilisent ces chiffres pour justifier les tarifs publicitaires, allouer les ressources serveur et se vanter auprès des investisseurs. Lorsque la moitié des visites IA signalées ne sont que du bruit, les budgets s'égarent et les tableaux de bord deviennent trompeurs.
Les deux filtres qui séparent l'affirmation de la réalité
- Le
verifiedBotCategoryde Cloudflare – Cloudflare ne remplit ce champ qu'après avoir résolu l'IP de la requête vers un domaine de bot connu via un DNS inversé. Si l'en-tête indique « GPTBot » mais que l'IP échoue à la recherche, la requête finit dans la catégorie « non vérifié ». - La vérification croisée avec le sitemap – Un bot ne lit réellement votre contenu que lorsque l'URL demandée apparaît dans votre sitemap XML. Les requêtes pour des chemins absents du sitemap cherchent probablement des vulnérabilités plutôt qu'à indexer des articles.
L'application des deux filtres au même échantillon de huit jours a produit des chiffres frappants :
- ChatGPT-User – 39 % des requêtes ont passé la vérification.
- GPTBot – 13 % vérifiés.
- PerplexityBot – 0 % vérifiés.
- Google-Extended – 0 % vérifiés ; la chaîne ne correspond à aucun crawler officiel de Google.
Même parmi les appels vérifiés, de nombreux bots n'ont récupéré que robots.txt ou le sitemap lui-même, et non les pages d'articles qui vous intéressent.
Ce que les développeurs peuvent faire dès aujourd'hui
- Activer la vérification des bots Cloudflare dans votre pipeline d'analyse. Le champ
verifiedBotCategoryapparaît dans les en-têtes de requête et peut être stocké aux côtés de vos propres journaux. - Maintenir un sitemap à jour et automatiser une vérification pour vous assurer que le chemin de chaque requête entrante existe bien dans celui-ci avant de la compter comme une vue de contenu.
- Filtrer les méthodes autres que GET et les requêtes ciblant des fichiers de développement typiques (
.env,.git,.bak). Il s'agit presque toujours de scans malveillants.
Le contre-argument
Certains soutiennent que les vérifications DNS inversées peuvent être usurpées et que l'objectif légitime d'un bot peut être de découvrir de nouvelles URL qui ne figurent pas encore dans le sitemap. Ces préoccupations sont valables : un attaquant déterminé pourrait compromettre un enregistrement DNS, et le nouveau contenu sera naturellement absent du sitemap actuel jusqu'au prochain cycle de génération.
La réponse pragmatique consiste à traiter la vérification comme un score de confiance plutôt que comme une barrière absolue. Combinez la vérification DNS, la présence dans le sitemap et les vérifications de la méthode de requête pour élever le niveau de ce que vous comptez comme « trafic IA réel ». Si une requête passe deux des trois tests, marquez-la pour une révision manuelle au lieu de la rejeter purement et simplement.
Ce qu'il faut surveiller ensuite
- Changements dans l'API de vérification de Cloudflare – toute modification de la logique
verifiedBotCategorypourrait modifier les taux de vérification. - Émergence de nouveaux bots auto-identifiés – surveillez les chaînes User-Agent qui apparaissent dans vos journaux ; un pic soudain peut indiquer un nouveau scanner se faisant passer pour un crawler d'IA.
- Fréquence de génération du sitemap – des intervalles plus longs augmentent le risque que des crawlers légitimes soient mal classés.
L'essentiel à retenir est simple : cessez de considérer une chaîne User-Agent comme une preuve. Superposez la vérification DNS et la validation du sitemap, et vous aurez une image plus claire de qui lit réellement votre contenu.
Source : https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo
