ШІ-краулери завищують показники вашого трафіку, а звичний швидкий спосіб — перевірка заголовка User-Agent — не допомагає це виявити.

Нещодавній восьмиденний аналіз логів виявив 468 справжніх запитів на отримання статей, але 991 запит, який вдавав з себе ШІ-бота, хоча насправді шукав такі файли, як .env або .git. У чому причина? Будь-хто може вставити самопроголошений рядок User-Agent, наприклад GPTBot або ChatGPT-User, у HTTP-запит.

Чому цей показник важливий

Вебсайти сприймають сплеск «ШІ-трафіку» як ознаку релевантності. Вони використовують ці цифри, щоб обґрунтувати ціни на рекламу, розподілити серверні ресурси та похизуватися перед інвесторами. Коли половина зареєстрованих ШІ-запитів є лише шумом, бюджети витрачаються марно, а дашборди стають оманливими.

Два фільтри, що відділяють твердження від реальності

  1. verifiedBotCategory від Cloudflare — Cloudflare заповнює це поле лише після того, як за допомогою зворотного DNS зіставить IP-адресу запиту з відомим доменом бота. Якщо заголовок каже «GPTBot», але IP-адреса не проходить перевірку, запит потрапляє в категорію «непідтверджених».
  2. Перевірка через sitemap — бот дійсно читає ваш контент лише тоді, коли запитуваний URL з’являється у вашому XML sitemap. Запити на шляхи, відсутні в sitemap, швидше за все, є спробами пошуку вразливостей, а не індексацією статей.

Застосування обох фільтрів до одного й того самого восьмиденного зразка дало вражаючі цифри:

  • ChatGPT-User — лише 39% запитів пройшли перевірку.
  • GPTBot — 13% підтверджених.
  • PerplexityBot — 0% підтверджених.
  • Google-Extended — 0% підтверджених; цей рядок не відповідає жодному офіційному краулеру Google.

Навіть серед підтверджених викликів багато ботів завантажували лише robots.txt або сам sitemap, а не сторінки статей, які вас цікавлять.

Що розробники можуть зробити вже сьогодні

  • Увімкніть перевірку ботів Cloudflare у вашому конвеєрі аналітики. Поле verifiedBotCategory з’являється в заголовках запитів і може зберігатися разом із вашими логами.
  • Підтримуйте актуальний sitemap і автоматизуйте перевірку: чи існує шлях кожного вхідного запиту в ньому, перш ніж зараховувати його як перегляд контенту.
  • Фільтруйте методи, що не є GET, та запити, спрямовані на типові файли розробки (.env, .git, .bak). Це майже завжди шкідливе сканування.

Контраргумент

Дехто стверджує, що перевірки зворотного DNS можна підробити, а легітимною метою бота може бути пошук нових URL-адрес, які ще не внесені до sitemap. Ці побоювання є обґрунтованими: наполегливий зловмисник може скомпрометувати DNS-запис, а новий контент природно буде відсутній у поточному sitemap до наступного циклу його оновлення.

Прагматична відповідь полягає в тому, щоб розглядати перевірку як показник впевненості, а не як абсолютний бар'єр. Поєднуйте перевірку DNS, наявність у sitemap та перевірку методів запиту, щоб підвищити планку того, що ви вважаєте «справжнім ШІ-трафіком». Якщо запит проходить дві з трьох перевірок, позначте його для ручного перегляду замість того, щоб відкидати одразу.

За чим варто стежити далі

  • Зміни в API перевірки Cloudflare — будь-яка зміна в логіці verifiedBotCategory може змінити рівень підтвердження.
  • Поява нових ботів із самоідентифікацією — стежте за рядками User-Agent, що з’являються у ваших логах; раптовий сплеск може вказувати на новий сканер, що маскується під ШІ-краулер.
  • Частота генерації sitemap — тривалі інтервали збільшують шанс того, що легітимні краулери будуть класифіковані неправильно.

Висновок простий: припиніть сприймати рядок User-Agent як доказ. Використовуйте багаторівневу перевірку через DNS та sitemap, і ви побачите чітку картину того, хто насправді читає ваш контент.

Source: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo