Các trình thu thập dữ liệu AI đang làm thổi phồng số liệu lưu lượng truy cập của bạn, và cách tắt thường dùng—kiểm tra header User-Agent—không thể phát hiện được điều này.

Một đợt quét nhật ký (log) trong tám ngày gần đây đã phát hiện ra 468 lượt lấy bài viết thực tế nhưng có tới 991 yêu cầu giả danh bot AI trong khi thực chất là đang dò tìm các tệp như .env hoặc .git. Thủ phạm là gì? Bất kỳ ai cũng có thể chèn một chuỗi User-Agent tự khai báo như GPTBot hoặc ChatGPT-User vào một yêu cầu HTTP.

Tại sao chỉ số này lại quan trọng

Các trang web coi sự gia tăng "lưu lượng AI" là dấu hiệu của sự liên quan. Họ sử dụng những con số này để biện minh cho giá quảng cáo, phân bổ tài nguyên máy chủ và khoe khoang với các nhà đầu tư. Khi một nửa số lượt truy cập AI được báo cáo chỉ là nhiễu, ngân sách sẽ bị sử dụng sai mục đích và các bảng điều khiển (dashboard) sẽ trở nên sai lệch.

Hai bộ lọc phân biệt giữa tuyên bố và thực tế

  1. verifiedBotCategory của Cloudflare – Cloudflare chỉ điền trường này sau khi nó phân giải IP của yêu cầu về một tên miền bot đã biết thông qua reverse DNS. Nếu header ghi là "GPTBot" nhưng IP không vượt qua được bước tra cứu, yêu cầu đó sẽ rơi vào nhóm "chưa được xác minh" (unverified).
  2. Kiểm tra chéo sitemap – Một bot thực sự đọc nội dung của bạn chỉ khi URL được yêu cầu xuất hiện trong sitemap XML của bạn. Các yêu cầu cho các đường dẫn không có trong sitemap thường là để dò tìm lỗ hổng thay vì lập chỉ mục các bài viết.

Áp dụng cả hai bộ lọc cho cùng một mẫu dữ liệu trong tám ngày đã cho thấy những con số đáng kinh ngạc:

  • ChatGPT-User – 39% yêu cầu vượt qua xác minh.
  • GPTBot – 13% được xác minh.
  • PerplexityBot – 0% được xác minh.
  • Google-Extended – 0% được xác minh; chuỗi này không tương ứng với bất kỳ trình thu thập dữ liệu chính thức nào của Google.

Ngay cả trong số các lượt gọi đã được xác minh, nhiều bot chỉ lấy robots.txt hoặc chính sitemap, chứ không phải các trang bài viết mà bạn quan tâm.

Những gì nhà phát triển có thể làm ngay hôm nay

  • Kích hoạt xác minh bot của Cloudflare trong quy trình phân tích của bạn. Trường verifiedBotCategory sẽ xuất hiện trong các header của yêu cầu và có thể được lưu trữ cùng với nhật ký của chính bạn.
  • Duy trì một sitemap luôn được cập nhật và tự động hóa việc kiểm tra xem đường dẫn của mọi yêu cầu đến có tồn tại trong đó hay không trước khi bạn tính đó là một lượt xem nội dung.
  • Lọc bỏ các phương thức không phải GET và các yêu cầu nhắm vào các tệp phát triển điển hình (.env, .git, .bak). Đó hầu như luôn là các cuộc quét độc hại.

Quan điểm phản biện

Một số người lập luận rằng việc kiểm tra reverse DNS có thể bị giả mạo, và mục đích hợp pháp của một bot có thể là để khám phá các URL mới chưa được liệt kê trong sitemap. Những lo ngại đó là có cơ sở: một kẻ tấn công quyết tâm có thể chiếm quyền kiểm soát bản ghi DNS, và nội dung mới sẽ đương nhiên vắng mặt trong sitemap hiện tại cho đến chu kỳ tạo tiếp theo.

Cách tiếp cận thực tế là coi việc xác minh như một điểm số tin cậy thay vì một rào cản tuyệt đối. Hãy kết hợp xác minh DNS, sự hiện diện trong sitemap và kiểm tra phương thức yêu cầu để nâng cao tiêu chuẩn cho những gì bạn tính là "lưu lượng AI thực". Nếu một yêu cầu vượt qua hai trong ba bước kiểm tra, hãy đánh dấu nó để xem xét thủ công thay vì loại bỏ ngay lập tức.

Những gì cần theo dõi tiếp theo

  • Những thay đổi đối với API xác minh của Cloudflare – bất kỳ sự thay đổi nào đối với logic của verifiedBotCategory đều có thể làm thay đổi tỷ lệ xác minh.
  • Sự xuất hiện của các bot mới tự định danh – hãy chú ý đến các chuỗi User-Agent xuất hiện trong nhật ký của bạn; một sự gia tăng đột ngột có thể cho thấy một trình quét mới đang giả danh trình thu thập dữ liệu AI.
  • Tần suất tạo sitemap – các khoảng thời gian dài hơn sẽ làm tăng khả năng các trình thu thập dữ liệu hợp lệ bị phân loại sai.

Bài học rút ra rất đơn giản: hãy ngừng coi một chuỗi User-Agent là bằng chứng. Hãy kết hợp xác minh DNS và xác thực sitemap, bạn sẽ thấy một bức tranh rõ ràng hơn về việc ai thực sự đang đọc nội dung của mình.

Source: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo