Crawler AI sedang melambungkan angka trafik anda, dan jalan pintas biasa—menyemak pengepala User-Agent—tidak dapat mengesannya.
Imbasan log selama lapan hari baru-baru ini mendedahkan 468 pengambilan artikel tulen tetapi 991 permintaan yang menyamar sebagai bot AI sedangkan ia sebenarnya sedang menyiasat fail seperti .env atau .git. Puncanya? Sesiapa sahaja boleh memasukkan rentetan User-Agent yang diisytiharkan sendiri seperti GPTBot atau ChatGPT-User ke dalam permintaan HTTP.
Mengapa metrik ini penting
Laman web menganggap lonjakan "trafik AI" sebagai tanda relevansi. Mereka menggunakan angka tersebut untuk mewajarkan kadar iklan, memperuntukkan sumber pelayan, dan bermegah kepada pelabur. Apabila separuh daripada hit AI yang dilaporkan hanyalah gangguan, bajet akan tersasar dan papan pemuka menjadi mengelirukan.
Dua penapis yang membezakan dakwaan daripada realiti
verifiedBotCategoryCloudflare – Cloudflare mengisi medan ini hanya selepas ia menyelesaikan IP permintaan kembali ke domain bot yang diketahui melalui reverse DNS. Jika pengepala menyatakan “GPTBot” tetapi IP gagal dalam pencarian, permintaan tersebut akan masuk ke dalam kategori “tidak disahkan” (unverified).- Semakan silang sitemap – Bot benar-benar membaca kandungan anda hanya apabila URL yang diminta muncul dalam sitemap XML anda. Permintaan untuk laluan yang tiada dalam sitemap berkemungkinan besar sedang mencari kerentanan dan bukannya mengindeks artikel.
Mengaplikasikan kedua-dua penapis kepada sampel lapan hari yang sama menghasilkan angka yang ketara:
- ChatGPT-User – 39% permintaan melepasi pengesahan.
- GPTBot – 13% disahkan.
- PerplexityBot – 0% disahkan.
- Google-Extended – 0% disahkan; rentetan tersebut tidak sepadan dengan mana-mana crawler rasmi Google.
Malah dalam kalangan panggilan yang disahkan, banyak bot hanya mengambil robots.txt atau sitemap itu sendiri, bukannya halaman artikel yang anda pentingkan.
Apa yang pembangun boleh lakukan hari ini
- Aktifkan pengesahan bot Cloudflare dalam saluran analitik anda. Medan
verifiedBotCategorymuncul dalam pengepala permintaan dan boleh disimpan bersama log anda sendiri. - Sentiasa kemas kini sitemap dan automatikkan semakan bahawa setiap laluan permintaan yang masuk wujud di sana sebelum anda mengiranya sebagai paparan kandungan.
- Tapis kaedah bukan-GET dan permintaan yang menyasarkan fail pembangunan tipikal (
.env,.git,.bak). Itu hampir sentiasa merupakan imbasan berniat jahat.
Hujah balas
Sesetengah pihak berhujah bahawa semakan reverse DNS boleh dipalsukan, dan tujuan sah sesuatu bot mungkin untuk menemui URL baharu yang belum disenaraikan dalam sitemap. Kebimbangan tersebut adalah berasas: penyerang yang nekad boleh menceroboh rekod DNS, dan kandungan baharu secara semula jadi akan tiada dalam sitemap semasa sehingga kitaran penjanaan seterusnya.
Respons pragmatik adalah dengan menganggap pengesahan sebagai skor keyakinan dan bukannya pintu penapis mutlak. Gabungkan pengesahan DNS, kehadiran sitemap, dan semakan kaedah permintaan untuk meningkatkan piawaian bagi apa yang anda kira sebagai "trafik AI sebenar." Jika sesuatu permintaan melepasi dua daripada tiga semakan, tandakan ia untuk semakan manual dan bukannya membuangnya terus.
Apa yang perlu diperhatikan seterusnya
- Perubahan pada API pengesahan Cloudflare – sebarang pengubahan pada logik
verifiedBotCategoryboleh mengubah kadar pengesahan. - Kemunculan bot baharu yang mengenal pasti diri sendiri – perhatikan rentetan User-Agent yang muncul dalam log anda; lonjakan mendadak mungkin menunjukkan pengimbas baharu yang menyamar sebagai crawler AI.
- Kekerapan penjanaan sitemap – selang masa yang lebih lama meningkatkan kemungkinan crawler yang sah akan salah dikelaskan.
Kesimpulannya mudah: berhenti menganggap rentetan User-Agent sebagai bukti. Lapiskan pengesahan DNS dan pengesahan sitemap, dan anda akan melihat gambaran yang lebih jelas tentang siapa yang sebenarnya membaca kandungan anda.
Sumber: https://dev.to/aulvem/ai-crawler-user-agents-are-self-reported-468-real-fetches-991-fake-ones-bgo
