44.9% daripada 107 laman web teratas menyekat sekurang-kurangnya satu pengumpul AI, menurut analisis tahun 2026. Risikonya bukan sekadar kehilangan trafik; ia adalah potensi kehilangan kehadiran daripada saluran baharu di mana pengguna mendapatkan maklumat hari ini.
Skop masalah ini
Robots.txt telah menjadi fail rujukan utama untuk memberitahu Googlebot dan pengumpul carian tradisional lain halaman mana yang perlu diindeks. Fail yang serupa kini mengawal pengumpul AI—ejen perisian yang membaca kandungan web untuk menjana jawapan bagi alatan seperti ChatGPT, Claude dan Perplexity. Kajian mendapati bahawa 44.9% daripada laman web yang diperiksa telah sengaja melarang sekurang-kurangnya satu daripada bot ini. GPTBot, pengumpul yang digunakan oleh model OpenAI, berada di tangga teratas senarai ejen yang disekat.
Sebahagian besar sekatan yang mengejutkan berpunca daripada tetapan satu klik dalam perkhidmatan seperti Cloudflare, di mana pemilik laman web mungkin secara tidak sengaja menyekat akses AI semasa cuba memperketat keselamatan.
Apa maksud sebenar "kebolehcarian AI" (AI crawlability)
Kebolehcarian (crawlability) ialah keupayaan bot untuk mengambil halaman. Bagi AI, kebolehcarian menentukan sama ada sesuatu model boleh menarik fakta terkini tentang jenama, produk atau perkhidmatan apabila pengguna bertanya soalan. Jika sesuatu laman web tidak boleh dicari, AI tidak mempunyai sumber untuk dirujuk, dan jenama tersebut akan hilang daripada suapan jawapan.
Strategi SEO lama tertumpu kepada Googlebot mengumpul halaman supaya ia boleh disusun mengikut kedudukan dalam senarai pautan. Kebolehcarian AI mengubah matlamat tersebut: berbanding kedudukan (ranking), hasilnya adalah cadangan di dalam jawapan perbualan.
Bot latihan vs. bot jawapan
Tidak semua pengumpul AI mempunyai tujuan yang sama.
- Bot latihan – contohnya termasuk GPTBot, ClaudeBot dan Google-Extended. Ia mengumpul (scrape) bahagian besar web untuk membekalkan set data besar yang menggerakkan model bahasa asas. Pemilik laman web boleh menyekat bot ini jika mereka ingin menghalang kandungan hak milik daripada digunakan dalam latihan model masa hadapan.
- Bot jawapan – contohnya termasuk OAI-SearchBot, Claude-SearchBot dan PerplexityBot. Bot ini beroperasi dalam masa nyata, menarik petikan (snippets) tertentu untuk menjawab pertanyaan pengguna. Menyekat bot jawapan bermakna kandungan laman web tidak akan pernah dipaparkan dalam jawapan perbualan, walaupun halaman yang sama masih diindeks oleh enjin carian tradisional.
Analisis menunjukkan banyak laman web mencampuradukkan kedua-duanya, yang akhirnya membawa kepada peraturan menyeluruh "sekat semua AI" yang menjejaskan keterlihatan tanpa melindungi sebarang harta intelek (IP) yang sebenar.
Mengapa bot yang salah disekat
Beberapa faktor menjelaskan salah konfigurasi ini:
- Tetapan keselamatan lalai – platform yang menawarkan butang suis tunggal "sekat AI" sering kali menerapkannya kepada setiap pengumpul yang diketahui, termasuk bot jawapan yang sebenarnya ingin dicapai oleh laman web tersebut.
- Kurang kesedaran – kebanyakan pentadbir web (webmasters) tahu tentang robots.txt untuk Googlebot, tetapi arahan khusus AI yang lebih baharu kurang difahami.
- Kebimbangan terhadap penyalahgunaan data – pemilik bimbang bot latihan akan memasukkan kandungan mereka ke dalam model masa hadapan, satu kebimbangan yang sah tetapi tidak terpakai kepada bot jawapan yang hanya mengambil data apabila diminta.
Cara mendapatkan keseimbangan yang betul
- Edit robots.txt – benarkan bot jawapan yang anda ingin capai secara eksplisit. Baris seperti
User-agent: OAI-SearchBot\nAllow: /membolehkan bot jawapan OpenAI mengumpul keseluruhan laman
- Penggunaan llms.txt – memandangkan piawaian ini semakin diterima, alatan yang menganalisisnya boleh menjadi cara utama bot jawapan AI mencari kandungan bernilai tinggi.
- Peralihan polisi daripada penyedia AI – OpenAI, Anthropic dan lain-lain mungkin memperhalusi polisi pengumpul (crawler) mereka, yang berpotensi menawarkan mekanisme pilihan masuk (opt-in) yang lebih terperinci.
- Panduan undang-undang mengenai data latihan AI – perdebatan berterusan tentang sama ada kandungan awam yang dikumpul (scraped) boleh digunakan untuk latihan model boleh mempengaruhi jumlah laman web yang memilih untuk menyekat bot latihan secara terus.
Intipatinya: jika sesebuah jenama ingin kekal kelihatan di tempat di mana pengguna semakin banyak bertanya soalan berbanding menaip kata kunci, ia mesti menjadikan laman webnya boleh dirangkak oleh AI. Langkah pertama ialah suntingan robots.txt yang mudah; langkah kedua ialah keputusan yang jelas tentang data apa yang selesa untuk dikongsi dengan generasi carian seterusnya. Mengabaikan perbezaan antara bot latihan dan bot jawapan boleh menyebabkan sesebuah syarikat tidak kelihatan dalam ruang yang sedang membentuk semula cara maklumat ditemui.
