Sepertiga Konten Web Pasca-ChatGPT Menunjukkan Tanda-Tanda Penulisan oleh AI
Sebuah studi terobosan oleh Pew Research telah mengungkapkan pergeseran masif dalam lanskap digital, mengungkap bahwa sebagian besar konten web baru dihasilkan oleh kecerdasan buatan. Seiring dengan semakin terintegrasinya Large Language Models (LLM) ke dalam alur kerja konten, batasan antara teks buatan manusia dan mesin semakin kabur dengan cepat.
Lonjakan Konten yang Dihasilkan AI
Untuk mengukur dampak AI generatif pada internet, Pew Research menganalisis hampir 500.000 halaman web berbahasa Inggris menggunakan arsip web Common Crawl. Dengan menggunakan teknologi deteksi Open Pangram, studi ini berupaya membedakan antara teks yang ditulis oleh manusia dan teks yang dibantu oleh AI.
Meskipun sampel acak dari 10.000 halaman pada Juli 2026 menunjukkan tingkat penulisan AI sebesar 10%, angka ini terdistorsi oleh penyertaan konten lama yang diterbitkan sebelum ledakan AI generatif. Namun, ketika para peneliti menyaring kumpulan data untuk hanya menyertakan halaman yang diterbitkan setelah peluncuran ChatGPT pada November 2022, angkanya melonjak. Studi tersebut menemukan bahwa lebih dari sepertiga (35%) dari semua halaman web yang diterbitkan di era baru ini menunjukkan tanda-tanda signifikan bahwa teks tersebut ditulis atau "diedit secara substansial" oleh AI.
Disparitas Domain dan "Bot Loop"
Proliferasi konten AI tidak merata di seluruh web. Studi ini menyoroti kontras yang tajam antara berbagai top-level domain (TLD) yang berbeda, yang menunjukkan bahwa kepentingan komersial mendorong adopsi alat penulisan AI yang paling agresif.
Menurut data tersebut, URL dengan domain .com menunjukkan tingkat penulisan AI sekitar 10 kali lebih tinggi daripada situs akademik atau pemerintah. Secara khusus, domain .edu dan .gov hanya menunjukkan tingkat penulisan AI sebesar 1%, sementara domain .org berada di angka 4,6%. Tren ini mengarah pada web yang terkomersialisasi di mana kecepatan dan skala—yang sering kali dicapai melalui LLM—lebih diprioritaskan daripada pengawasan editorial tradisional.
Lonjakan konten AI ini muncul bersamaan dengan pencapaian yang mengkhawatirkan yang dilaporkan oleh Cloudflare: lalu lintas bot secara resmi telah melampaui lalu lintas web manusia. Hal ini menciptakan potensi loop umpan balik "dead internet", di mana bot semakin banyak menjelajahi dan mengambil (scraping) konten yang ditulis oleh bot lainnya.
Ciri Linguistik dan Tantangan Deteksi
Studi ini juga mengidentifikasi pola linguistik tertentu yang berfungsi sebagai "ciri" (tells) untuk teks yang dihasilkan AI. Seiring dengan semakin canggihnya LLM, jejak gaya mereka menjadi lebih mudah diprediksi. Para peneliti mencatat peningkatan prevalensi struktur sintaksis tertentu, seperti:
- Penggunaan em dash dan koma Oxford yang ekstensif.
- Pola frasa berirama seperti "Bukan X, melainkan Y."
- Kecenderungan gaya tertentu yang dioptimalkan untuk keterbacaan tetapi kurang memiliki nuansa manusia.
Meskipun studi tersebut mengakui bahwa alat deteksi AI seperti Pangram tidaklah sempurna dan dapat mengalami kesalahan positif (false positives), skala datanya menunjukkan bahwa temuan ini menunjukkan arah yang akurat. Bagi para pengembang dan pendiri, hal ini menyoroti tantangan kritis: saat web semakin jenuh dengan data sintetis, menjaga kualitas set pelatihan untuk model masa depan menjadi semakin sulit.
Poin-Poin Penting
- Pergeseran Masif dalam Pembuatan Konten: 35% halaman web yang diterbitkan sejak peluncuran ChatGPT menunjukkan tanda-tanda jelas penulisan oleh AI atau pengeditan AI yang intensif.
- Dominasi Komersial: Domain .com adalah penggerak utama konten AI, melampaui domain .edu dan .gov dengan faktor 10 kali lipat.
- Ekosistem Bot: Kenaikan konten yang ditulis AI bertepatan dengan lalu lintas bot yang melampaui lalu lintas manusia, menandakan pergeseran menuju ekosistem web yang didominasi mesin.
