เนื้อหาบนเว็บ 1 ใน 3 หลังยุค ChatGPT แสดงสัญญาณว่าเขียนโดย AI

ผลการศึกษาที่สำคัญโดย Pew Research ได้เผยให้เห็นถึงการเปลี่ยนแปลงครั้งใหญ่ในภูมิทัศน์ดิจิทัล โดยพบว่าเนื้อหาเว็บใหม่ๆ จำนวนมากถูกสร้างขึ้นโดยปัญญาประดิษฐ์ (AI) เมื่อ Large Language Models (LLMs) เข้ามาเป็นส่วนหนึ่งของกระบวนการสร้างเนื้อหา เส้นแบ่งระหว่างข้อความที่เขียนโดยมนุษย์และเครื่องจักรจึงเริ่มเลือนลางลงอย่างรวดเร็ว

การเพิ่มขึ้นอย่างรวดเร็วของเนื้อหาที่สร้างโดย AI

เพื่อวัดผลกระทบของ Generative AI ที่มีต่ออินเทอร์เน็ต Pew Research ได้วิเคราะห์หน้าเว็บภาษาอังกฤษเกือบ 500,000 หน้า โดยใช้คลังข้อมูลเว็บ Common Crawl และด้วยการใช้เทคโนโลยีการตรวจจับของ Open Pangram การศึกษานี้จึงมุ่งหวังที่จะแยกแยะระหว่างข้อความที่เขียนโดยมนุษย์และข้อความที่มี AI ช่วยเขียน

แม้ว่ากลุ่มตัวอย่างแบบสุ่มจำนวน 10,000 หน้าจากเดือนกรกฎาคม 2026 จะแสดงอัตราการเขียนโดย AI อยู่ที่ 10% แต่ตัวเลขนี้มีความคลาดเคลื่อนเนื่องจากมีการรวมเนื้อหาเก่าที่เผยแพร่ก่อนยุคทองของ Generative AI เข้าไปด้วย อย่างไรก็ตาม เมื่อนักวิจัยคัดกรองชุดข้อมูลให้เหลือเฉพาะหน้าที่เผยแพร่หลังจากการเปิดตัว ChatGPT ในเดือนพฤศจิกายน 2022 ตัวเลขดังกล่าวกลับพุ่งสูงขึ้น ผลการศึกษาพบว่ามากกว่าหนึ่งในสาม (35%) ของหน้าเว็บทั้งหมดที่เผยแพร่ในยุคปัจจุบัน แสดงสัญญาณที่ชัดเจนว่าถูกเขียนหรือ "ได้รับการแก้ไขอย่างมีนัยสำคัญ" โดย AI

ความแตกต่างของโดเมนและ "วงจรบอท" (Bot Loop)

การแพร่กระจายของเนื้อหา AI ไม่ได้เกิดขึ้นอย่างเท่าเทียมกันทั่วทั้งเว็บ การศึกษานี้ชี้ให้เห็นถึงความแตกต่างอย่างชัดเจนระหว่างโดเมนระดับบนสุด (TLDs) ที่ต่างกัน ซึ่งบ่งชี้ว่าผลประโยชน์เชิงพาณิชย์เป็นแรงขับเคลื่อนหลักในการนำเครื่องมือเขียนด้วย AI มาใช้อย่างรุนแรงที่สุด

จากข้อมูลพบว่า URL ที่มีโดเมน .com มีอัตราการเขียนโดย AI สูงกว่าเว็บไซต์ทางวิชาการหรือหน่วยงานรัฐบาลประมาณ 10 เท่า โดยเฉพาะอย่างยิ่ง โดเมน .edu และ .gov มีอัตราการเขียนโดย AI เพียง 1% ในขณะที่โดเมน .org อยู่ที่ 4.6% แนวโน้มนี้ชี้ให้เห็นถึงเว็บเชิงพาณิชย์ที่ให้ความสำคัญกับความเร็วและขนาดของเนื้อหา ซึ่งมักทำได้ผ่าน LLMs มากกว่าการตรวจสอบโดยบรรณาธิการแบบดั้งเดิม

การเพิ่มขึ้นของเนื้อหา AI นี้เกิดขึ้นพร้อมกับหมุดหมายที่น่ากังวลซึ่งรายงานโดย Cloudflare นั่นคือ ทราฟฟิกจากบอทได้แซงหน้าทราฟฟิกจากมนุษย์อย่างเป็นทางการแล้ว สิ่งนี้สร้างวงจรป้อนกลับที่อาจนำไปสู่ "อินเทอร์เน็ตที่ตายแล้ว" (dead internet) ซึ่งบอทจะเข้ามาท่องเว็บและดึงข้อมูล (scraping) เนื้อหาที่ถูกเขียนขึ้นโดยบอทตัวอื่นๆ มากขึ้นเรื่อยๆ

สัญญาณทางภาษาและความท้าทายในการตรวจจับ

การศึกษายังระบุถึงรูปแบบทางภาษาเฉพาะเจาะจงที่ใช้เป็น "สัญญาณ" (tells) ของข้อความที่สร้างโดย AI เนื่องจาก LLMs มีความซับซ้อนมากขึ้น ลายนิ้วมือทางสไตล์ของพวกมันจึงคาดเดาได้ง่ายขึ้น นักวิจัยสังเกตเห็นความแพร่หลายที่เพิ่มขึ้นของโครงสร้างไวยากรณ์บางอย่าง เช่น:

  • การใช้ em dash และ Oxford comma อย่างแพร่หลาย
  • รูปแบบการใช้สำนวนที่มีจังหวะ เช่น "It’s not X, it’s Y."
  • แนวโน้มทางสไตล์เฉพาะที่ปรับแต่งมาเพื่อให้อ่านง่าย แต่ขาดความละเอียดอ่อนแบบมนุษย์

แม้ว่าการศึกษาจะยอมรับว่าเครื่องมือตรวจจับ AI อย่าง Pangram ไม่ได้สมบูรณ์แบบและอาจเกิดข้อผิดพลาดแบบ false positive ได้ แต่ขนาดของข้อมูลบ่งชี้ว่าผลลัพธ์เหล่านี้มีความถูกต้องในเชิงทิศทาง สำหรับนักพัฒนาและผู้ก่อตั้ง นี่คือความท้าทายที่สำคัญ: เมื่อเว็บเต็มไปด้วยข้อมูลสังเคราะห์ (synthetic data) การรักษาคุณภาพของชุดข้อมูลสำหรับฝึกฝน (training sets) สำหรับโมเดลในอนาคตจึงทำได้ยากขึ้นเรื่อยๆ

สรุปประเด็นสำคัญ

  • การเปลี่ยนแปลงครั้งใหญ่ในการสร้างเนื้อหา: 35% ของหน้าเว็บที่เผยแพร่ตั้งแต่การเปิดตัว ChatGPT แสดงสัญญาณที่ชัดเจนของการเขียนโดย AI หรือการใช้ AI แก้ไขอย่างหนัก
  • การครอบงำโดยภาคพาณิชย์: โดเมน .com เป็นแรงขับเคลื่อนหลักของเนื้อหา AI โดยมีสัดส่วนมากกว่าโดเมน .edu และ .gov ถึง 10 เท่า
  • ระบบนิเวศของบอท: การเพิ่มขึ้นของเนื้อหาที่เขียนโดย AI เกิดขึ้นพร้อมกับการที่ทราฟฟิกบอทแซงหน้าทราฟฟิกมนุษย์ ซึ่งส่งสัญญาณถึงการเปลี่ยนผ่านไปสู่ระบบนิเวศเว็บที่ถูกครอบงำโดยเครื่องจักร