ผลการทดสอบอย่างรวดเร็วชี้ให้เห็นว่า เครื่องมือค้นหาด้วย AI อาจดูมีความมั่นใจในขณะที่อ้างอิงแหล่งข้อมูลที่เสียหรือมีคุณภาพต่ำ

การตรวจสอบแหล่งที่มา (provenance) อย่างง่ายกับเครื่องมือค้นหาที่ขับเคลื่อนด้วย AI ยอดนิยม 3 รายการ พบว่า 2 ใน 3 รายนั้นชี้ไปยังลิงก์ที่เสีย หรือใช้แหล่งข้อมูลที่มีความน่าเชื่อถือต่ำมาสนับสนุนคำตอบ ทั้งที่ทั้งสามเครื่องมือแสดงข้อความที่ดูมั่นใจและมีแถบ "chips" แสดงแหล่งที่มาเหมือนกัน

การทดสอบที่นำไปสู่ความประหลาดใจ

ผมได้ลองถามคำถามที่เป็นข้อเท็จจริงและเป็นเรื่องล่าสุดว่า: “มีอะไรเปลี่ยนแปลงใน EU AI Act ในปี 2026 บ้าง?” คำตอบนี้มีอยู่ในข้อความแก้ไขฉบับทางการ ดังนั้นคำตอบจึงต้องมีอยู่หรือไม่ก็ไม่มีเลย ผมได้ป้อนคำถามนี้ไปยังเครื่องมือค้นหาด้วย AI 3 รายที่แสดงการอ้างอิง ได้แก่ Perplexity, Google’s AI mode และ Brave Search

ทั้งสามเครื่องมือให้ข้อเท็จจริงที่เหมือนกันทุกประการ ทั้งวันที่และคำอธิบาย ดังนั้นในแง่ของความถูกต้องเพียวๆ พวกเขาจึงเสมอกัน ความแตกต่างจะปรากฏขึ้นก็ต่อเมื่อผมตรวจสอบแหล่งที่มาที่ถูกอ้างอิงเท่านั้น

วิธีที่ผมใช้ตัดสินคุณภาพของแหล่งข้อมูล

ผมได้สร้างเกณฑ์การให้คะแนนแบบ 3 ระดับ โดยให้น้ำหนักกับการอ้างอิงแต่ละครั้งตามประเภทของโฮสต์:

  • Primary (น้ำหนัก 3) – เว็บไซต์ที่เผยแพร่กฎหมายนั้นจริงๆ (เช่น ทะเบียนทางการของ EU)
  • Official (น้ำหนัก 2) – สถาบันที่ออกหรือกำกับดูแลกฎหมาย (โดเมนของรัฐบาล, เว็บไซต์หน่วยงาน)
  • User-generated content (UGC, น้ำหนัก 0) – แพลตฟอร์มต่างๆ เช่น YouTube หรือ Reddit

คะแนนรวมของแต่ละเครื่องมือคือค่าเฉลี่ยของน้ำหนัก URL ที่แสดงออกมา

Engine แหล่งข้อมูลที่รายงาน คะแนน
Perplexity โดเมนทางการของรัฐบาล 2.00
Google AI mode บริษัทที่ปรึกษาและวิดีโอ YouTube 1.00
Brave Search แหล่งข้อมูลหลัก (Primary source) 3.00

หากดูจากตัวเลข Brave ดูสมบูรณ์แบบ Perplexity อยู่ในระดับที่ใช้ได้ และ Google ตามหลังอยู่

ความล้มเหลวที่ซ่อนอยู่: ลิงก์ที่เสีย

การแบ่งระดับนี้พิจารณาเพียงแค่ชื่อโดเมนเท่านั้น แต่ไม่ได้ตรวจสอบว่าหน้าเว็บที่ลิงก์ไปนั้นโหลดได้จริงหรือไม่ ผมได้ลองคลิกเข้าไปในทุก URL พบว่าการอ้างอิง "primary" ของ Brave แสดงผลเป็นหน้าว่าง—นั่นคือลิงก์เสีย เครื่องมือนี้อ้างว่าชี้ไปยังตัวกฎหมายแต่กลับไม่แสดงข้อมูลใดๆ เลย

Perplexity ใช้โดเมนทางการของรัฐบาล

Google ใช้บริษัทที่ปรึกษาและวิดีโอ YouTube

ปัญหาที่แตกต่างกันสองประการปรากฏขึ้น:

  1. โดเมนที่มีคุณภาพสูงไม่ได้การันตีว่าหน้าเว็บจะเข้าถึงได้
  2. บทสรุปที่เขียนมาอย่างดีอาจถูกสนับสนุนด้วยแหล่งข้อมูลที่มีความน่าเชื่อถือต่ำ

ส่วนต่อประสานกับผู้ใช้ (User interface) ปิดบังปัญหาทั้งสองนี้ เครื่องมือทั้งสามแสดงย่อหน้าที่ดูมั่นใจและแถบ source chips ที่ดูเหมือนกัน โดยไม่มีสัญญาณทางภาพใดๆ เลยว่า chip หนึ่งลิงก์ไปยังหน้าที่เสีย หรืออีกอันหนึ่งชี้ไปยังวิดีโอสอนใน YouTube แทนที่จะเป็นตัวบทกฎหมาย

ทำไมแหล่งที่มา (provenance) จึงสำคัญสำหรับนักพัฒนา

นักพัฒนาสามารถเปลี่ยนเรื่องแหล่งที่มาให้กลายเป็นตัวชี้วัดที่ทดสอบได้:

  • ให้คะแนนทุกคำตอบ โดยใช้น้ำหนักแบบแบ่งระดับคล้ายกับวิธีข้างต้น
  • ตรวจสอบความสมบูรณ์ของลิงก์ โดยอัตโนมัติ; ทำเครื่องหมายเมื่อพบการตอบสนองที่ว่างเปล่าหรือข้อผิดพลาด HTTP
  • แจ้งเตือน เมื่อคะแนนแหล่งที่มาของคำตอบต่ำกว่าเกณฑ์ที่กำหนดไว้

แนวทางนี้เป็นรูปธรรมมากกว่าการไล่ตาม "อาการประสาทหลอน" (hallucinations) – โมเดลอาจสร้างประโยคที่ดูสมเหตุสมผลขึ้นมา แต่การตรวจสอบแหล่งที่มาจะบอกคุณได้อย่างชัดเจนว่าการอ้างอิงใด (หรือการขาดการอ้างอิง) ที่ทำให้เกิดปัญหา ซึ่งช่วยให้สามารถแก้ไขได้อย่างตรงจุด

บทสรุป

การทดสอบแหล่งที่มาสั้นๆ แสดงให้เห็นว่าเครื่องมือค้นหาด้วย AI สามารถดูมีความน่าเชื่อถือในขณะที่อ้างอิงแหล่งข้อมูลที่เสียหรือมีคุณภาพต่ำ นักพัฒนาที่พึ่งพาเครื่องมือเหล่านี้ควรปฏิบัติกับคุณภาพของการอ้างอิงในฐานะคุณสมบัติที่วัดผลได้ ไม่ใช่สิ่งที่ต้องทึกทักเอาเองว่ามีการรับประกัน และควรสร้างระบบตรวจสอบอัตโนมัติไว้ในขั้นตอนการทำงาน (pipelines) การตรวจสอบว่าแหล่งข้อมูล "primary" สามารถโหลดได้จริงหรือไม่ อาจเป็นตัวตัดสินความแตกต่างระหว่างคำตอบที่น่าเชื่อถือกับกับดักข้อมูลเท็จที่แฝงมาอย่างเงียบเชียบ