Stanford’s 2026 AI Index shows safety incidents climbing to 362 last year, underscoring a widening chasm between rapid model improvements and lagging safeguards meant to keep them trustworthy. Every unchecked failure erodes confidence in systems already embedded in finance, health and public services.

ข้อมูลเบื้องหลังช่องว่างดังกล่าว

ดัชนีนี้ซึ่งรวบรวมโดย Institute for Human-Centered Artificial Intelligence ได้นำประสิทธิภาพที่โดดเด่นมาเปรียบเทียบกับความน่าเชื่อถือในโลกความเป็นจริง โมเดลระดับแนวหน้ายังคงทำคะแนนได้ดีเยี่ยมในการทดสอบมาตรฐาน (benchmark) แต่ "อัตราการหลอน" (hallucination rates) — ซึ่งเป็นกรณีที่โมเดลสร้างข้อความที่เป็นเท็จหรือกุเรื่องขึ้นมา — นั้นสูงถึง 22% ถึง 94% ทั่วทั้งวงการ เมื่อผู้ใช้ป้อนข้อมูลที่เป็นเท็จโดยเจตนา ความแม่นยำของ GPT-4o จะดิ่งลงจาก 98.2% เหลือเพียง 64.4% ในขณะที่ DeepSeek R1 ลดลงจากมากกว่า 90% เหลือเพียง 14.4% ภายใต้การทดสอบเดียวกัน มาตรการป้องกันความปลอดภัย (safety guardrails) ที่ควรจะบล็อกคำสั่งที่เป็นอันตรายกลับถูกเจาะผ่านได้เป็นประจำเมื่อผู้โจมตีพยายามทดสอบระบบ

ทำไมบริษัทต่างๆ จึงต้องเร่งรีบจัดการ

การนำนโยบายมาใช้ก้าวหน้าไปเร็วกว่าการบังคับใช้ สัดส่วนของบริษัทที่ไม่มีการกำกับดูแล AI ลดลงจาก 24% เป็น 11% ระหว่างการสำรวจครั้งก่อนกับปีนี้ และหลายแห่งเริ่มอ้างอิงมาตรฐานต่างๆ เช่น ISO/IEC 42001 หรือ NIST AI Risk Management Framework อย่างไรก็ตาม การร่างนโยบายนั้นไม่เหมือนกับการนำไปปฏิบัติจริง ช่องว่างด้านความรู้ภายในองค์กรส่งผลกระทบต่อผู้ตอบแบบสอบถาม 59%, ข้อจำกัดด้านงบประมาณเป็นอุปสรรคต่อ 48% และความไม่แน่นอนด้านกฎระเบียบสร้างปัญหาให้แก่ 41% รายงานระบุว่านี่คือ "ปัญหาทางเทคนิค": การเพิ่มความเข้มงวดในการควบคุมความเป็นส่วนตัวอาจทำให้เกณฑ์วัดความยุติธรรม (fairness metrics) อ่อนแอลงโดยไม่ตั้งใจ และในทางกลับกัน ทำให้วิศวกรต้องรับมือกับวัตถุประสงค์ที่ขัดแย้งกันโดยไม่มีเครื่องมือหรือเงินทุนที่เพียงพอ

ภาพลวงตาของการตรวจสอบความปลอดภัยในปัจจุบัน

คะแนนความโปร่งใส — ซึ่งเป็นค่ารวมของความเปิดเผยของผู้พัฒนาเกี่ยวกับข้อจำกัดของโมเดลและวิธีการทดสอบ — ลดลงจาก 58 เหลือ 40 ซึ่งบ่งชี้ว่าการรายงานโดยสมัครใจกำลังสูญเสียความน่าเชื่อถือ บริษัทต่างๆ มักพึ่งพาการตรวจสอบภายในซึ่งมักจะพลาดความล้มเหลวในกรณีที่เกิดขึ้นได้ยาก (edge-case failures) ตามที่ระบุไว้ในดัชนี ผลลัพธ์ที่ได้คือความรู้สึกปลอดภัยที่ผิดพลาด องค์กรต่างๆ เชื่อว่าตนเองได้รับการคุ้มครองในขณะที่ช่องโหว่ที่ซ่อนอยู่ยังคงมีอยู่

มุมมองแย้ง: มาตรฐานต่างๆ กำลังได้รับความนิยมมากขึ้น

ฝ่ายที่สนับสนุนโต้แย้งว่าการอ้างอิงกรอบการทำงานของ ISO และ NIST ถือเป็นก้าวสำคัญ มาตรฐานที่เป็นทางการช่วยให้ผู้ตรวจสอบและหน่วยงานกำกับดูแลมีภาษาและเกณฑ์ความคาดหวังพื้นฐานที่ตรงกัน ทำให้การเปรียบเทียบระหว่างบริษัททำได้ง่ายขึ้น กลุ่มที่เริ่มนำมาใช้ก่อนรายงานว่าการประสานงานภายในราบรื่นขึ้นและมีแนวทางการยกระดับปัญหา (escalation paths) ที่ชัดเจนขึ้นเมื่อมีนโยบายรองรับ การเพิ่มขึ้นของการนำนโยบายมาใช้บ่งชี้ว่าอุตสาหกรรมตระหนักถึงความเสี่ยงและพร้อมที่จะลงทุนในการกำกับดูแล

สิ่งที่ยังขาดหายไป

แม้จะมีนโยบายเป็นลายลักษณ์อักษร แต่การปฏิบัติจริงยังคงติดขัด ดัชนีนี้เน้นย้ำถึงอุปสรรคในทางปฏิบัติ 3 ประการ:

  • ช่องว่างด้านความรู้: ทีมงานขาดความเชี่ยวชาญเชิงลึกด้านความเสี่ยงของ AI นำไปสู่การตรวจสอบการปฏิบัติตามกฎระเบียบเพียงผิวเผิน
  • งบประมาณไม่เพียงพอ: เครื่องมือด้านความปลอดภัย การตรวจสอบโดยบุคคลที่สาม และการตรวจสอบอย่างต่อเนื่อง จำเป็นต้องใช้งบประมาณที่หลายบริษัทไม่สามารถอนุมัติได้
  • ความคลุมเครือด้านกฎระเบียบ: กฎหมายที่กำกวมหรือกำลังเปลี่ยนแปลงทำให้ยากต่อการออกแบบแผนงานการปฏิบัติตามกฎระเบียบในระยะยาว

การแก้ไขปัญหาเหล่านี้อาจจำเป็นต้องมีการตรวจสอบจากภายนอก รายงานแนะนำให้ก้าวข้ามการประเมินตนเองไปสู่การประเมินโดยอิสระที่จำลองการใช้งานในโลกความเป็นจริงและการโจมตีแบบ adversarial นอกจากนี้ยังเรียกร้องให้มีโซลูชันทางวิศวกรรมที่ฝังการตรวจสอบความปลอดภัยลงในโมเดลไพป์ไลน์ (model pipelines) โดยตรง แทนที่จะมองว่าเป็นเพียงสิ่งที่ต้องทำภายหลัง

สิ่งที่ต้องจับตามองต่อไป