ผลการทดสอบ ActiveVision benchmark แสดงให้เห็นว่าโมเดลภาษาขนาดใหญ่แบบ multimodal (LLMs) ชั้นนำในปัจจุบัน สามารถแก้โจทย์ที่ต้องมองภาพมากกว่าหนึ่งครั้งได้เพียง 10.6% เท่านั้น ในการทดสอบความท้าทายด้านการรับรู้แบบวนซ้ำ (iterative-perception challenges) จำนวน 17 รูปแบบ มนุษย์ทำสำเร็จถึง 96.1% ในขณะที่ GPT-5.5 ทำได้ 10.6% และ Claude Fable 5 ทำได้เพียง 3.5% โดยมีโจทย์ถึง 11 ข้อที่โมเดลทั้งหมดไม่สามารถตอบถูกได้เลยแม้แต่ข้อเดียว

ทำไมโมเดลการมองเห็นในปัจจุบันถึงติดขัด

ระบบการมองเห็นส่วนใหญ่ประมวลผลภาพแบบครั้งเดียวจบ โดย "vision encoder" จะสกัดคุณลักษณะ (features) ออกมาเพียงครั้งเดียว แล้วส่งต่อให้โมเดลภาษาเพื่อใช้ในการให้เหตุผล กระบวนการทำงาน (pipeline) นี้ไม่สามารถสั่งให้มองซ้ำ ขยายดูเฉพาะจุด หรือประเมินสมมติฐานใหม่ได้ ในทางตรงกันข้าม มนุษย์จะคาดเดาในเบื้องต้น เปลี่ยนจุดโฟกัส รวบรวมหลักฐานใหม่ และปรับคำตอบของตนเอง Benchmark นี้ได้กำหนดวงจรดังกล่าวให้เป็นระบบ โดยแต่ละโจทย์จะบังคับให้โมเดลต้องสังเกต เสนอการกระทำ สังเกตผลลัพธ์ และทำซ้ำจนกว่าจะบรรลุข้อสรุปที่ถูกต้อง

สิ่งที่ benchmark นี้ทดสอบ

นักวิจัยได้สร้างสถานการณ์ 17 รูปแบบที่ต้องอาศัยการสังเกตซ้ำๆ ซึ่งผลลัพธ์ที่ได้นั้นน่าตกใจ:

  • ผู้เข้าร่วมที่เป็นมนุษย์: สำเร็จ 96.1%
  • GPT-5.5: สำเร็จ 10.6%
  • Claude Fable 5: สำเร็จ 3.5%
  • 11 โจทย์: โมเดลที่ทดสอบทั้งหมดได้คะแนนเป็นศูนย์

แม้ว่าโมเดลจะสร้างโค้ดเพื่อประมวลผลภาพซ้ำ แต่พวกมันก็ยังมองข้ามข้อผิดพลาดในผลลัพธ์ของตัวเอง ซึ่งเป็นการยืนยันว่าข้อจำกัดนี้เกิดจากโครงสร้างสถาปัตยกรรม (architectural) มากกว่าจะเป็นเรื่องของข้อมูลเพียงอย่างเดียว

ความเสี่ยงสำหรับนักพัฒนาและอุตสาหกรรม

หากคุณกำลังสร้างหุ่นยนต์อัตโนมัติ โดรนตรวจสอบ หรือระบบใดก็ตามที่ต้องตรวจสอบข้อมูลภาพอย่างต่อเนื่อง โมเดลการมองเห็นแบบครั้งเดียวจบ (single-shot vision model) ถือว่ามีความเสี่ยง Benchmark นี้แสดงให้เห็นว่ากระบวนการทำงานด้านการมองเห็นที่ใช้ LLM ในปัจจุบัน ไม่สามารถจัดการกับการรับรู้ที่ขับเคลื่อนด้วยการตอบสนอง (feedback-driven perception) ได้อย่างน่าเชื่อถือ ดังนั้นพวกมันจึงอาจมองข้ามจุดบกพร่อง นับจำนวนสิ่งของผิดพลาด หรือตีความฉากที่มีการเคลื่อนไหวผิดไป การเพิ่มข้อมูลการฝึกฝนหรือการขยายขนาดพารามิเตอร์จะไม่สามารถปิดช่องว่างนี้ได้ เพราะสิ่งที่ขาดหายไปคือกลไกสำหรับการสังเกตแบบวนซ้ำที่สามารถควบคุมได้

ข้อโต้แย้ง: โมเดลที่ใหญ่กว่าจะช่วยได้หรือไม่?

การเพิ่มข้อมูลการฝึกฝนหรือการขยายขนาดพารามิเตอร์จะไม่สามารถปิดช่องว่างนี้ได้ เพราะสิ่งที่ขาดหายไปคือกลไกสำหรับการสังเกตแบบวนซ้ำที่สามารถควบคุมได้

แนวทางในอนาคต

นักวิจัยเสนอแนวทางเสริมดังนี้:

  • การออกแบบสถาปัตยกรรมใหม่ (Architectural redesign) – ฝังโมดูลการมองเห็นที่ควบคุมได้ ซึ่งสามารถร้องขอการมองเห็นมุมใหม่ ตัดส่วนภาพ (crop) หรือปรับเปลี่ยนสภาพแสงตามสถานะภายในของโมเดล

บทสรุป: Multimodal LLMs ในปัจจุบันทำได้ดีเยี่ยมในการตอบคำถามจากภาพนิ่ง แต่จะสอบตกเมื่อโจทย์ต้องการการมองซ้ำ ปัญญาประดิษฐ์ด้านการมองเห็นที่แท้จริงจำเป็นต้องมีโมเดลที่สามารถควบคุมการมองเห็นของตัวเองได้ ไม่ใช่แค่การอ่านภาพเพียงครั้งเดียว