โมเดลภาษา-ภาพ (Vision-language models หรือ VLMs) ยังคงทำผลงานได้ไม่ดีนักในงานด้านการมองเห็นขั้นพื้นฐาน ผลการประเมินจาก PerceptionBench ชุดใหม่พบว่าไม่มีระบบชั้นนำทั้ง 16 ระบบใดที่มีความแม่นยำโดยรวมเกิน 60% และแม้แต่ระบบที่แข็งแกร่งที่สุดก็ยังทำคะแนนได้ไม่ถึง 80% ในทักษะเฉพาะด้านใดเลย ผลลัพธ์นี้เป็นการเตือนเหล่านักพัฒนาว่า คะแนนที่สูงในการทดสอบการบรรยายภาพ (captioning) หรือการใช้เหตุผล (reasoning) ที่เป็นที่นิยมนั้น ไม่ได้การันตีว่าโมเดลจะมีความสามารถในการมองเห็นที่เชื่อถือได้เสมอไป

ทำไมการทดสอบที่มีอยู่ถึงปกปิดปัญหา

เกณฑ์มาตรฐาน (benchmarks) สาธารณะส่วนใหญ่มักจะผสมผสานทั้งการบรรยายภาพ การตอบคำถาม และการใช้เหตุผลเชิงสามัญสำนึกเข้าด้วยกัน เมื่อโมเดลสร้างคำบรรยายภาพที่ผิดพลาด ความผิดพลาดนั้นอาจเกิดจากการใช้ภาษาผิด การใช้เหตุผลที่ผิดพลาด หรือเพียงแค่การไม่สามารถจดจำวัตถุได้ เนื่องจากองค์ประกอบทั้งสามนี้ปะปนกันอยู่ คะแนนที่ต่ำจึงไม่ได้ให้เบาะแสเกี่ยวกับข้อบกพร่องด้านการมองเห็นเลย ด้วยเหตุนี้ ทีมที่สร้างแอปพลิเคชันจึงมีความมั่นใจที่สูงเกินจริงจากตัวเลขพาดหัว โดยทึกทักเอาเองว่าโมเดลนั้น "มองเห็น" ได้อย่างถูกต้อง

สิ่งที่ PerceptionBench ทำแตกต่างออกไป

PerceptionBench แยกความสามารถด้านการมองเห็นออกเป็น 10 ด้าน และประเมินแต่ละโมเดลด้วยชุดงานด้านการมองเห็นโดยเฉพาะ (pure-vision task set) การตัดเรื่องภาษาและการใช้เหตุผลออกไปช่วยให้เกณฑ์มาตรฐานนี้แสดงให้เห็นว่าส่วนหน้าด้านการมองเห็น (visual front-end) ทำงานได้ดีเพียงใดด้วยตัวมันเอง จากภาพรวม พบว่า VLMs ชั้นนำทั้ง 16 ระบบทำคะแนนไม่ถึงเกณฑ์ความแม่นยำที่ 60% และระบบที่มีประสิทธิภาพดีที่สุดก็ไม่เคยทำคะแนนถึง 80% ในทักษะใดทักษะหนึ่งเลย อาการประสาทหลอน (Hallucination) หรือการสร้างรายละเอียดที่ไม่มีอยู่จริงในภาพ เป็นข้อผิดพลาดที่พบได้บ่อยที่สุด ในขณะที่รูปแบบของจุดแข็งและจุดอ่อนนั้นมีความแตกต่างกันอย่างมากในแต่ละโมเดล

ใครคือผู้ที่จะเสียประโยชน์

นักพัฒนาไม่ควรแทนที่ตัวจำแนกภาพเฉพาะทาง (dedicated visual classifiers) ด้วยโมเดล AI ทั่วไป

จุดที่ข้อโต้แย้งอาจมีจุดอ่อน

ข้อมูลจาก PerceptionBench แสดงให้เห็นถึงผลตอบแทนที่ลดน้อยลง (diminishing returns): แม้แต่โมเดลที่มีขนาดใหญ่ที่สุดก็ยังคงสะดุดกับงานด้านการรับรู้ขั้นพื้นฐาน

ขั้นตอนที่นำไปปฏิบัติได้จริงสำหรับนักพัฒนา

  • คงการใช้ตัวจำแนกภาพเฉพาะทาง (dedicated visual classifiers) สำหรับงานที่ต้องการความแม่นยำสูง โดยให้มองว่า VLMs เป็นส่วนเสริมมากกว่าที่จะนำมาใช้แทนที่
  • เพิ่มชั้นการตรวจสอบ (verification layer) เพื่อตรวจสอบความถูกต้องของผลลัพธ์จากโมเดลเทียบกับตัวตรวจจับ (detector) ที่เชื่อถือได้ ก่อนที่จะส่งถึงมือผู้ใช้
  • ใช้งานตัวกรองการมองเห็นขนาดเล็ก (lightweight vision filter) เพื่อตรวจจับอาการประสาทหลอนหรือการจำแนกประเภทที่ผิดพลาดอย่างชัดเจนตั้งแต่ช่วงต้นของกระบวนการ (pipeline)

การจับคู่ VLM อเนกประสงค์เข้ากับส่วนประกอบด้านการมองเห็นที่สร้างขึ้นเพื่อวัตถุประสงค์เฉพาะ จะช่วยให้ทีมสามารถใช้ความสามารถในการใช้เหตุผลของโมเดลแรก ในขณะที่ยังสามารถป้องกันจุดบอดด้านการมองเห็นของมันได้

ที่มา: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1