מדד ה-ActiveVision מראה שמוגלי השפה הגדולים (LLMs) הרב-מודאליים המובילים כיום פתרו 10.6% מהמשימות הדורשות הסתכלות על תמונה יותר מפעם אחת. במבחן של 17 אתגרי תפיסה איטרטיביים, בני אדם הצליחו ב-96.1% מהמקרים, בעוד ש-GPT-5.5 הצליח ב-10.6% ו-Claude Fable 5 הצליח ב-3.5%; ב-11 מהמשימות לא התקבל אף תשובה נכונה מהמודלים.
מדוע מודלי ראייה נוכחיים נתקלים בקשיים
רוב מערכות הראייה מתייחסות לתמונה כאל קלט חד-פעמי. "vision encoder" מחלץ מאפיינים פעם אחת, ואז מעביר אותם למודל השפה לצורך הסקה. ה-pipeline אינו יכול לבקש מבט שני, לבצע זום על אזור מסוים, או להעריך מחדש השערה. בני אדם, לעומת זאת, מציעים השערה ראשונית, משנים את המיקוד, אוספים ראיות חדשות ומתאימים את תשובתם. המדד ממסד את הלולאה הזו: כל משימה מאלצת את המודל להתבונן, להציע פעולה, להתבונן בתוצאה, ולחזור על הפעולה עד להגעה למסקנה נכונה.
מה המדד בדק
חוקרים בנו 17 תרחישים הדורשים תצפית חוזרת. התוצאות חדות:
- משתתפים אנושיים: 96.1% הצלחה
- GPT-5.5: 10.6% הצלחה
- Claude Fable 5: 3.5% הצלחה
- אחת-עשרה משימות: כל מודל שנבדק קיבל ציון אפס
אפילו כאשר המודלים ייצרו קוד לעיבוד מחדש של התמונה, הם פספסו שגיאות בפלט שלהם עצמם, מה שמאשר שהמגבלה היא ארכיטקטונית ולא רק מבוססת נתונים.
ההשלכות על מפתחים ועל התעשייה
אם אתם בונים רובוטים אוטונומיים, רחפני בדיקה, או כל מערכת שחייבת לאמת מידע חזותי לאורך זמן, מודל ראייה מסוג single-shot הוא מסוכן. המדד מראה שצינורות עיבוד ראייה מבוססי LLM נוכחיים אינם יכולים להתמודד באופן אמין עם תפיסה מונעת-משוב, ולכן הם יפספסו פגמים, יספרו פריטים לא נכון, או יפרשו סצנות דינמיות באופן שגוי. הוספת נתוני אימון נוספים או הגדלת מספר הפרמטרים לא יצמצמו את הפער; המרכיב החסר הוא מנגנון לתצפית מבוקרת ואיטרטיבית.
טיעון נגד: האם מודלים גדולים יותר יכולים לעזור?
הוספת נתוני אימון נוספים או הגדלת מספר הפרמטרים לא יצמצמו את הפער; המרכיב החסר הוא מנגנון לתצפית מבוקרת ואיטרטיבית.
דרכים קדימה
חוקרים מציעים כיוון משלים:
- עיצוב מחדש של הארכיטקטורה – הטמעת מודול חזותי הניתן לשליטה, שיכול לבקש זוויות צפייה חדשות, לחתוך אזורים או לשנות תנאי תאורה בהתבסס על המצב הפנימי של המודל.
שורה תחתונה: מודלי LLM רב-מודאליים נוכחיים מצטיינים במתן תשובות לשאלות על תמונות סטטיות, אך נכשלים כאשר בעיה דורשת מבט נוסף. אינטליגנציה חזותית אמיתית תזדקק למודלים שיכולים לשלוט בראייה שלהם, ולא רק לקרוא תמונה פעם אחת.
