بنچمارک ActiveVision نشان می‌دهد که مدل‌های زبانی بزرگ (LLMs) چندوجهی پیشرو امروزی، تنها ۱۰.۶٪ از وظایفی را که مستلزم نگاه کردن بیش از یک بار به تصویر هستند، حل کرده‌اند. در آزمونی شامل ۱۷ چالش ادراک تکرارشونده، انسان‌ها در ۹۶.۱٪ موارد موفق بودند، در حالی که GPT-5.5 موفقیت ۱۰.۶ درصدی و Claude Fable 5 موفقیت ۳.۵ درصدی داشتند؛ در یازده مورد از وظایف، هیچ پاسخ صحیحی از سوی مدل‌ها ارائه نشد.

چرا مدل‌های بینایی فعلی دچار لغزش می‌شوند

اکثر سیستم‌های بینایی با یک تصویر به عنوان یک ورودی یک‌باره برخورد می‌کنند. یک «رمزگذار بینایی» (vision encoder) ویژگی‌ها را یک‌بار استخراج کرده و سپس آن‌ها را برای استدلال به مدل زبانی تحویل می‌دهد. این خط لوله (pipeline) نمی‌تواند درخواست نگاه دوم کند، روی منطقه‌ای زوم کند یا یک فرضیه را دوباره ارزیابی کند. در مقابل، انسان‌ها یک حدس اولیه می‌زنند، تمرکز خود را تغییر می‌دهند، شواهد جدید جمع‌آوری می‌کنند و پاسخ خود را اصلاح می‌کنند. این بنچمارک آن چرخه را رسمی‌سازی می‌کند: هر وظیفه مدل را مجبور می‌کند تا مشاهده کند، اقدامی را پیشنهاد دهد، نتیجه را مشاهده کند و این روند را تا رسیدن به نتیجه صحیح تکرار کند.

بنچمارک چه چیزی را آزمایش کرد

محققان ۱۷ سناریو ساختند که نیازمند مشاهده مکرر هستند. نتایج تکان‌دهنده است:

  • شرکت‌کنندگان انسانی: ۹۶.۱٪ موفقیت
  • GPT-5.5: ۱۰.۶٪ موفقیت
  • Claude Fable 5: ۳.۵٪ موفقیت
  • یازده وظیفه: تمام مدل‌های آزمایش‌شده امتیاز صفر گرفتند

حتی زمانی که مدل‌ها برای پردازش مجدد تصویر کد تولید کردند، باز هم متوجه خطاها در خروجی خود نشدند، که این امر تأیید می‌کند که این محدودیت بیشتر ساختاری است تا صرفاً مبتنی بر داده.

مخاطرات برای توسعه‌دهندگان و صنعت

اگر در حال ساخت ربات‌های خودمختار، پهپادهای بازرسی یا هر سیستمی هستید که باید اطلاعات بصری را در طول زمان تأیید کند، استفاده از یک مدل بینایی تک‌مرحله‌ای (single-shot) پرخطر است. این بنچمارک نشان می‌دهد که خط لوله‌های بینایی مبتنی بر LLM فعلی نمی‌توانند به طور قابل اعتماد ادراک مبتنی بر بازخورد را مدیریت کنند، بنابراین نقص‌ها را نادیده می‌گیرند، اشیاء را اشتباه می‌شمارند یا صحنه‌های پویا را اشتباه تفسیر می‌کنند. افزودن داده‌های آموزشی بیشتر یا افزایش پارامترها این شکاف را پر نخواهد کرد؛ عنصر مفقوده، مکانیزمی برای مشاهده کنترل‌شده و تکرارشونده است.

استدلال متقابل: آیا مدل‌های بزرگ‌تر می‌توانند کمک کنند؟

افزودن داده‌های آموزشی بیشتر یا افزایش پارامترها این شکاف را پر نخواهد کرد؛ عنصر مفقوده، مکانیزمی برای مشاهده کنترل‌شده و تکرارشونده است.

مسیرهای پیش رو

محققان یک جهت مکمل را پیشنهاد می‌کنند:

  • بازطراحی ساختاری – تعبیه یک ماژول بصری قابل کنترل که بتواند بر اساس وضعیت داخلی مدل، درخواست نماهای جدید کند، نواحی را برش دهد (crop) یا شرایط نورپردازی را تغییر دهد.

نکته کلیدی: مدل‌های LLM چندوجهی فعلی در پاسخ به سوالات مربوط به تصاویر ایستا عالی هستند، اما زمانی که یک مسئله مستلزم نگاه دوباره باشد، ناتوان می‌مانند. هوش بصری واقعی به مدل‌هایی نیاز خواهد داشت که بتوانند بینایی خود را کنترل کنند، نه اینکه فقط یک بار یک تصویر را بخوانند.