Penanda aras ActiveVision menunjukkan bahawa model bahasa besar (LLM) multimodal terkemuka hari ini hanya menyelesaikan 10.6% tugasan yang memerlukan imej dilihat lebih daripada sekali. Dalam ujian terhadap 17 cabaran persepsi-iteratif, manusia berjaya sebanyak 96.1% daripada masa, manakala GPT-5.5 hanya mencapai 10.6% dan Claude Fable 5 mencapai 3.5%; sebelas daripada tugasan tersebut tidak mendapat sebarang jawapan betul daripada model-model tersebut.

Mengapa model penglihatan semasa tersandung

Kebanyakan sistem penglihatan menganggap imej sebagai input sekali sahaja. Sebuah “vision encoder” mengekstrak ciri-ciri sekali, kemudian menyerahkannya kepada model bahasa untuk penaakulan. Saluran kerja (pipeline) tersebut tidak boleh meminta pandangan kedua, zum masuk pada sesuatu kawasan, atau menilai semula sesuatu hipotesis. Sebaliknya, manusia membuat tekaan awal, mengubah fokus, mengumpul bukti baharu, dan melaraskan jawapan mereka. Penanda aras ini memformalkan gelung tersebut: setiap tugasan memaksa model untuk memerhati, mencadangkan tindakan, memerhati hasil, dan mengulanginya sehingga ia mencapai kesimpulan yang betul.

Apa yang diuji oleh penanda aras tersebut

Penyelidik membina 17 senario yang memerlukan pemerhatian berulang kali. Keputusannya sangat ketara:

  • Peserta manusia: 96.1% kejayaan
  • GPT-5.5: 10.6% kejayaan
  • Claude Fable 5: 3.5% kejayaan
  • Sebelas tugasan: setiap model yang diuji mendapat skor sifar

Walaupun model menjana kod untuk memproses semula imej, mereka terlepas ralat dalam output mereka sendiri, mengesahkan bahawa had tersebut adalah bersifat seni bina (architectural) dan bukannya semata-mata dipacu oleh data.

Pertaruhan bagi pembangun dan industri

Jika anda sedang membina robot autonomi, dron pemeriksaan, atau mana-mana sistem yang mesti mengesahkan maklumat visual dari semasa ke semasa, model penglihatan "single-shot" adalah berisiko. Penanda aras ini menunjukkan bahawa saluran kerja penglihatan berasaskan LLM semasa tidak dapat mengendalikan persepsi berasaskan maklum balas dengan boleh dipercayai, jadi ia akan terlepas kecacatan, tersalah kira item, atau tersalah tafsir babak dinamik. Menambah lebih banyak data latihan atau meningkatkan parameter tidak akan merapatkan jurang tersebut; elemen yang hilang adalah mekanisme untuk pemerhatian iteratif yang terkawal.

Hujah balas: bolehkah model yang lebih besar membantu?

Menambah lebih banyak data latihan atau meningkatkan parameter tidak akan merapatkan jurang tersebut; elemen yang hilang adalah mekanisme untuk pemerhatian iteratif yang terkawal.

Jalan ke hadapan

Penyelidik mencadangkan hala tuju pelengkap:

  • Reka bentuk semula seni bina – menyematkan modul visual yang boleh dikawal yang boleh meminta pandangan baharu, memotong kawasan, atau mengubah keadaan pencahayaan berdasarkan keadaan dalaman model.

Rumusan: LLM multimodal semasa cemerlang dalam menjawab soalan imej statik tetapi gagal apabila sesuatu masalah memerlukan pemerhatian semula. Kecerdasan visual yang sebenar memerlukan model yang boleh mengawal penglihatan mereka sendiri, bukan sekadar membaca gambar sekali sahaja.