Model bahasa-visi (VLM) masih belum mencapai target pada tugas-tugas visual dasar. Evaluasi PerceptionBench yang baru menemukan bahwa tidak ada satu pun dari enam belas sistem terkemuka yang melampaui akurasi 60% secara keseluruhan, dan bahkan yang terkuat sekalipun tetap berada di bawah 80% pada keterampilan individu apa pun. Hasil ini memperingatkan para pengembang bahwa skor tinggi pada tes captioning atau penalaran yang populer tidak menjamin penglihatan yang andal.
Mengapa pengujian yang ada menyembunyikan masalah tersebut
Sebagian besar tolok ukur (benchmark) publik mencampuradukkan deskripsi gambar, menjawab pertanyaan, dan penalaran akal sehat. Ketika sebuah model mengeluarkan caption yang salah, kesalahan tersebut bisa berupa kekeliruan bahasa, kesalahan penalaran, atau kegagalan sederhana dalam mengenali objek. Karena ketiga komponen tersebut saling terkait, skor yang buruk tidak memberikan petunjuk tentang kekurangan visualnya. Oleh karena itu, tim yang membangun aplikasi mendapatkan kepercayaan diri yang berlebihan dari angka-angka utama, dengan asumsi bahwa model tersebut "melihat" dengan benar.
Apa yang dilakukan PerceptionBench secara berbeda
PerceptionBench mengisolasi sepuluh kemampuan visual dan mengevaluasi setiap model pada set tugas visi murni. Dengan menyingkirkan aspek bahasa dan penalaran, tolok ukur ini menunjukkan seberapa baik bagian visual depan (front-end) bekerja secara mandiri. Secara keseluruhan, enam belas VLM teratas gagal mencapai ambang batas akurasi 60%, dan sistem dengan performa terbaik tidak pernah mencapai 80% pada satu keterampilan pun. Halusinasi—menghasilkan detail yang tidak ada dalam gambar—adalah kesalahan yang paling umum, sementara pola kekuatan dan kelemahan sangat bervariasi di antara model-model tersebut.
Siapa yang akan dirugikan
Pengembang sebaiknya tidak mengganti klasifikasi visual khusus dengan model AI umum.
Di mana argumen ini goyah
Data PerceptionBench menunjukkan hasil yang semakin menurun: bahkan model terbesar sekalipun masih tersandung pada tugas-tugas persepsi dasar.
Langkah praktis bagi pengembang
- Tetap gunakan klasifikasi visual khusus untuk tugas-tugas yang menuntut presisi; perlakukan VLM sebagai pelengkap, bukan pengganti.
- Tambahkan lapisan verifikasi yang memeriksa ulang output model terhadap detektor tepercaya sebelum sampai ke pengguna.
- Terapkan filter visi ringan untuk menangkap halusinasi atau salah klasifikasi yang jelas sejak dini dalam pipeline.
Memasangkan VLM serbaguna dengan komponen visi yang dibuat khusus memungkinkan tim untuk menggunakan kemampuan penalaran dari VLM tersebut sambil tetap waspada terhadap titik buta visualnya.
Sumber: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1
