I modelli vision-language (VLM) non riescono ancora a centrare l'obiettivo nei compiti visivi elementari. Una nuova valutazione di PerceptionBench ha rilevato che nessuno dei sedici sistemi leader supera il 60% di accuratezza complessiva, e anche il più forte rimane sotto l'80% in qualsiasi singola abilità. Il risultato avverte gli sviluppatori che punteggi elevati nei popolari test di captioning o di ragionamento non garantiscono una visione affidabile.

Perché i test esistenti nascondono il problema

La maggior parte dei benchmark pubblici mescola descrizione delle immagini, question answering e ragionamento di senso comune. Quando un modello genera una didascalia errata, l'errore potrebbe essere un'imprecisione linguistica, un errore di ragionamento o un semplice fallimento nel riconoscere l'oggetto. Poiché i tre componenti sono intrecciati, un punteggio basso non fornisce indizi sulla carenza visiva. Di conseguenza, i team che sviluppano applicazioni traggono una fiducia eccessiva dai numeri principali, assumendo che il modello "veda" correttamente.

Cosa fa di diverso PerceptionBench

PerceptionBench isola dieci abilità visive e valuta ogni modello su un set di compiti di pura visione. Eliminando il linguaggio e il ragionamento, il benchmark mostra quanto funzioni bene il front-end visivo da solo. In generale, i sedici migliori VLM non raggiungono la soglia del 60% di accuratezza, e il sistema con le prestazioni migliori non raggiunge mai l'80% in alcuna singola abilità. L'allucinazione — ovvero la produzione di dettagli non presenti nell'immagine — è l'errore più comune, mentre il pattern di punti di forza e di debolezza varia ampiamente tra i modelli.

Chi rischia di perdere

Gli sviluppatori non dovrebbero sostituire i classificatori visivi dedicati con modelli di IA generica.

Dove l'argomentazione vacilla

I dati di PerceptionBench mostrano rendimenti decrescenti: anche i modelli più grandi inciampano ancora in compiti di percezione di base.

Passaggi pratici per gli sviluppatori

  • Mantenere classificatori visivi dedicati per i compiti che richiedono precisione; trattare i VLM come complementari piuttosto che come sostituti.
  • Aggiungere uno strato di verifica che incroci gli output del modello con un rilevatore affidabile prima che raggiungano l'utente.
  • Implementare un filtro visivo leggero per intercettare precocemente allucinazioni o classificazioni errate evidenti nella pipeline.

Abbinare un VLM general-purpose a un componente di visione costruito ad hoc consente ai team di sfruttare le capacità di ragionamento del primo, proteggendosi al contempo dai suoi punti ciechi visivi.

Fonte: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1