ਵਿਜ਼ਨ-ਲੈਂਗੂਏਜ ਮਾਡਲ (VLMs) ਅਜੇ ਵੀ ਮੁੱਢਲੇ ਵਿਜ਼ੂਅਲ ਕੰਮਾਂ ਵਿੱਚ ਅਸਫਲ ਰਹਿੰਦੇ ਹਨ। ਇੱਕ ਨਵੇਂ PerceptionBench ਮੁਲਾਂਕਣ ਵਿੱਚ ਪਾਇਆ ਗਿਆ ਹੈ ਕਿ ਸੋਲ਼ਹਾਂ ਪ੍ਰਮੁੱਖ ਪ੍ਰਣਾਲੀਆਂ ਵਿੱਚੋਂ ਕੋਈ ਵੀ ਕੁੱਲ ਮਿਲਾ ਕੇ 60% ਤੋਂ ਵੱਧ ਸ਼ੁੱਧਤਾ (accuracy) ਪ੍ਰਾਪਤ ਨਹੀਂ ਕਰ ਸਕਦੀ, ਅਤੇ ਸਭ ਤੋਂ ਮਜ਼ਬੂਤ ਮਾਡਲ ਵੀ ਕਿਸੇ ਵੀ ਵਿਅਕਤੀਗਤ ਹੁਨਰ 'ਤੇ 80% ਤੋਂ ਹੇਠਾਂ ਰਹਿੰਦਾ ਹੈ। ਇਹ ਨਤੀਜਾ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਚੇਤਾਵਨੀ ਦਿੰਦਾ ਹੈ ਕਿ ਪ੍ਰਸਿੱਧ ਕੈਪਸ਼ਨਿੰਗ ਜਾਂ ਤਰਕ (reasoning) ਟੈਸਟਾਂ ਵਿੱਚ ਉੱਚ ਸਕੋਰ ਭਰੋਸੇਯੋਗ ਨਜ਼ਰ ਦੀ ਗਾਰੰਟੀ ਨਹੀਂ ਦਿੰਦੇ।

ਮੌਜੂਦਾ ਟੈਸਟ ਸਮੱਸਿਆ ਨੂੰ ਕਿਉਂ ਛੁਪਾਉਂਦੇ ਹਨ

ਜ਼ਿਆਦਾਤਰ ਜਨਤਕ ਬੈਂਚਮਾਰਕਸ (benchmarks) ਤਸਵੀਰ ਦੇ ਵੇਰਵੇ, ਪ੍ਰਸ਼ਨ ਉੱਤਰ ਅਤੇ ਆਮ ਗਿਆਨ ਵਾਲੇ ਤਰਕ (commonsense reasoning) ਨੂੰ ਮਿਲਾ ਦਿੰਦੇ ਹਨ। ਜਦੋਂ ਕੋਈ ਮਾਡਲ ਗਲਤ ਕੈਪਸ਼ਨ ਦਿੰਦਾ ਹੈ, ਤਾਂ ਉਹ ਗਲਤੀ ਭਾਸ਼ਾ ਦੀ ਕਮੀ, ਤਰਕ ਦੀ ਗਲਤੀ, ਜਾਂ ਵਸਤੂ ਨੂੰ ਪਛਾਣਨ ਵਿੱਚ ਅਸਫਲਤਾ ਹੋ ਸਕਦੀ ਹੈ। ਕਿਉਂਕਿ ਇਹ ਤਿੰਨੋਂ ਹਿੱਸੇ ਆਪਸ ਵਿੱਚ ਗੁੰਝਲਦਾਰ ਤਰੀਕੇ ਨਾਲ ਜੁੜੇ ਹੋਏ ਹਨ, ਇਸ ਲਈ ਘੱਟ ਸਕੋਰ ਵਿਜ਼ੂਅਲ ਕਮੀ ਬਾਰੇ ਕੋਈ ਸੰਕੇਤ ਨਹੀਂ ਦਿੰਦਾ। ਇਸ ਲਈ ਐਪਲੀਕੇਸ਼ਨ ਬਣਾਉਣ ਵਾਲੀਆਂ ਟੀਮਾਂ ਮੁੱਖ ਅੰਕੜਿਆਂ ਤੋਂ ਵਧੇਰੇ ਆਤਮ-ਵਿਸ਼ਵਾਸ ਲੈ ਲੈਂਦੀਆਂ ਹਨ, ਇਹ ਮੰਨ ਕੇ ਕਿ ਮਾਡਲ ਸਹੀ ਤਰੀਕੇ ਨਾਲ "ਦੇਖ" ਰਿਹਾ ਹੈ।

PerceptionBench ਕੀ ਵੱਖਰਾ ਕਰਦਾ ਹੈ

PerceptionBench ਦਸ ਵਿਜ਼ੂਅਲ ਯੋਗਤਾਵਾਂ ਨੂੰ ਵੱਖ ਕਰਦਾ ਹੈ ਅਤੇ ਹਰੇਕ ਮਾਡਲ ਦਾ ਮੁਲਾਂਕਣ ਸ਼ੁੱਧ-ਵਿਜ਼ਨ (pure-vision) ਟਾਸਕ ਸੈੱਟ 'ਤੇ ਕਰਦਾ ਹੈ। ਭਾਸ਼ਾ ਅਤੇ ਤਰਕ ਨੂੰ ਹਟਾ ਕੇ, ਇਹ ਬੈਂਚਮਾਰਕ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਵਿਜ਼ੂਅਲ ਫਰੰਟ-ਐਂਡ ਆਪਣੇ ਆਪ ਵਿੱਚ ਕਿੰਨੀ ਚੰਗੀ ਤਰ੍ਹਾਂ ਕੰਮ ਕਰਦਾ ਹੈ। ਸਮੁੱਚੇ ਤੌਰ 'ਤੇ, ਸੋਲ਼ਹਾਂ ਪ੍ਰਮੁੱਖ VLMs 60% ਦੀ ਸ਼ੁੱਧਤਾ ਦੀ ਸੀਮਾ ਤੋਂ ਪਿੱਛੇ ਰਹਿ ਜਾਂਦੇ ਹਨ, ਅਤੇ ਸਭ ਤੋਂ ਵਧੀਆ ਪ੍ਰਦਰਸ਼ਨ ਕਰਨ ਵਾਲੀ ਪ੍ਰਣਾਲੀ ਕਿਸੇ ਵੀ ਇੱਕ ਹੁਨਰ 'ਤੇ 80% ਤੱਕ ਨਹੀਂ ਪਹੁੰਚਦੀ। ਹੈਲੂਸੀਨੇਸ਼ਨ (Hallucination)—ਅਜਿਹੀਆਂ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਪੈਦਾ ਕਰਨਾ ਜੋ ਤਸਵੀਰ ਵਿੱਚ ਨਹੀਂ ਹਨ—ਸਭ ਤੋਂ ਆਮ ਗਲਤੀ ਹੈ, ਜਦੋਂ ਕਿ ਮਾਡਲਾਂ ਦੇ ਵਿਚਕਾਰ ਤਾਕਤ ਅਤੇ ਕਮਜ਼ੋਰੀਆਂ ਦਾ ਪੈਟਰਨ ਬਹੁਤ ਵੱਖਰਾ ਹੁੰਦਾ ਹੈ।

ਕਿਸ ਦਾ ਨੁਕਸਾਨ ਹੋ ਸਕਦਾ ਹੈ

ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਸਮਰਪਿਤ ਵਿਜ਼ੂਅਲ ਕਲਾਸੀਫਾਇਰਾਂ (visual classifiers) ਨੂੰ ਆਮ AI ਮਾਡਲਾਂ ਨਾਲ ਨਹੀਂ ਬਦਲਣਾ ਚਾਹੀਦਾ।

ਜਿੱਥੇ ਦਲੀਲ ਕਮਜ਼ੋਰ ਪੈਂਦੀ ਹੈ

PerceptionBench ਦਾ ਡੇਟਾ ਘਟਦੇ ਹੋਏ ਲਾਭਾਂ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ: ਵੱਡੇ ਤੋਂ ਵੱਡੇ ਮਾਡਲ ਵੀ ਅਜੇ ਵੀ ਬੁਨਿਆਦੀ ਪੈਰਸੈਪਸ਼ਨ (perception) ਕੰਮਾਂ ਵਿੱਚ ਅਸਫਲ ਹੋ ਰਹੇ ਹਨ।

ਡਿਵੈਲਪਰਾਂ ਲਈ ਵਿਵਹਾਰਕ ਕਦਮ

  • ਸਮਰਪਿਤ ਵਿਜ਼ੂਅਲ ਕਲਾਸੀਫਾਇਰ ਰੱਖੋ ਉਹਨਾਂ ਕੰਮਾਂ ਲਈ ਜਿਨ੍ਹਾਂ ਵਿੱਚ ਸਟੀਕਤਾ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ; VLMs ਨੂੰ ਬਦਲ ਵਜੋਂ ਨਹੀਂ ਬਲਕਿ ਪੂਰਕ ਵਜੋਂ ਵਰਤੋ।
  • ਇੱਕ ਵੈਰੀਫਿਕੇਸ਼ਨ ਲੇਅਰ ਜੋੜੋ ਜੋ ਯੂਜ਼ਰ ਤੱਕ ਪਹੁੰਚਣ ਤੋਂ ਪਹਿਲਾਂ ਮਾਡਲ ਦੇ ਆਉਟਪੁੱਟ ਦੀ ਭਰੋਸੇਯੋਗ ਡਿਟੈਕਟਰ ਨਾਲ ਜਾਂਚ ਕਰੇ।
  • ਇੱਕ ਹਲਕਾ ਵਿਜ਼ਨ ਫਿਲਟਰ ਲਾਗੂ ਕਰੋ ਤਾਂ ਜੋ ਪਾਈਪਲਾਈਨ ਦੇ ਸ਼ੁਰੂ ਵਿੱਚ ਹੀ ਸਪੱਸ਼ਟ ਹੈਲੂਸੀਨੇਸ਼ਨ ਜਾਂ ਗਲਤ ਕਲਾਸੀਫਿਕੇਸ਼ਨ ਨੂੰ ਫੜਿਆ ਜਾ ਸਕੇ।

ਇੱਕ ਆਮ-ਮੰਨਿਆ VLM ਨੂੰ ਵਿਸ਼ੇਸ਼ ਤੌਰ 'ਤੇ ਬਣਾਏ ਗਏ ਵਿਜ਼ਨ ਕੰਪੋਨੈਂਟ ਨਾਲ ਜੋੜਨਾ ਟੀਮਾਂ ਨੂੰ ਪਹਿਲੇ ਦੀ ਤਰਕ ਸ਼ਕਤੀ ਦੀ ਵਰਤੋਂ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ ਅਤੇ ਨਾਲ ਹੀ ਇਸਦੀਆਂ ਵਿਜ਼ੂਅਲ ਕਮੀਆਂ (blind spots) ਤੋਂ ਬਚਾਅ ਕਰਦਾ ਹੈ।

ਸਰੋਤ: https://dev.to/olaughter/vision-language-models-cap-at-sixty-percent-accuracy-nj1