ActiveVision ਬੈਂਚਮਾਰਕ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਅੱਜ ਦੇ ਪ੍ਰਮੁੱਖ ਮਲਟੀਮੋਡਲ ਲਾਰਜ ਲੈਂਗੂਏਜ ਮਾਡਲ (LLMs) ਉਨ੍ਹਾਂ ਕੰਮਾਂ ਦਾ ਸਿਰਫ਼ 10.6% ਹੱਲ ਕਰ ਪਾਏ ਹਨ ਜਿਨ੍ਹਾਂ ਲਈ ਇੱਕ ਤਸਵੀਰ ਨੂੰ ਇੱਕ ਤੋਂ ਵੱਧ ਵਾਰ ਦੇਖਣ ਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ। 17 ਇਟਰੇਟਿਵ-ਪਰਸੈਪਸ਼ਨ ਚੁਣੌਤੀਆਂ ਦੇ ਇੱਕ ਟੈਸਟ ਵਿੱਚ, ਇਨਸਾਨ 96.1% ਵਾਰ ਸਫਲ ਰਹੇ ਜਦੋਂ ਕਿ GPT-5.5 ਨੇ 10.6% ਅਤੇ Claude Fable 5 ਨੇ 3.5% ਪ੍ਰਾਪਤ ਕੀਤੇ; ਗਿਆਰਾਂ ਕੰਮਾਂ ਵਿੱਚ ਮਾਡਲਾਂ ਵੱਲੋਂ ਇੱਕ ਵੀ ਸਹੀ ਜਵਾਬ ਨਹੀਂ ਮਿਲਿਆ।

ਮੌਜੂਦਾ ਵਿਜ਼ਨ ਮਾਡਲ ਕਿਉਂ ਅਸਫਲ ਹੁੰਦੇ ਹਨ

ਜ਼ਿਆਦਾਤਰ ਵਿਜ਼ਨ ਸਿਸਟਮ ਇੱਕ ਤਸਵੀਰ ਨੂੰ ਸਿਰਫ਼ ਇੱਕ ਵਾਰ ਦੇ ਦਿੱਤੇ ਜਾਣ ਵਾਲੇ ਇਨਪੁਟ ਵਜੋਂ ਮੰਨਦੇ ਹਨ। ਇੱਕ “ਵਿਜ਼ਨ ਇਨਕੋਡਰ” ਇੱਕ ਵਾਰ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ (features) ਕੱਢਦਾ ਹੈ, ਫਿਰ ਤਰਕ ਕਰਨ ਲਈ ਉਹਨਾਂ ਨੂੰ ਲੈਂਗੂਏਜ ਮਾਡਲ ਨੂੰ ਸੌਂਪ ਦਿੰਦਾ ਹੈ। ਇਹ ਪਾਈਪਲਾਈਨ ਦੂਜੀ ਵਾਰ ਦੇਖਣ ਦੀ ਬੇਨਤੀ ਨਹੀਂ ਕਰ ਸਕਦੀ, ਕਿਸੇ ਖਾਸ ਹਿੱਸੇ ਨੂੰ ਜ਼ੂਮ ਨਹੀਂ ਕਰ ਸਕਦੀ, ਜਾਂ ਕਿਸੇ ਅਨੁਮਾਨ ਦਾ ਮੁੜ ਮੁਲਾਂਕਣ ਨਹੀਂ ਕਰ ਸਕਦੀ। ਇਸਦੇ ਉਲਟ, ਇਨਸਾਨ ਇੱਕ ਸ਼ੁਰੂਆਤੀ ਅੰਦਾਜ਼ਾ ਲਗਾਉਂਦੇ ਹਨ, ਧਿਆਨ ਬਦਲਦੇ ਹਨ, ਨਵੇਂ ਸਬੂਤ ਇਕੱਠੇ ਕਰਦੇ ਹਨ ਅਤੇ ਆਪਣੇ ਜਵਾਬ ਨੂੰ ਸੁਧਾਰਦੇ ਹਨ। ਇਹ ਬੈਂਚਮਾਰਕ ਉਸੇ ਚੱਕਰ ਨੂੰ ਰੂਪ ਦਿੰਦਾ ਹੈ: ਹਰ ਕੰਮ ਮਾਡਲ ਨੂੰ ਦੇਖਣ, ਇੱਕ ਕਾਰਵਾਈ ਦਾ ਪ੍ਰਸਤਾਵ ਦੇਣ, ਨਤੀਜੇ ਨੂੰ ਦੇਖਣ ਅਤੇ ਇੱਕ ਸਹੀ ਸਿੱਟੇ 'ਤੇ ਪਹੁੰਚਣ ਤੱਕ ਇਸੇ ਪ੍ਰਕਿਰਿਆ ਨੂੰ ਦੁਹਰਾਉਣ ਲਈ ਮਜਬੂਰ ਕਰਦਾ ਹੈ।

ਬੈਂਚਮਾਰਕ ਨੇ ਕੀ ਟੈਸਟ ਕੀਤਾ

ਖੋਜਕਰਤਾਵਾਂ ਨੇ 17 ਅਜਿਹੇ ਸਥਿਤੀਆਂ ਤਿਆਰ ਕੀਤੀਆਂ ਜਿਨ੍ਹਾਂ ਲਈ ਵਾਰ-ਵਾਰ ਦੇਖਣ ਦੀ ਲੋੜ ਸੀ। ਨਤੀਜੇ ਬਹੁਤ ਹੀ ਸਪੱਸ਼ਟ ਹਨ:

  • ਮਨੁੱਖੀ ਭਾਗੀਦਾਰ: 96.1% ਸਫਲਤਾ
  • GPT-5.5: 10.6% ਸਫਲਤਾ
  • Claude Fable 5: 3.5% ਸਫਲਤਾ
  • ਗਿਆਰਾਂ ਕੰਮ: ਟੈਸਟ ਕੀਤੇ ਗਏ ਹਰ ਮਾਡਲ ਦਾ ਸਕੋਰ ਜ਼ੀਰੋ ਰਿਹਾ

ਭਾਵੇਂ ਮਾਡਲਾਂ ਨੇ ਤਸਵੀਰ ਨੂੰ ਮੁੜ ਪ੍ਰੋਸੈਸ ਕਰਨ ਲਈ ਕੋਡ ਤਿਆਰ ਕੀਤਾ, ਫਿਰ ਵੀ ਉਹ ਆਪਣੇ ਹੀ ਆਉਟਪੁੱਟ ਵਿੱਚ ਗਲਤੀਆਂ ਨੂੰ ਨਹੀਂ ਫੜ ਸਕੇ, ਜੋ ਇਹ ਪੁਸ਼ਟੀ ਕਰਦਾ ਹੈ ਕਿ ਇਹ ਸੀਮਾ ਸਿਰਫ਼ ਡੇਟਾ-ਡ੍ਰਿਵਨ ਹੋਣ ਦੀ ਬਜਾਏ ਆਰਕੀਟੈਕਚਰਲ ਹੈ।

ਡਿਵੈਲਪਰਾਂ ਅਤੇ ਉਦਯੋਗ ਲਈ ਜੋਖਮ

ਜੇਕਰ ਤੁਸੀਂ ਆਟੋਨੋਮਸ ਰੋਬੋਟ, ਨਿਰੀਖਣ ਡਰੋਨ, ਜਾਂ ਕੋਈ ਅਜਿਹਾ ਸਿਸਟਮ ਬਣਾ ਰਹੇ ਹੋ ਜਿਸ ਨੂੰ ਸਮੇਂ ਦੇ ਨਾਲ ਵਿਜ਼ੂਅਲ ਜਾਣਕਾਰੀ ਦੀ ਪੁਸ਼ਟੀ ਕਰਨੀ ਪੈਂਦੀ ਹੈ, ਤਾਂ ਇੱਕ ਸਿੰਗਲ-ਸ਼ੌਟ ਵਿਜ਼ਨ ਮਾਡਲ ਜੋਖਮ ਭਰਿਆ ਹੋ ਸਕਦਾ ਹੈ। ਬੈਂਚਮਾਰਕ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਮੌਜੂਦਾ LLM-ਅਧਾਰਤ ਵਿਜ਼ਨ ਪਾਈਪਲਾਈਨਾਂ ਫੀਡਬੈਕ-ਡ੍ਰਿਵਨ ਪਰਸੈਪਸ਼ਨ ਨੂੰ ਭਰੋਸੇਯੋਗ ਤਰੀਕੇ ਨਾਲ ਸੰਭਾਲ ਨਹੀਂ ਸਕਦੀਆਂ, ਇਸ ਲਈ ਉਹ ਨੁਕਸਾਂ ਨੂੰ ਦੇਖਣ ਵਿੱਚ ਅਸਫਲ ਰਹਿ ਸਕਦੀਆਂ ਹਨ, ਵਸਤੂਆਂ ਦੀ ਗਲਤ ਗਿਣਤੀ ਕਰ ਸਕਦੀਆਂ ਹਨ, ਜਾਂ ਗਤੀਸ਼ੀਲ ਦ੍ਰਿਸ਼ਾਂ ਦੀ ਗਲਤ ਵਿਆਖਿਆ ਕਰ ਸਕਦੀਆਂ ਹਨ। ਵਧੇਰੇ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਜੋੜਨਾ ਜਾਂ ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਵਧਾਉਣਾ ਇਸ ਪਾੜੇ ਨੂੰ ਖਤਮ ਨਹੀਂ ਕਰੇਗਾ; ਇਸ ਵਿੱਚ ਜੋ ਚੀਜ਼ ਘਾਟ ਹੈ ਉਹ ਹੈ ਨਿਯੰਤਰਿਤ, ਇਟਰੇਟਿਵ ਨਿਰੀਖਣ ਲਈ ਇੱਕ ਵਿਧੀ।

ਵਿਰੋਧੀ ਦਲੀਲ: ਕੀ ਵੱਡੇ ਮਾਡਲ ਮਦਦ ਕਰ ਸਕਦੇ ਹਨ?

ਵਧੇਰੇ ਟ੍ਰੇਨਿੰਗ ਡੇਟਾ ਜੋੜਨਾ ਜਾਂ ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਵਧਾਉਣਾ ਇਸ ਪਾੜੇ ਨੂੰ ਖਤਮ ਨਹੀਂ ਕਰੇਗਾ; ਇਸ ਵਿੱਚ ਜੋ ਚੀਜ਼ ਘਾਟ ਹੈ ਉਹ ਹੈ ਨਿਯੰਤਰਿਤ, ਇਟਰੇਟਿਵ ਨਿਰੀਖਣ ਲਈ ਇੱਕ ਵਿਧੀ।

ਅੱਗੇ ਵਧਣ ਦੇ ਰਾਹ

ਖੋਜਕਰਤਾ ਇੱਕ ਪੂਰਕ ਦਿਸ਼ਾ ਦਾ ਸੁਝਾਅ ਦਿੰਦੇ ਹਨ:

  • ਆਰਕੀਟੈਕਚਰਲ ਰੀਡਿਜ਼ਾਈਨ – ਇੱਕ ਨਿਯੰਤਰਣਯੋਗ ਵਿਜ਼ੂਅਲ ਮੋਡਿਊਲ ਨੂੰ ਸ਼ਾਮਲ ਕਰਨਾ ਜੋ ਮਾਡਲ ਦੀ ਅੰਦਰੂਨੀ ਸਥਿਤੀ ਦੇ ਅਧਾਰ 'ਤੇ ਨਵੇਂ ਵਿਊ