OpenAI ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਉਸਦੇ GPT-5.6 Sol ਮਾਡਲ ਨੇ ARC-AGI-3 ਲੌਜੀਕਲ-ਰੀਜ਼ਨਿੰਗ ਬੈਂਚਮਾਰਕ 'ਤੇ 38.3 % ਦੀ ਸਫਲਤਾ ਦਰ ਹਾਸਲ ਕੀਤੀ ਹੈ, ਜੋ Anthropic ਦੇ Claude Opus 5 (30.2 %) ਤੋਂ ਕਿਤੇ ਅੱਗੇ ਹੈ। ਇਹ ਲੀਡ ਉਦੋਂ ਹੀ ਦਿਖਾਈ ਦਿੰਦੀ ਹੈ ਜਦੋਂ ਮਾਡਲ OpenAI ਦੇ ਕਸਟਮ Responses API ਰਾਹੀਂ ਚੱਲਦਾ ਹੈ, ਜੋ ਦੋ ਅਜਿਹੇ ਇਨਫਰੈਂਸ-ਟਾਈਮ (inference-time) ਤਰੀਕੇ ਜੋੜਦਾ ਹੈ ਜਿਨ੍ਹਾਂ ਦੀ ਅਧਿਕਾਰਤ ਟੈਸਟ ਹਾਰਨੈਸ (test harness) ਇਜਾਜ਼ਤ ਨਹੀਂ ਦਿੰਦੀ।
ਪਿਛੋਕੜ: ਇੱਕ ਬੈਂਚਮਾਰਕ ਹਥਿਆਰਾਂ ਦੀ ਦੌੜ
ARC-AGI-3 ਕਿਸੇ ਮਾਡਲ ਦੀ ਯਾਦ ਕੀਤੇ ਹੋਏ ਤੱਥਾਂ 'ਤੇ ਨਿਰਭਰ ਕੀਤੇ ਬਿਨਾਂ ਨਵੇਂ, ਬਹੁ-ਪੜਾਵੀ (multi-step) ਸਵਾਲਾਂ ਨੂੰ ਹੱਲ ਕਰਨ ਦੀ ਯੋਗਤਾ ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ। ਇਸ ਸਾਲ ਦੇ ਸ਼ੁਰੂ ਵਿੱਚ Anthropic ਨੇ ਇਸ ਬੈਂਚਮਾਰਕ 'ਤੇ ਚਾਰ ਗੁਣਾ ਵਾਧੇ ਦਾ ਐਲਾਨ ਕੀਤਾ ਸੀ, ਜਿਸ ਨਾਲ Opus 5 ਜਨਤਕ ਲੀਡਰਬੋਰਡ ਦੇ ਸਿਖਰ 'ਤੇ ਪਹੁੰਚ ਗਿਆ ਸੀ। ਉਸ ਨਤੀਜੇ ਨੇ "ਰਅ" (raw) ਮਾਡਲ ਸਮਰੱਥਾ ਲਈ ਇੱਕ ਨਵਾਂ ਮਾਪਦੰਡ ਸਥਾਪਿਤ ਕੀਤਾ ਕਿਉਂਕਿ ਅਧਿਕਾਰਤ ਹਾਰਨੈਸ ਹਰ ਕਦਮ ਤੋਂ ਬਾਅਦ ਕਿਸੇ ਵੀ ਵਿਚਕਾਰਲੇ ਤਰਕ (intermediate reasoning) ਨੂੰ ਰੱਦ ਕਰ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਮਾਡਲ ਨੂੰ ਹਰ ਵਾਰ ਨਵੇਂ ਸਿਰੇ ਤੋਂ ਸ਼ੁਰੂ ਕਰਨ ਲਈ ਮਜਬੂਰ ਕੀਤਾ ਜਾਂਦਾ ਹੈ।
OpenAI ਦਾ ਇਹ ਦਾਅਵਾ ਵੀ ਉਸੇ ਮੁਕਾਬਲੇ ਵਾਲੇ ਮਾਹੌਲ ਵਿੱਚ ਆਇਆ ਹੈ। ਇੱਕ ਉੱਚਾ ਸਕੋਰ ਪ੍ਰਕਾਸ਼ਿਤ ਕਰਕੇ, ਕੰਪਨੀ ਇਹ ਸੰਕੇਤ ਦੇ ਰਹੀ ਹੈ ਕਿ ਉਸਦੀ ਤਾਜ਼ਾ ਪੀੜ੍ਹੀ ਨਾ ਸਿਰਫ਼ ਆਪਣੇ ਮੁੱਖ ਵਿਰੋਧੀ ਦੀ ਲੌਜੀਕਲ ਕਾਰਗੁਜ਼ਾਰੀ ਦੇ ਬਰਾਬਰ ਆ ਸਕਦੀ ਹੈ, ਸਗੋਂ ਉਸ ਤੋਂ ਅੱਗੇ ਵੀ ਨਿਕਲ ਸਕਦੀ ਹੈ। ਹਾਲਾਂਕਿ, ਇਹ ਹੈੱਡਲਾਈਨ ਇੱਕ ਤਕਨੀਕੀ ਸੂਖਮਤਾ (nuance) ਨੂੰ ਛੁਪਾਉਂਦੀ ਹੈ ਜੋ ਇਸ ਗੱਲ ਨੂੰ ਬਦਲ ਰਹੀ ਹੈ ਕਿ ਕਮਿਊਨਿਟੀ ਬੈਂਚਮਾਰਕ ਟੇਬਲਾਂ ਨੂੰ ਕਿਵੇਂ ਪੜ੍ਹਦੀ ਹੈ।
ਅੰਕੜਿਆਂ ਦਾ ਅਸਲ ਮਤਲਬ ਕੀ ਹੈ
ਜਦੋਂ GPT-5.6 Sol ਦਾ ਮੁਲਾਂਕਣ ਉਸੇ ਅਧਿਕਾਰਤ ARC-AGI-3 ਹਾਰਨੈਸ ਦੇ ਅਧੀਨ ਕੀਤਾ ਜਾਂਦਾ ਹੈ ਜਿਸ ਨੇ Opus 5 ਨੂੰ 30.2 % ਦਾ ਨਤੀਜਾ ਦਿੱਤਾ ਸੀ, ਤਾਂ ਮਾਡਲ ਦੀ ਸਫਲਤਾ ਦਰ ਡਿੱਗ ਕੇ ਸਿਰਫ਼ 7.8 % ਰਹਿ ਜਾਂਦੀ ਹੈ। ਇਹ ਵੱਡਾ ਫਰਕ ਕੋਈ ਗਲਤੀ ਨਹੀਂ ਹੈ; ਇਹ OpenAI ਦੁਆਰਾ ਮਾਡਲ ਦੇ ਨਾਲ ਦਿੱਤੇ ਗਏ ਦੋ ਇੰਜੀਨੀਅਰਡ ਫੀਚਰਾਂ ਦਾ ਨਤੀਜਾ ਹੈ:
- Retained Reasoning – ਹਰ ਸਬ-ਟਾਸਕ ਤੋਂ ਬਾਅਦ ਚੇਨ-ਆਫ-ਥੌਟ (chain-of-thought) ਨੂੰ ਮਿਟਾਉਣ ਦੀ ਬਜਾਏ, ਸਿਸਟਮ ਵਿਚਕਾਰਲੇ ਟੈਕਸਟ ਨੂੰ ਜਿਉਂਦਾ ਰੱਖਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਮਾਡਲ ਪਹਿਲਾਂ ਦੇ ਅਨੁਮਾਨਾਂ ਦਾ ਹਵਾਲਾ ਦੇ ਸਕਦਾ ਹੈ ਅਤੇ ਇੱਕ ਇਕੱਠਾ ਤਰਕ ਬਣਾ ਸਕਦਾ ਹੈ।
- Compaction – ਟੋਕਨ ਸੀਮਾਵਾਂ ਦੇ ਅੰਦਰ ਰਹਿਣ ਲਈ ਪੁਰਾਣੇ ਸੰਦਰਭ (context) ਨੂੰ ਕੱਟਣ ਦੀ ਬਜਾਏ, ਵੈਪਰ (wrapper) ਪਿਛਲੇ ਕਦਮਾਂ ਨੂੰ ਇੱਕ ਸੰਖੇਪ ਸਾਰ ਵਿੱਚ ਸੰਕੁਚਿਤ ਕਰ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਪ੍ਰੋਂਪਟ ਦੇ ਆਕਾਰ ਨੂੰ ਕਾਬੂ ਵਿੱਚ ਰੱਖਦੇ ਹੋਏ ਲੌਜੀਕਲ ਧਾਗੇ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਿਆ ਜਾਂਦਾ ਹੈ।
ਇਹ ਦੋਵੇਂ ਵਿਧੀਆਂ ਪ੍ਰੋਪਰਾਈਟਰੀ Responses API ਵਿੱਚ ਮੌਜੂਦ ਹਨ। ਮਾਡਲ ਨੂੰ ਇੱਕ ਅਮੀਰ ਅਤੇ ਨਿਰੰਤਰ ਸੰਦਰਭ ਦੇ ਕੇ, OpenAI ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਢੰਗ ਨਾਲ ਮਾਡਲ ਦੀ "ਯਾਦਦਾਸ਼ਤ" ਨੂੰ ਵਧਾਉਂਦਾ ਹੈ ਅਤੇ ਇਸਨੂੰ ਆਪਣੇ ਤਰਕ ਨੂੰ ਦੁਬਾਰਾ ਵਰਤਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ। ਇਸਦੇ ਉਲਟ, ਅਧਿਕਾਰਤ ਹਾਰਨੈਸ ਇੱਕ ਸਖ਼ਤ "ਸਟੇਟਲੈੱਸ" (stateless) ਮੋਡ ਲਾਗੂ ਕਰਦਾ ਹੈ ਜੋ ਉਹਨਾਂ ਫਾਇਦਿਆਂ ਨੂੰ ਖਤਮ ਕਰ ਦਿੰਦਾ ਹੈ।
ਵਿਧੀ (Methodology) ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ
ਇਹ ਘਟਨਾ AI ਮੁਲਾਂਕਣ ਵਿੱਚ ਵਧ ਰਹੇ ਵਿਭਾਜਨ ਨੂੰ ਉਜਾਗਰ ਕਰਦੀ ਹੈ: ਰਅ (raw) ਮਾਡਲ ਸਕੋਰ ਬਨਾਮ ਸਿਸਟਮ-ਪੱਧਰੀ ਕਾਰਗੁਜ਼ਾਰੀ। OpenAI ਦਾ ਤਰਕ ਹੈ ਕਿ ਇੱਕ ਬੈਂਚਮਾਰਕ ਨੂੰ ਉਸ ਪੂਰੇ ਸਟੈਕ ਨੂੰ ਦਰਸਾਉਣਾ ਚਾਹੀਦਾ ਹੈ ਜਿਸ ਨੂੰ ਡਿਵੈਲਪਰ ਅਸਲ ਵਿੱਚ ਤੈਨਾਤ (deploy) ਕਰਨਗੇ – ਮਾਡਲ, ਇਨਫਰੈਂਸ ਪਾਈਪਲਾਈਨ, ਅਤੇ ਮੈਮੋਰੀ ਮੈਨੇਜਮੈਂਟ। ਉਸ ਨਜ਼ਰੀਏ ਤੋਂ, 38.3 % ਦਾ ਸਕੋਰ ਇੱਕ ਪ੍ਰੋਡਕਟ ਟੀਮ ਨੂੰ ਦੱਸਦਾ ਹੈ ਕਿ ਇਹ ਸਾਂਝੀ ਪੇਸ਼ਕਸ਼ ਇਕੱਲੇ ਮੁਲਾਂਕਣ ਕੀਤੇ ਗਏ ਮਾਡਲ ਨਾਲੋਂ ਵਧੇਰੇ ਅਸਲ-ਦੁਨੀਆ ਦੇ ਕੰਮਾਂ ਨੂੰ ਹੱਲ ਕਰ ਸਕਦੀ ਹੈ।
ਆਲੋਚਕਾਂ ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਇਹ ਵਿਗਿਆਨਕ ਤਰੱਕੀ ਨੂੰ ਉਲਝਾਉਂਦਾ ਹੈ। ਜੇਕਰ ਹਰ ਲੈਬ ਆਪਣੇ ਖਾਸ ਵੈਪਰ (wrappers) ਜੋੜਦੀ ਹੈ, ਤਾਂ ਲੀਡਰਬੋਰਡ ਮਾਡਲ ਦੀ ਬੁੱਧੀ ਦੀ ਸਾਫ਼ ਤੁਲਨਾ ਹੋਣ ਦੀ ਬਜਾਏ ਇੰਜੀਨੀਅਰਿੰਗ ਤਰੀਕਿਆਂ ਦਾ ਇੱਕ ਮਿਸ਼ਰਣ ਬਣ ਜਾਵੇਗਾ। ਅਧਿਕਾਰਤ ARC-AGI-3 ਹਾਰਨੈਸ ਖੇਡ ਦੇ ਮੈਦਾਨ ਨੂੰ ਬਰਾਬਰ ਰੱਖਣ ਲਈ ਮੌਜੂਦ ਹੈ, ਇਹ ਯਕੀਨੀ ਬਣਾਉਣ ਲਈ ਕਿ ਉੱਚਾ ਅੰਕ ਇੱਕ ਅਸਲ ਵਿੱਚ ਮਜ਼ਬੂਤ ਮੂਲ ਮਾਡਲ ਦਾ ਸੰਕੇਤ ਹੈ, ਨਾ ਕਿ ਇੱਕ ਸਮਾਰਟ ਵੈਪਰ ਦਾ।
ਡਿਵੈਲਪਰਾਂ ਅਤੇ ਨ
ਕੁਝ ਖੋਜਕਰਤਾ ਕਸਟਮ APIs ਦੀ ਵਰਤੋਂ ਨੂੰ “benchmark gaming” ਵਜੋਂ ਦਰਜ ਕਰਦੇ ਹਨ,
