OpenAI ਨੇ ਐਲਾਨ ਕੀਤਾ ਕਿ ਉਸਦੇ GPT-5.6 Sol ਮਾਡਲ ਨੇ ARC-AGI-3 ਲੌਜਿਕ ਬੈਂਚਮਾਰਕ 'ਤੇ 38.3 ਪ੍ਰਤੀਸ਼ਤ ਸਕੋਰ ਹਾਸਲ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ Anthropic ਦੇ Claude Opus 5 (30.2 ਪ੍ਰਤੀਸ਼ਤ) ਤੋਂ ਕਿਤੇ ਜ਼ਿਆਦਾ ਹੈ। ਇਸ ਦਾਅਵੇ ਨੇ ਤੁਰੰਤ ਇੱਕ ਤਕਨੀਕੀ ਵਿਵਾਦ ਨੂੰ ਜਨਮ ਦਿੱਤਾ ਕਿਉਂਕਿ ਜਦੋਂ ਇਸੇ ਮਾਡਲ ਨੂੰ ਬੈਂਚਮਾਰਕ ਦੇ ਅਧਿਕਾਰਤ ਟੈਸਟ ਹਾਰਨੈਸ (test harness) ਰਾਹੀਂ ਚਲਾਇਆ ਗਿਆ, ਤਾਂ ਇਸ ਨੇ ਸਿਰਫ਼ 7.8 ਪ੍ਰਤੀਸ਼ਤ ਸਕੋਰ ਕੀਤਾ।

ARC-AGI-3 ਸਕੋਰ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ARC-AGI-3 ਕਿਸੇ ਮਾਡਲ ਦੀ ਯਾਦ ਕੀਤੇ ਹੋਏ ਪੈਟਰਨਾਂ 'ਤੇ ਨਿਰਭਰ ਕਰਨ ਦੀ ਬਜਾਏ, ਬਿਲਕੁਲ ਨਵੀਆਂ ਅਤੇ ਗੁੰਝਲਦਾਰ ਤਰਕ-ਅਧਾਰਤ (reasoning-heavy) ਸਮੱਸਿਆਵਾਂ ਨੂੰ ਹੱਲ ਕਰਨ ਦੀ ਯੋਗਤਾ ਦੀ ਜਾਂਚ ਕਰਦਾ ਹੈ। ਖੋਜਕਰਤਾ ਇਹਨਾਂ ਸਕੋਰਾਂ ਨੂੰ "ਜਨਰਲ-ਇੰਟੈਲੀਜੈਂਸ" (general-intelligence) ਦੀ ਪ੍ਰਗਤੀ ਦੇ ਪ੍ਰਤੀਕ ਵਜੋਂ ਦੇਖਦੇ ਹਨ, ਇਸ ਲਈ ਦਸ-ਅੰਕ ਦੀ ਇਹ ਲੀਡ ਮਨੁੱਖ ਵਰਗੀ ਸਮੱਸਿਆ ਹੱਲ ਕਰਨ ਦੀ ਸਮਰੱਥਾ ਵੱਲ ਇੱਕ ਵੱਡਾ ਕਦਮ ਜਾਪਦੀ ਹੈ। ਸਿਰਫ਼ ਇਹੀ ਗੱਲ ਦੱਸਦੀ ਹੈ ਕਿ ਕਿਉਂ ਇਸ ਖ਼ਬਰ ਨੇ AI ਕਮਿਊਨਿਟੀ ਵਿੱਚ ਹਲਚਲ ਮਚਾ ਦਿੱਤੀ।

ਲੁਕਿਆ ਹੋਇਆ ਕਾਰਨ: Retained Reasoning ਅਤੇ Compaction

OpenAI ਨੇ GPT-5.6 Sol ਦਾ ਮੁਲਾਂਕਣ ਜਨਤਕ ਟੈਸਟ ਹਾਰਨੈਸ ਨਾਲ ਨਹੀਂ ਕੀਤਾ। ਇਸ ਦੀ ਬਜਾਏ, ਇਸ ਨੇ ਆਪਣੇ Responses API ਦੀ ਵਰਤੋਂ ਦੋ ਵਿਸ਼ੇਸ਼ (proprietary) ਵਿਕਲਪਾਂ ਨਾਲ ਕੀਤੀ:

  • Retained Reasoning – ਇਹ ਮਾਡਲ ਦੇ ਵਿਚਾਰਾਂ ਦੀ ਲੜੀ (chain of thought) ਨੂੰ ਕਈ ਪੜਾਵਾਂ ਤੱਕ ਜਿਉਂਦਾ ਰੱਖਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਵਿਚਕਾਰਲੇ ਤਰਕ ਦੇ ਨੁਕਸਾਨ ਨੂੰ ਰੋਕਿਆ ਜਾ ਸਕਦਾ ਹੈ ਜੋ ਉਦੋਂ ਹੁੰਦਾ ਹੈ ਜਦੋਂ ਹਰੇਕ ਪੜਾਅ ਨੂੰ ਵੱਖਰੇ ਤੌਰ 'ਤੇ ਲਿਆ ਜਾਂਦਾ ਹੈ।
  • Compaction – ਇਹ ਪੁਰਾਣੇ ਸੰਦਰਭ (context) ਨੂੰ ਕੱਟਣ ਦੀ ਬਜਾਏ ਉਸ ਨੂੰ ਸੰਕੁਚਿਤ (compress) ਕਰ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਮਾਡਲ ਨੂੰ ਇੱਕ ਲੰਬੇ ਅਤੇ ਸੰਖੇਪ ਇਤਿਹਾਸ ਦਾ ਹਵਾਲਾ ਲੈਣ ਦੀ ਇਜਾਜ਼ਤ ਮਿਲਦੀ ਹੈ।

ਜਦੋਂ ਇਹ ਸੈਟਿੰਗਾਂ ਚਾਲੂ ਹੁੰਦੀਆਂ ਹਨ, ਤਾਂ ਮਾਡਲ ਲੰਬੇ ਤਰਕਾਂ ਨੂੰ ਆਪਸ ਵਿੱਚ ਜੋੜਦਾ ਹੈ ਅਤੇ ਪਹਿਲਾਂ ਕੀਤੇ ਗਏ ਨਿਰਕਰਸ਼ਾਂ ਦੀ ਮੁੜ ਵਰਤੋਂ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਬਹੁ-ਪੜਾਵੀ ਕੰਮਾਂ ਵਿੱਚ ਪ੍ਰਦਰਸ਼ਨ ਵਧ ਜਾਂਦਾ ਹੈ। ਅਧਿਕਾਰਤ ਹਾਰਨੈਸ ਵਿੱਚ, ਜੋ ਹਰੇਕ ਕਾਰਵਾਈ ਤੋਂ ਬਾਅਦ ਤਰਕ ਨੂੰ ਖਤਮ ਕਰ ਦਿੰਦਾ ਹੈ, ਉਹੀ ਮਾਡਲ 7.8 ਪ੍ਰਤੀਸ਼ਤ ਸਕੋਰ ਤੱਕ ਡਿੱਗ ਜਾਂਦਾ ਹੈ, ਜੋ ਇਸ ਨੂੰ Claude Opus 5 ਤੋਂ ਕਾਫ਼ੀ ਪਿੱਛੇ ਰੱਖਦਾ ਹੈ।

OpenAI ਦਾ ਤਰਕ ਹੈ ਕਿ ਇੱਕ ਬੈਂਚਮਾਰਕ ਨੂੰ ਪੂਰੇ ਇਨਫਰੈਂਸ ਪਾਈਪਲਾਈਨ (inference pipeline) ਨੂੰ ਮਾਪਣਾ ਚਾਹੀਦਾ ਹੈ, ਨਾ ਕਿ ਸਿਰਫ਼ ਰੋਅ ਨਿਊਰਲ ਵੇਟਸ (raw neural weights) ਨੂੰ। ਉਸ ਦ੍ਰਿਸ਼ਟੀਕੋਣ ਤੋਂ, "ਵੈਪਰ" (wrapper) – ਉਹ API ਲੌਜਿਕ ਜੋ ਸੰਦਰਭ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ ਅਤੇ ਸੰਕੁਚਿਤ ਕਰਦਾ ਹੈ – ਉਸ ਪ੍ਰਣਾਲੀ ਦਾ ਹਿੱਸਾ ਹੈ ਜਿਸਦਾ ਮੁਲਾਂਕਣ ਕੀਤਾ ਜਾ ਰਿਹਾ ਹੈ।

ਨਿਰਪੱਖਤਾ ਬਾਰੇ ਬਹਿਸ

ARC Prize ਦੇ ਸਹਿ-ਸੰਸਥਾਪਕ ਫਰਾਂਸੋਆ ਚੋਲੇਟ (François Chollet), ਜੋ ਇਸ ਬੈਂਚਮਾਰਕ ਨੂੰ ਸਪਾਂਸਰ ਕਰਦੇ ਹਨ, ਨੇ ਇਸ 'ਤੇ ਆਪਣੀ ਰਾਏ ਦਿੱਤੀ। ਉਨ੍ਹਾਂ ਨੇ ਬੈਂਚਮਾਰਕ ਨੂੰ "ਹੱਲ" ਕਰਨ ਲਈ ਬਣਾਏ ਗਏ ਕਸਟਮ ਹਾਰਨੈਸ ਅਤੇ ਆਮ-ਮੰਨਿਆ API ਸੈਟਿੰਗਾਂ ਵਿਚਕਾਰ ਅੰਤਰ ਦੱਸਿਆ ਜਿਨ੍ਹਾਂ ਨੂੰ ਕੋਈ ਵੀ ਉਪਭੋਗਤਾ ਚਾਲੂ ਕਰ ਸਕਦਾ ਹੈ। ਚੋਲੇਟ ਨੇ ਨੋਟ ਕੀਤਾ ਕਿ ਅਸਲ ARC Prize ਟੈਸਟਿੰਗ ਵਾਤਾਵਰਣ ਵਿੱਚ ਪੁਰਾਣੇ OpenAI-ਸਟਾਈਲ ਦੇ completions API ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਗਈ ਸੀ, ਜਿਸ ਵਿੱਚ ਉਹ ਉੱਨਤ ਵਿਸ਼ੇਸ਼ਤਾਵਾਂ ਨਹੀਂ ਸਨ ਜੋ ਹੁਣ Anthropic ਦੇ Claude API ਵਿੱਚ ਉਪਲਬਧ ਹਨ। ਉਸ ਅਸਮਾਨਤਾ ਕਾਰਨ ਸ਼ਾਇਦ ਪਹਿਲੇ ਦੌਰਾਂ ਵਿੱਚ OpenAI ਨੂੰ ਨੁਕਸਾਨ ਹੋਇਆ ਹੋਵੇ।

ਉਨ੍ਹਾਂ ਨੇ ਤੁਲਨਾ ਨੂੰ ਅਵੈਧ ਐਲਾਨਣ ਤੋਂ ਇਨਕਾਰ ਕਰ ਦਿੱਤਾ। ਚੋਲੇਟ ਨੇ ਕਿਹਾ ਕਿ ਜੇਕਰ ਸਹੀ ਸੈਟਿੰਗਾਂ ਅਤੇ ਜੁੜੀਆਂ ਹੋਈਆਂ ਲਾਗਤਾਂ ਦਾ ਖੁਲਾਸਾ ਕੀਤਾ ਜਾਵੇ, ਤਾਂ ਸਿੱਧੀ ਤੁਲਨਾ ਸਵੀਕਾਰਯੋਗ ਹੈ। ਉਨ੍ਹਾਂ ਦਾ ਤਰਕ ਸੀ ਕਿ ਪਾਰਦਰਸ਼ਤਾ ਕਮਿਊਨਿਟੀ ਨੂੰ ਇਹ ਮੁਲਾਂਕਣ ਕਰਨ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀ ਹੈ ਕਿ ਕੀ ਇਹ ਅੰਤਰ ਮਾਡਲ ਆਰਕੀਟੈਕਚਰ, ਇੰਜੀਨੀਅਰਿੰਗ ਤਰੀਕਿਆਂ, ਜਾਂ ਦੋਵਾਂ ਕਾਰਨ ਹੈ।

ਕੌਣ ਜਿੱਤਦਾ ਹੈ, ਕੌਣ ਹਾਰਦਾ ਹੈ

ਜੇਕਰ ਉੱਚੇ ਸਕੋਰ ਨੂੰ ਸੱਚ ਮੰਨ ਲਿਆ ਜਾਂਦਾ ਹੈ, ਤਾਂ OpenAI ਨੂੰ ਜਨਤਕ ਪ੍ਰਤੀਛਾਅ (public perception) ਵਿੱਚ ਵਾਧਾ ਮਿਲੇਗਾ ਅਤੇ ਐਂਟਰਪ੍ਰਾਈਜ਼ ਲਾਇਸੈਂਸਿੰਗ ਗੱਲਬਾਤ ਵਿੱਚ ਇੱਕ ਮਜ਼ਬੂਤ ਸਥਿਤੀ ਮਿਲੇਗੀ। Claude ਦੀ ਟੀਮ ਮਿਆਰੀ ਹਾਰਨੈਸ 'ਤੇ ਰੋਅ-ਮਾਡਲ (raw-model) ਦੇ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਸਬੂਤ ਵਜੋਂ ਪੇਸ਼ ਕਰ ਸਕਦੀ ਹੈ ਕਿ ਵਾਧੂ ਇੰਜੀਨੀਅਰਿੰਗ ਲੇਅਰਾਂ ਨੂੰ ਹਟਾਉਣ 'ਤੇ ਉਨ੍ਹਾਂ ਦਾ ਆਰਕੀਟੈਕਚਰ ਵਧੇਰੇ ਕੁਸ਼ਲ ਹੈ।

ਖੋਜਕਰਤਾ ਅਤੇ ਡਿਵੈਲਪਰ ਜੋ ਨਿਵੇਸ਼ ਕਰਨ ਲਈ ਬੈਂਚਮਾਰਕ ਰੈਂਕਿੰਗਾਂ 'ਤੇ ਨਿਰਭਰ ਕਰਦੇ ਹਨ, ਉਨ੍ਹਾਂ ਲਈ ਇਹ ਘਟਨਾ ਚਿੰਤਾਜਨਕ ਹੋ ਸਕਦੀ ਹੈ। ਇਹ ਮਾਮਲਾ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਜਿਵੇਂ-ਜਿਵੇਂ ਮਾਡਲ ਵੱਡੇ ਹੁੰਦੇ ਜਾਂਦੇ ਹਨ, ਉਹ ਸਾਫਟਵੇਅਰ ਜੋ ਉਨ੍ਹਾਂ ਦੇ ਇਨਫਰੈਂਸ (inference) ਦਾ ਪ੍ਰਬੰਧ ਕਰਦਾ ਹੈ, ਨਿਰਣਾਇਕ ਹੋ ਸਕਦਾ ਹੈ। ਉਹ ਕੰ

ਆਲੋਚਕਾਂ ਦਾ ਤਰਕ ਹੈ ਕਿ ਇੱਕ ਸਾਂਝੇ ਬੇਸਲਾਈਨ ਤੋਂ ਬਿਨਾਂ, ਸਕੋਰ ਇੱਕ ਬਦਲਦੇ ਨਿਸ਼ਾਨੇ ਬਣ ਜਾਂਦੇ ਹਨ, ਜੋ ਇੱਕ ਨਿਰਪੱਖ ਮਾਪਦੰਡ ਵਜੋਂ ਬੈਂਚਮਾਰਕ ਦੀ ਭੂਮਿਕਾ ਨੂੰ ਕਮਜ਼ੋਰ ਕਰਦੇ ਹਨ। ਈਕੋਲੋਜੀਕਲ ਵੈਲਿਡਿਟੀ (ਅਸਲ ਤਾਇਨਾਤੀਆਂ ਨੂੰ ਦਰਸਾਉਣਾ) ਅਤੇ ਵਿਧੀਵਤ ਸ਼ੁੱਧਤਾ (ਮਾਡਲ ਨੂੰ ਅਲੱਗ ਕਰਨਾ) ਵਿਚਕਾਰ ਦਾ ਤਣਾਅ ਮੌਜੂਦਾ ਵਿਵਾਦ ਨੂੰ ਹੋਰ ਵਧਾ ਰਿਹਾ ਹੈ।

ਮੁੱਖ ਨੁਕਤੇ

GPT-5.6 Sol ਦਾ ਦਾਅਵਾ AI ਮੁਲਾਂਕਣ ਵਿੱਚ ਵਧ ਰਹੇ ਵਿਭਾਜਨ ਨੂੰ ਉਜਾਗਰ ਕਰਦਾ ਹੈ: ਮਾਡਲ ਦੀ ਕੁਦਰਤੀ ਪ੍ਰਤਿਭਾ ਬਨਾਮ ਉਹ ਇੰਜੀਨੀਅਰਿੰਗ ਈਕੋਸਿਸਟਮ ਜੋ ਇਸਨੂੰ ਪ੍ਰਗਟ ਕਰਦਾ ਹੈ। ਜਦੋਂ ਤੱਕ ਭਾਈਚਾਰਾ ਇਨਫਰੈਂਸ ਸੈਟਿੰਗਾਂ ਅਤੇ ਉਹਨਾਂ ਦੀ ਲਾਗਤ ਦੇ ਪੂਰੇ ਖੁਲਾਸੇ ਦੀ ਮੰਗ ਕਰਦਾ ਰਹੇਗਾ, ਇਹ ਬਹਿਸ ਜਨਰਲ ਇੰਟੈਲੀਜੈਂਸ ਵੱਲ ਹੋ ਰਹੀ ਤਰੱਕੀ ਦੇ ਸਾਡੇ ਦ੍ਰਿਸ਼ਟੀਕੋਣ ਨੂੰ ਧੁੰਦਲਾ ਕਰਨ ਦੀ ਬਜਾਏ ਹੋਰ ਤੇਜ਼ ਹੋਵੇਗੀ।