ਇੱਕ ਸਿੰਗਲ RTX 5090 'ਤੇ ਚਲਾਏ ਗਏ ਪੰਜ ਲੋਕਲ LLM agents ਦੇ ਬੈਂਚਮਾਰਕ ਤੋਂ ਪਤਾ ਲੱਗਦਾ ਹੈ ਕਿ ਇੱਕ 35-ਬਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ mixture-of-experts (MoE) ਮਾਡਲ ਨੇ ਇੱਕ ਅਸਲ-ਦੁਨੀਆ ਦੇ ਕੋਡਿੰਗ ਟਾਸਕ ਵਿੱਚ ਆਪਣੇ ਸਾਥੀਆਂ ਨੂੰ ਪਛਾੜ ਦਿੱਤਾ। ਇਸ ਟੈਸਟ ਵਿੱਚ, ਬਿਨਾਂ ਕਿਸੇ ਕਲਾਉਡ API ਦੇ, ਇੱਕ ਮੌਜੂਦਾ ਐਡਮਿਨ ਪੈਨਲ ਵਿੱਚ Tag Manager ਜੋੜਿਆ ਗਿਆ ਸੀ, ਜਿਸ ਵਿੱਚ Qwen 3.6 35B-A3B ਸਪੱਸ਼ਟ ਜੇਤੂ ਵਜੋਂ ਉਭਰਿਆ।

ਇਹ ਟੈਸਟ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ਨਿੱਜੀ ਹਾਰਡਵੇਅਰ 'ਤੇ ਵੱਡੇ ਲੈਂਗੂਏਜ ਮਾਡਲਾਂ ਨੂੰ ਚਲਾਉਣ ਨਾਲ ਡਿਵੈਲਪਰ API ਫੀਸਾਂ ਅਤੇ ਡਾਟਾ-ਪ੍ਰਾਈਵੇਸੀ ਦੀਆਂ ਚਿੰਤਾਵਾਂ ਤੋਂ ਬਚ ਸਕਦੇ ਹਨ। ਫਿਰ ਵੀ "local agents" ਇੱਕ ਬਜ਼ਵਰਡ ਬਣੇ ਹੋਏ ਹਨ: ਕੀ ਉਹ ਅਸਲ ਵਿੱਚ ਫਾਈਲਾਂ ਨੂੰ ਐਡਿਟ ਕਰ ਸਕਦੇ ਹਨ, command-line ਟੂਲਸ ਨੂੰ ਕਾਲ ਕਰ ਸਕਦੇ ਹਨ, ਅਤੇ ਕਿਸੇ ਇਨਸਾਨ ਦੀ ਮਦਦ ਤੋਂ ਬਿਨਾਂ production-ready ਕੋਡ ਤਿਆਰ ਕਰ ਸਕਦੇ ਹਨ? ਕਲਾਉਡ ਸੇਵਾਵਾਂ ਤੋਂ ਬਿਨਾਂ ਕੀਤਾ ਗਿਆ ਇਹ ਪ੍ਰੈਕਟੀਕਲ ਤੁਲਨਾ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਇਹ ਸਮਝਣ ਵਿੱਚ ਮਦਦ ਕਰਦੀ ਹੈ ਕਿ ਇਹ ਤਕਨਾਲੋਜੀ ਇਸ ਸਮੇਂ ਕਿੱਥੇ ਖੜ੍ਹੀ ਹੈ।

ਹਾਰਡਵੇਅਰ ਅਤੇ ਟਾਸਕ

ਪੰਜੇ ਮਾਡਲ ਇੱਕੋ ਵਰਕਸਟੇਸ਼ਨ 'ਤੇ ਚੱਲੇ: ਇੱਕ RTX 5090 GPU, ਜੋ ਕਿ ਇੱਕ ਆਮ ਹਾਈ-ਐਂਡ ਕੰਜ਼ਿਊਮਰ ਕਾਰਡ ਹੈ, ਅਤੇ ਕੋਈ ਬਾਹਰੀ ਸੇਵਾਵਾਂ ਨਹੀਂ ਸਨ। ਟਾਸਕ ਜਾਣਬੁੱਝ ਕੇ ਸਰਲ ਪਰ ਪ੍ਰਤੀਨਿਧ ਰੱਖਿਆ ਗਿਆ ਸੀ – ਪਹਿਲਾਂ ਤੋਂ ਬਣੇ ਹੋਏ ਐਡਮਿਨ ਸੈਕਸ਼ਨ ਵਿੱਚ ਇੱਕ Tag Manager ਕੰਪੋਨੈਂਟ ਜੋੜਨਾ। ਸਫਲਤਾ ਲਈ ਮਾਡਲ ਲਈ ਸਹੀ ਸੋਰਸ ਫਾਈਲਾਂ ਲੱਭਣਾ, ਉਹਨਾਂ ਨੂੰ ਐਡਿਟ ਕਰਨਾ, ਅਤੇ ਇਹ ਯਕੀਨੀ ਬਣਾਉਣਾ ਜ਼ਰੂਰੀ ਸੀ ਕਿ ਨਵਾਂ ਫੀਚਰ ਮੌਜੂਦਾ ਕਾਰਜਸ਼ੀਲਤਾ ਨੂੰ ਖਰਾਬ ਕੀਤੇ ਬਿਨਾਂ ਸ਼ਾਮਲ ਹੋ ਗਿਆ ਹੈ।

ਮਾਡਲ ਦੀ ਕਾਰਗੁਜ਼ਾਰੀ

  • Qwen 3.6 35B-A3B (MoE) – ਕੰਮ ਨੂੰ ਖੁਦਮੁਖਤਿਆਰ ਤਰੀਕੇ ਨਾਲ ਪੂਰਾ ਕੀਤਾ, ਕੁਝ ਸਮਝਦਾਰੀ ਵਾਲੇ ਸੁਧਾਰ ਕੀਤੇ ਜੋ ਮੰਗੇ ਨਹੀਂ ਗਏ ਸਨ, ਅਤੇ ਇਸ ਨੂੰ ਰਨ ਤੋਂ ਬਾਅਦ ਕਿਸੇ ਪੈਚ ਦੀ ਲੋੜ ਨਹੀਂ ਪਈ।
  • Qwen 3.6 27B (dense) – ਟਾਸਕ ਪੂਰਾ ਕੀਤਾ ਪਰ ਲਗਭਗ ਦੁੱਗਣੇ ਇੰਟਰੈਕਸ਼ਨ ਸਟੈਪਸ ਲਏ ਅਤੇ ਕਦੇ-ਕਦੇ ਹਦਾਇਤਾਂ ਦਾ ਗਲਤ ਅਰਥ ਕੱਢਿਆ।
  • GLM-4.7-Flash (dense) – ਇੱਕ ਕੰਮ ਕਰਨ ਵਾਲਾ ਇੰਪਲੀਮੈਂਟੇਸ਼ਨ ਤਿਆਰ ਕੀਤਾ ਪਰ ਗਲਤ ਫਾਈਲ-ਮੈਚਿੰਗ ਪੈਟਰਨਾਂ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਅਤੇ ਸੁਰੱਖਿਆ ਚੈੱਕ ਛੱਡ ਦਿੱਤੇ, ਜਿਸ ਨਾਲ ਕੋਡ ਕਮਜ਼ੋਰ ਰਹਿ ਗਿਆ।
  • Qwythos-9B – ਕੋਈ ਵੀ ਅਸਲੀ ਟੂਲ ਨਹੀਂ ਚਲਾਇਆ; ਇਹ ਅਸਫਲਤਾ ਮਾਡਲ ਖੁਦ ਜਾਂ ਲੋਕਲ ਸੈੱਟਅੱਪ ਕਾਰਨ ਹੋ ਸਕਦੀ ਹੈ, ਪਰ ਟੈਸਟ ਕਾਰਨ ਦਾ ਪਤਾ ਨਹੀਂ ਲਗਾ ਸਕਿਆ।
  • Nemotron-3-Nano (hybrid) – ਇੱਕ ਲੂਪ ਵਿੱਚ ਫਸ ਗਿਆ, ਉਸ ਫੋਲਡਰ ਨੂੰ ਲੱਭਣ ਵਿੱਚ 40 ਵਾਰ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ ਜਿਸ ਨੂੰ ਉਹ ਪਹਿਲਾਂ ਹੀ ਲੱਭ ਚੁੱਕਾ ਸੀ, ਅਤੇ ਉਸ ਤੋਂ ਅੱਗੇ ਨਹੀਂ ਵਧ ਸਕਿਆ।

ਨਤੀਜੇ ਕੀ ਦੱਸਦੇ ਹਨ

ਆਰਕੀਟੈਕਚਰ ਇੱਕ ਭਰੋਸੇਯੋਗ ਪੂਰਵ-ਅਨੁਮਾਨ ਨਹੀਂ ਹੈ

MoE ਮਾਡਲ, ਜੋ ਆਪਣੇ ਪੈਰਾਮੀਟਰਾਂ ਨੂੰ ਕਈ ਐਕਸਪਰਟ ਸਬ-ਨੈੱਟਵਰਕਾਂ ਵਿੱਚ ਵੰਡਦਾ ਹੈ, ਸਿੱਧੇ ਤੌਰ 'ਤੇ ਜਿੱਤ ਗਿਆ, ਜਦੋਂ ਕਿ dense ਅਤੇ hybrid ਵੇਰੀਐਂਟ ਸਫਲਤਾ ਅਤੇ ਪੂਰੀ ਤਰ੍ਹਾਂ ਅਸਫਲਤਾ ਦੇ ਵਿਚਕਾਰ ਵੰਡੇ ਹੋਏ ਸਨ। ਇਹ ਸੁਝਾਅ ਦਿੰਦਾ ਹੈ ਕਿ ਸਿਰਫ਼ ਆਰਕੀਟੈਕਚਰਲ ਚੋਣਾਂ ਟੂਲ-ਵਰਤੋਂ ਦੀ ਯੋਗਤਾ ਦੀ ਗਾਰੰਟੀ ਨਹੀਂ ਦਿੰਦੀਆਂ।

ਟੂਲ ਦੀ ਵਰਤੋਂ ਇੱਕ ਵੱਡੀ ਰੁਕਾਵਟ ਬਣੀ ਹੋਈ ਹੈ

ਪੰਜੇ ਏਜੰਟਾਂ ਵਿੱਚੋਂ ਕਿਸੇ ਨੇ ਵੀ ਟੈਸਟ ਲਈ ਦਿੱਤੇ ਗਏ ਸਮਰਪਿਤ ਸਕ੍ਰੀਨਸ਼ੌਟ ਟੂਲ ਦੀ ਵਰਤੋਂ ਨਹੀਂ ਕੀਤੀ। ਸਾਰਿਆਂ ਨੇ ਫਾਈਲਾਂ ਦੇ ਨਾਮ ਅੰਦਾਜ਼ੇ ਨਾਲ ਲਗਾ ਕੇ ਜਾਂ ਅਸਿੱਧੇ ਤਰੀਕਿਆਂ ਦੀ ਕੋਸ਼ਿਸ਼ ਕਰਕੇ ਕੰਮ ਚਲਾਉਣ ਦੀ ਕੋਸ਼ਿਸ਼ ਕੀਤੀ। "ਕੋਡ ਜਨਰੇਟ ਕਰ ਸਕਣਾ" ਅਤੇ "ਬਾਹਰੀ ਯੂਟੀਲਿਟੀਜ਼ ਨੂੰ ਸੰਚਾਲਿਤ ਕਰ ਸਕਣਾ" ਦੇ ਵਿਚਕਾਰ ਦਾ ਪਾੜਾ ਅਜੇ ਵੀ ਬਹੁਤ ਜ਼ਿਆਦਾ ਹੈ।

ਲੋਕਲ ਚਲਾਉਣ ਦਾ ਮਤਲਬ ਸਿਰਫ਼ ਮਾਡਲ ਨੂੰ ਹੀ ਨਹੀਂ, ਸਗੋਂ ਸਟੈਕ ਨੂੰ ਡੀਬੱਗ ਕਰਨਾ ਵੀ ਹੈ

ਟੈਸਟ ਸ਼ੁਰੂ ਹੋਣ ਤੋਂ ਪਹਿਲਾਂ ਦੋ ਮਾਡਲਾਂ ਨੂੰ ਉਹਨਾਂ ਦੇ ਪ੍ਰੋਂਪਟ ਟੈਂਪਲੇਟਾਂ ਵਿੱਚ ਤੁਰੰਤ ਪੈਚ ਦੀ ਲੋੜ ਪਈ। ਮਾਡਲ-ਵਿਸ਼ੇਸ਼ ਬੱਗਸ ਨੂੰ ਠੀਕ ਕਰਨ ਵਿੱਚ ਲੱਗੀ ਮਿਹਨਤ ਅਸਲ Tag Manager ਕੋਡ ਲਿਖਣ ਵਿੱਚ ਲੱਗੇ ਸਮੇਂ ਤੋਂ ਵੱਧ ਗਈ, ਜੋ ਇਹ ਦਰਸਾਉਂਦੀ ਹੈ ਕਿ ਮੌਜੂਦਾ ਲੋਕਲ ਡਿਪਲੋਇਮੈਂਟ ਕਿੰਨੇ ਨਾਜ਼ੁਕ ਹਨ।

ਸਾਵਧਾਨੀ ਲਈ ਇੱਕ ਨੋਟ

ਇਹ ਬੈਂਚਮਾਰਕ ਇੱਕ ਸਿੰਗਲ ਹਾਰਡਵੇਅਰ ਕੌਂਫਿਗਰੇਸ਼ਨ, ਇੱਕ ਸਿੰਗਲ ਕੋਡਿੰਗ ਸਥਿਤੀ, ਅਤੇ ਮਾਡਲਾਂ ਦੇ ਇੱਕ ਛੋਟੇ ਸਮੂਹ ਨੂੰ ਦਰਸਾਉਂਦਾ ਹੈ। Qwen 3.6 35B-A3B ਪਹਿਲਾਂ ਇੱਕ ਪਿਛਲੇ ਰਾਊਂਡ ਵਿੱਚ ਅਸਫਲ ਰਿਹਾ ਸੀ; ਉਸਦੀ ਪਹਿਲੀ ਅਸਫਲਤਾ ਇੱਕ ਇਤਫ਼ਾਕ ਸੀ। ਇਸ ਲਈ ਨਤੀਜੇ ਸਿਰਫ਼ ਸੰਕੇਤਕ ਹਨ, ਨਾ ਕਿ ਅੰਤਿਮ।

ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ

ਭਵਿੱਖ ਦੇ ਰਾਊਂਡਾਂ ਵਿੱਚ ਟਾਸਕ ਸੈੱਟ ਨੂੰ ਵਧਾਉਣ, ਵਧੇਰੇ ਵਿਭਿੰਨ ਟੂਲਚੇਨਾਂ ਨੂੰ ਸ਼ਾਮਲ ਕਰਨ ਅਤੇ ਹਾਰਡਵੇਅਰ ਦੀ ਇੱਕ ਵਿਸ਼ਾਲ ਸ਼੍ਰੇਣੀ 'ਤੇ ਟੈਸਟ ਕਰਨ ਦੀ ਲੋੜ ਹੋਵੇਗੀ। ਨਿਰੀਖਕਾਂ ਨੂੰ ਇਸ ਗੱਲ 'ਤੇ ਨਜ਼ਰ ਰੱਖਣੀ ਚਾਹੀਦੀ ਹੈ ਕਿ ਕੀ MoE ਮਾਡਲ ਲਗਾਤਾਰ dense ਅਤੇ hybrid ਡਿਜ਼ਾਈਨਾਂ ਨਾਲੋਂ ਬਿਹਤਰ ਪ੍ਰਦਰਸ਼ਨ ਕਰਦੇ ਹਨ, ਅਤੇ ਕੀ ਡਿਵੈਲਪਰ ਅਜਿਹੇ ਭਰੋਸੇਯੋਗ ਵੈਪਰ (wrappers) ਬਣਾ ਸਕਦੇ ਹਨ ਜੋ ਮੈਨੂਅਲ ਬੱਗ-ਪੈਚਿੰਗ ਦੀ ਲੋੜ ਨੂੰ ਖਤਮ ਕਰ ਸਕਣ।

ਸਿੱਖਿਆ: ਇੱਕ 35B MoE ਮਾਡਲ ਪਹਿਲਾਂ ਹੀ ਇੱਕ ਸਮਰੱਥ ਲੋਕਲ ਕੋਡਿੰਗ ਸਹਾਇਕ ਵਜੋਂ ਕੰਮ ਕਰ ਸਕਦਾ ਹੈ, ਪਰ ਵਿਆਪਕ ਈਕੋਸਿਸਟਮ—ਟੂਲ ਇੰਟੀਗ੍ਰੇਸ਼ਨ, ਪ੍ਰੋਂਪਟ ਇੰਜੀਨੀਅਰਿੰਗ, ਅਤੇ ਸਥਿਰ ਰਨਟਾਈਮ—ਅਜੇ ਵੀ ਪਛੜ ਰਿਹਾ ਹੈ। ਜਦੋਂ ਤੱਕ ਇਹ ਸਾਰੇ ਹਿੱਸੇ ਇਕੱਠੇ ਨਹੀਂ ਹੋ ਜਾਂਦੇ, ਡਿਵੈਲਪਰਾਂ ਨੂੰ "plug-and-play" ਲੋਕਲ ਏਜੰਟਾਂ ਬਾਰੇ ਆਪਣੀਆਂ ਉਮੀਦਾਂ ਨੂੰ ਸੰਭਾਲ ਕੇ ਰੱਖ