Poolside ਦਾ Laguna S 2.1: ਛੋਟਾ Open-Weight ਮਾਡਲ ਕੋਡਿੰਗ AI ਨੂੰ ਮੁੜ ਪਰਿਭਾਸ਼ਿਤ ਕਰ ਰਿਹਾ ਹੈ

Poolside ਨੇ Laguna S 2.1 ਰਿਲੀਜ਼ ਕੀਤਾ ਹੈ, ਜੋ ਕਿ ਇੱਕ ਸੰਖੇਪ open-weight ਕੋਡਿੰਗ ਮਾਡਲ ਹੈ ਜੋ ਕਿ ਕਿਤੇ ਵੱਡੇ ਮੁਕਾਬਲੇਬਾਜ਼ਾਂ ਨੂੰ ਪਛਾੜ ਰਿਹਾ ਹੈ। ਕੁੱਲ ਪੈਰਾਮੀਟਰਾਂ ਦੀ ਗਿਣਤੀ ਦੀ ਬਜਾਏ agentic persistence ਅਤੇ reasoning ਨੂੰ ਤਰਜੀਹ ਦੇ ਕੇ, ਇਹ ਰਿਲੀਜ਼ ਵਿਸ਼ੇਸ਼ LLM ਵਿਕਾਸ ਦੇ ਸਾਡੇ ਤਰੀਕੇ ਵਿੱਚ ਇੱਕ ਵੱਡੀ ਤਬਦੀਲੀ ਦਾ ਸੰਕੇਤ ਦਿੰਦੀ ਹੈ।

ਟ੍ਰਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਵਾਲੇ ਦਿੱਗਜਾਂ ਨੂੰ ਪਛਾੜਨਾ

Laguna S 2.1 ਇਹ ਸਾਬਤ ਕਰ ਰਿਹਾ ਹੈ ਕਿ ਮਾਡਲ ਦਾ ਸਕੇਲ ਹੀ ਬੁੱਧੀ ਦਾ ਇੱਕੋ ਇੱਕ ਰਸਤਾ ਨਹੀਂ ਹੈ। Terminal-Bench 2.1 ਬੈਂਚਮਾਰਕ 'ਤੇ, ਜੋ ਕਿ ਲੰਬੇ ਸਮੇਂ ਤੱਕ ਚੱਲਣ ਵਾਲੇ terminal ਕੰਮਾਂ ਦਾ ਮੁਲਾਂਕਣ ਕਰਦਾ ਹੈ, ਮਾਡਲ ਨੇ "thinking mode" ਚਾਲੂ ਹੋਣ 'ਤੇ 70.2% ਸਕੋਰ ਪ੍ਰਾਪਤ ਕੀਤਾ। ਇਹ ਪ੍ਰਦਰਸ਼ਨ ਇਸਨੂੰ ਸਿੱਧੇ ਤੌਰ 'ਤੇ Tencent ਦੇ ਵਿਸ਼ਾਲ 295B-A21B Hy3 ਮਾਡਲ ਤੋਂ ਪਿੱਛੇ ਰੱਖਦਾ ਹੈ, ਪਰ DeepSeek-V4-Pro-Max ਅਤੇ Nemotron 3 Ultra ਵਰਗੇ ਕਿਤੇ ਵੱਡੇ open-weights ਸਿਸਟਮਾਂ ਤੋਂ ਅੱਗੇ ਰੱਖਦਾ ਹੈ।

Datacurve DeepSWE ਬੈਂਚਮਾਰਕ 'ਤੇ ਇਹ ਅੰਤਰ ਹੋਰ ਵੀ ਸਪੱਸ਼ਟ ਹੋ ਜਾਂਦਾ ਹੈ। Laguna S 2.1 ਨੇ 40.4% ਸਕੋਰ ਕੀਤਾ, ਜੋ ਕਿ ਇੱਕ ਟ੍ਰਿਲੀਅਨ ਤੋਂ ਵੱਧ ਪੈਰਾਮੀਟਰਾਂ ਵਾਲੇ ਕਈ open-weight ਮਾਡਲਾਂ ਦੇ ਮੁਕਾਬਲੇ ਇੱਕ ਹੈਰਾਨੀਜਨਕ ਨਤੀਜਾ ਹੈ, ਜੋ 10% ਦਾ ਅੰਕੜਾ ਵੀ ਪਾਰ ਨਹੀਂ ਕਰ ਸਕੇ। ਮਾਡਲ SWE-Bench Multilingual, SWE-Bench Pro, ਅਤੇ SWE Atlas ਵਿੱਚ ਵੀ ਸ਼ਾਨਦਾਰ ਪ੍ਰਦਰਸ਼ਨ ਦਿਖਾਉਂਦਾ ਹੈ, ਜੋ ਗੁੰਝਲਦਾਰ ਸੌਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ ਵਰਕਫਲੋ ਵਿੱਚ ਇਸਦੀ ਉਪਯੋਗਤਾ ਨੂੰ ਸਾਬਤ ਕਰਦਾ ਹੈ।

ਲਗਨ (Persistence) ਅਤੇ "Thinking" ਦੀ ਸ਼ਕਤੀ

Laguna S 2.1 ਦੀ ਇੱਕ ਮੁੱਖ ਵਿਸ਼ੇਸ਼ਤਾ ਇਸਦਾ "thinking mode" ਹੈ, ਜੋ pass-at-one ਰੇਟਾਂ ਵਿੱਚ ਭਾਰੀ ਸੁਧਾਰ ਕਰਦਾ ਹੈ। ਇਸ reasoning ਕਦਮ ਤੋਂ ਬਿਨਾਂ, Terminal-Bench ਸਕੋਰ 70.2% ਤੋਂ ਡਿੱਗ ਕੇ 60.4% ਹੋ ਜਾਂਦੇ ਹਨ, ਅਤੇ DeepSWE ਸਕੋਰ 40.4% ਤੋਂ ਡਿੱਗ ਕੇ 16.5% ਰਹਿ ਜਾਂਦੇ ਹਨ।

Poolside ਦਾ ਕਹਿਣਾ ਹੈ ਕਿ ਸਿਰਫ਼ ਬੁੱਧੀ ਵਧਾਉਣ ਦੀ ਬਜਾਏ, ਉਨ੍ਹਾਂ ਨੇ ਉਨ੍ਹਾਂ "ਵਿਹਾਰਾਂ" (behaviors) ਨੂੰ ਸੁਧਾਰਨ 'ਤੇ ਧਿਆਨ ਦਿੱਤਾ ਹੈ ਜੋ ਸਮਰੱਥਾ ਵੱਲ ਲੈ ਜਾਂਦੇ ਹਨ। ਇਸ ਵਿੱਚ ਵਧੇਰੇ verification, ਅੰਦਾਜ਼ਿਆਂ ਨੂੰ ਸੱਚ ਮੰਨਣ ਦੀ ਰੁਝਾਨ ਨੂੰ ਘਟਾਉਣਾ, ਅਤੇ ਲਗਨ (persistence) ਨੂੰ ਉਤਸ਼ਾਹਿਤ ਕਰਨਾ ਸ਼ਾਮਲ ਹੈ। ਦਸਤਾਵੇਜ਼ੀ ਪ੍ਰਯੋਗਾਂ ਵਿੱਚ, ਮਾਡਲ ਨੇ ਸਿਰਫ਼ 50 ਮਿੰਟਾਂ ਵਿੱਚ ਇੱਕ ਖਾਲੀ ਫੋਲਡਰ ਤੋਂ ਇੱਕ ਕਾਰਜਸ਼ੀਲ ਬ੍ਰਾਊਜ਼ਰ ਇੰਜਣ ਬਣਾਇਆ। ਇਸ ਤੋਂ ਵੀ ਵੱਧ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਤੌਰ 'ਤੇ, ਇਸਨੇ ਸਿਰਫ਼ 40 ਤਰਕ ਕਦਮਾਂ ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਅਤੇ ਸਿਰਫ਼ $0.088 ਦੀ ਲਾਗਤ ਨਾਲ Erdos Problem #397 ਦਾ ਹੱਲ ਸੁਤੰਤਰ ਰੂਪ ਵਿੱਚ ਲੱਭ ਲਿਆ—ਇੱਕ ਅਜਿਹੀ ਗਣਿਤ ਦੀ ਸਮੱਸਿਆ ਜੋ 1975 ਤੋਂ ਅਣਸੁਲਝੀ ਸੀ।

ਵੱਡੇ ਪੱਧਰ 'ਤੇ Agentic Training

ਪਿਛਲੇ XS 2.1 ਵਰਜ਼ਨ ਤੋਂ S 2.1 ਤੱਕ ਪ੍ਰਦਰਸ਼ਨ ਵਿੱਚ ਵੱਡਾ ਉਛਾਲ ਨਵੇਂ pre-training ਡੇਟਾ ਦੀ ਬਜਾਏ ਗੂੜ੍ਹੀ post-training ਦੁਆਰਾ ਲਿਆਂਦਾ ਗਿਆ ਸੀ। Agentic training ਪੜਾਅ ਵਿੱਚ 409,000 ਵੱਖ-ਵੱਖ ਵਾਤਾਵਰਣਾਂ ਦੀ ਵਰਤੋਂ ਕੀਤੀ ਗਈ ਸੀ, ਜਿਸ ਵਿੱਚ ਸ਼ਾਮਲ ਹਨ:

  • terminal-ਵਿਸ਼ੇਸ਼ ਕੰਮਾਂ ਲਈ 83,000 ਵਾਤਾਵਰਣ।
  • ਸੌਫਟਵੇਅਰ ਇੰਜੀਨੀਅਰਿੰਗ ਵਰਕਫਲੋ ਲਈ 168,000 ਵਾਤਾਵਰਣ।
  • ਲਗਭਗ 17,000 ਰਿਪੋਜ਼ਟਰੀਆਂ ਤੋਂ ਲਏ ਗਏ 38,000 ਅਸਲ-ਦੁਨੀਆ ਦੇ commits।

ਇਸ ਟ੍ਰੇਨਿੰਗ ਪ੍ਰਕਿਰਿਆ ਨੂੰ 4,096 Nvidia H200 GPUs ਦੇ ਇੱਕ ਵਿਸ਼ਾਲ ਕੰਪਿਊਟ ਕਲਸਟਰ ਦੁਆਰਾ ਸਮਰਥਨ ਦਿੱਤਾ ਗਿਆ ਸੀ। ਖਾਸ ਤੌਰ 'ਤੇ, S 2.1 ਇਸ ਸੀਰੀਜ਼ ਦਾ ਪਹਿਲਾ ਮਾਡਲ ਹੈ ਜਿਸ ਨੂੰ FP8 precision ਵਿੱਚ reinforcement learning ਦੀ ਵਰਤੋਂ ਕਰਕੇ ਸਿਖਾਇਆ ਗਿਆ ਹੈ। "reward hacking" ਨੂੰ ਰੋਕਣ ਲਈ—ਜਿੱਥੇ ਇੱਕ ਮਾਡਲ ਕਿਸੇ ਕੰਮ ਨੂੰ ਹੱਲ ਕਰਨ ਦੀ ਬਜਾਏ ਮੌਜੂਦਾ pull requests ਦੀ ਭਾਲ ਕਰ ਸਕਦਾ ਹੈ—Poolside ਨੇ ਨੈੱਟਵਰਕ ਪਹੁੰਚ ਨੂੰ ਚੋਣਵੇਂ ਤੌਰ 'ਤੇ ਰੋਕਣ ਲਈ ਇੱਕ ਨਵਾਂ sandbox ਸਿਸਟਮ ਲਾਗੂ ਕੀਤਾ।

ਪਹੁੰਚ ਅਤੇ ਤੈਨਾਤੀ (Deployment)

Laguna S 2.1 ਨੂੰ OpenMDW 1.1 ਲਾਇਸੈਂਸ (Linux Foundation ਦੁਆਰਾ ਸਮਰਥਿਤ) ਦੇ ਅਧੀਨ ਰਿਲੀਜ਼ ਕੀਤਾ ਗਿਆ ਹੈ, ਜੋ ਵਪਾਰਕ ਵਰਤੋਂ, ਸੋਧ ਅਤੇ ਮੁੜ ਵੰਡ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦਾ ਹੈ। ਡਿਵੈਲਪਰ Hugging Face ਰਾਹੀਂ, ਜਾਂ Baseten, Vercel AI Gateway, ਅਤੇ OpenRouter ਵਰਗੀਆਂ ਹੋਸਟਡ ਸੇਵਾਵਾਂ ਰਾਹੀਂ ਮਾਡਲ ਤੱਕ ਪਹੁੰਚ ਕਰ ਸਕਦੇ ਹਨ। OpenRouter ਮੁਫ਼ਤ ਵਿੱਚ ਇੱਕ ਮਹੱਤਵਪੂਰਨ 256K context window ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ, ਜਿਸ ਵਿੱਚ ਇੱਕ ਭੁਗਤਾਨ ਵਾਲਾ ਟਾਇਰ ਇੱਕ ਮਿਲੀਅਨ ਟੋਕਨਾਂ ਤੱਕ ਸਮਰਥਨ ਕਰਦਾ ਹੈ।

ਮੁੱਖ ਗੱਲਾਂ

  • ਸਕੇਲ ਦੀ ਬਜਾਏ ਕੁਸ਼ਲਤਾ: Laguna S 2.1 ਸਾਬਤ ਕਰਦਾ ਹੈ ਕਿ ਲਗਨ ਅਤੇ verification ਵਰਗੇ agentic ਵਿਹਾਰ ਛੋਟੇ ਮਾਡਲਾਂ ਨੂੰ ਟ੍ਰਿਲੀਅਨ-ਪੈਰਾਮੀਟਰ ਸਿਸਟਮਾਂ ਨੂੰ ਪਛਾੜਨ ਦੀ ਇਜਾਜ਼ਤ ਦੇ ਸਕਦੇ ਹਨ।
  • Reasoning ਜ਼ਰੂਰੀ ਹੈ: ਗੁੰਝਲਦਾਰ ਕੰਮਾਂ ਲਈ "thinking mode" ਮਹੱਤਵਪੂਰਨ ਹੈ, ਜੋ ਸਾਰੇ ਪ੍ਰਮੁੱਖ ਕੋਡਿੰਗ ਬੈਂਚਮਾਰਕਾਂ ਵਿੱਚ ਪ੍ਰਦਰਸ਼ਨ ਨੂੰ ਕਾਫ਼ੀ ਵਧਾਉਂਦਾ ਹੈ।
  • Agentic Training ਦੀ ਸਫਲਤਾ: ਮਾਡਲ ਦੀ ਤਾਕਤ 409,000 ਵਿਸ਼ੇਸ਼ ਵਾਤਾਵਰਣਾਂ ਅਤੇ ਅਸਲ-ਦੁਨੀਆ ਦੇ ਕੋਡ commits ਵਿੱਚ ਵਿਸ਼ਾਲ ਪੱਧਰ ਦੀ post-training ਤੋਂ ਮਿਲਦੀ ਹੈ।