Poolside का Laguna S 2.1: छोटा ओपन-वेट मॉडल कोडिंग AI को फिर से परिभाषित कर रहा है

Poolside ने Laguna S 2.1 रिलीज़ किया है, जो एक कॉम्पैक्ट ओपन-वेट कोडिंग मॉडल है और अपने से काफी बड़े प्रतिस्पर्धियों को पीछे छोड़ रहा है। कच्चे पैरामीटर काउंट (raw parameter count) के बजाय एजेंटिक दृढ़ता (agentic persistence) और तर्क (reasoning) को प्राथमिकता देकर, यह रिलीज़ विशेषीकृत LLM विकास के प्रति हमारे दृष्टिकोण में एक बड़े बदलाव का संकेत देती है।

ट्रिलियन-पैरामीटर वाले दिग्गजों को पीछे छोड़ना

Laguna S 2.1 यह प्रदर्शित कर रहा है कि मॉडल का स्केल ही बुद्धिमत्ता का एकमात्र रास्ता नहीं है। Terminal-Bench 2.1 बेंचमार्क पर, जो लंबे समय तक चलने वाले टर्मिनल कार्यों का मूल्यांकन करता है, "thinking mode" सक्षम होने पर मॉडल ने 70.2% का स्कोर प्राप्त किया। यह प्रदर्शन इसे सीधे Tencent के विशाल 295B-A21B Hy3 मॉडल के बाद रखता है, लेकिन DeepSeek-V4-Pro-Max और Nemotron 3 Ultra जैसे बहुत बड़े ओपन-वेट सिस्टम से आगे रखता है।

Datacurve DeepSWE बेंचमार्क पर यह अंतर और भी स्पष्ट हो जाता है। Laguna S 2.1 ने 40.4% स्कोर किया, जो एक ट्रिलियन से अधिक पैरामीटर वाले कई ओपन-वेट मॉडलों की तुलना में चौंकाने वाला परिणाम है, जो 10% का आंकड़ा भी नहीं तोड़ सके। मॉडल SWE-Bench Multilingual, SWE-Bench Pro, और SWE Atlas में भी उत्कृष्ट प्रदर्शन दिखाता है, जो जटिल सॉफ्टवेयर इंजीनियरिंग वर्कफ़्लो में इसकी उपयोगिता को साबित करता है।

दृढ़ता और "Thinking" की शक्ति

Laguna S 2.1 की एक मुख्य विशेषता इसका "thinking mode" है, जो pass-at-one दरों में भारी सुधार करता है। इस रीजनिंग स्टेप के बिना, Terminal-Bench स्कोर 70.2% से गिरकर 60.4% हो जाते हैं, और DeepSWE स्कोर 40.4% से घटकर 16.5% रह जाते हैं।

Poolside का तर्क है कि केवल बुद्धिमत्ता बढ़ाने के बजाय, उन्होंने उन "व्यवहारों" (behaviors) को सुधारने पर ध्यान केंद्रित किया है जो क्षमता की ओर ले जाते हैं। इसमें बढ़ी हुई वेरिफिकेशन, धारणाओं को बिना सोचे-समझे स्वीकार करने की प्रवृत्ति को कम करना और दृढ़ता को बढ़ावा देना शामिल है। दस्तावेजी परीक्षणों में, मॉडल ने केवल 50 मिनट में एक खाली फोल्डर से एक कार्यात्मक ब्राउज़र इंजन बनाया। इससे भी अधिक प्रभावशाली बात यह है कि इसने केवल 40 रीजनिंग स्टेप्स का उपयोग करके और मात्र $0.088 की लागत में Erdos Problem #397 का समाधान स्वतंत्र रूप से खोज निकाला—एक ऐसी गणितीय समस्या जो 1975 से अनसुलझी थी।

बड़े पैमाने पर एजेंटिक ट्रेनिंग

पिछले XS 2.1 संस्करण से S 2.1 तक प्रदर्शन में आई उछाल नए प्री-ट्रेनिंग डेटा के बजाय गहन पोस्ट-ट्रेनिंग (post-training) के कारण थी। एजेंटिक ट्रेनिंग चरण में 409,000 अलग-अलग वातावरणों का उपयोग किया गया, जिनमें शामिल हैं:

  • टर्मिनल-विशिष्ट कार्यों के लिए 83,000 वातावरण।
  • सॉफ्टवेयर इंजीनियरिंग वर्कफ़्लो के लिए 168,000 वातावरण।
  • लगभग 17,000 रिपॉजिटरी से प्राप्त 38,000 वास्तविक-दुनिया के कमिट्स (commits)।

इस ट्रेनिंग प्रक्रिया को 4,096 Nvidia H200 GPUs के एक विशाल कंप्यूट क्लस्टर द्वारा समर्थन दिया गया था। विशेष रूप से, S 2.1 इस श्रृंखला का पहला मॉडल है जिसे FP8 प्रिसिजन में रिइन्फोर्समेंट लर्निंग (reinforcement learning) का उपयोग करके प्रशिक्षित किया गया है। "reward hacking" को रोकने के लिए—जहाँ एक मॉडल कार्य को हल करने के बजाय मौजूदा पुल रिक्वेस्ट (pull requests) को खोज सकता है—Poolside ने नेटवर्क एक्सेस को चुनिंदा रूप से ब्लॉक करने के लिए एक नया सैंडबॉक्स सिस्टम लागू किया है।

सुलभता और परिनियोजन

Laguna S 2.1 को OpenMDW 1.1 लाइसेंस (Linux Foundation द्वारा समर्थित) के तहत रिलीज़ किया गया है, जो व्यावसायिक उपयोग, संशोधन और पुनर्वितरण की अनुमति देता है। डेवलपर्स Hugging Face के माध्यम से, या Baseten, Vercel AI Gateway और OpenRouter जैसी होस्टेड सेवाओं के माध्यम से मॉडल तक पहुँच सकते हैं। OpenRouter मुफ़्त में एक महत्वपूर्ण 256K कॉन्टेक्स्ट विंडो प्रदान करता है, जिसमें एक पेड टियर एक मिलियन टोकन तक का समर्थन करता है।

मुख्य बातें

  • स्केल के बजाय दक्षता: Laguna S 2.1 साबित करता है कि दृढ़ता और वेरिफिकेशन जैसे एजेंटिक व्यवहार छोटे मॉडलों को ट्रिलियन-पैरामीटर सिस्टम से बेहतर प्रदर्शन करने की अनुमति दे सकते हैं।
  • तर्क (Reasoning) आवश्यक है: जटिल कार्यों के लिए "thinking mode" महत्वपूर्ण है, जो सभी प्रमुख कोडिंग बेंचमार्क में प्रदर्शन को काफी बढ़ाता है।
  • एजेंटिक ट्रेनिंग की सफलता: मॉडल की ताकत 409,000 विशेष वातावरणों और वास्तविक-दुनिया के कोड कमिट्स पर बड़े पैमाने पर पोस्ट-ट्रेनिंग से प्राप्त हुई है।