Poolside નું Laguna S 2.1: નાનું Open-Weight મોડેલ કોડિંગ AI ને પુનઃવ્યાખ્યાયિત કરે છે
Poolside એ Laguna S 2.1 રિલીઝ કર્યું છે, જે એક કોમ્પેક્ટ open-weight કોડિંગ મોડેલ છે જે નોંધપાત્ર રીતે મોટા સ્પર્ધકો કરતા વધુ સારું પ્રદર્શન કરી રહ્યું છે. કાચા પેરામીટર કાઉન્ટ (parameter count) કરતા એજન્ટિક પર્સિસ્ટન્સ (agentic persistence) અને રીઝનિંગ (reasoning) ને પ્રાધાન્ય આપીને, આ રિલીઝ વિશિષ્ટ LLM ડેવલપમેન્ટ પ્રત્યેના આપણા અભિગમમાં એક મોટો ફેરફાર સૂચવે છે.
ટ્રિલિયન-પેરામીટર ધરાવતા દિગ્ગજો કરતા વધુ સારું પ્રદર્શન
Laguna S 2.1 એ સાબિત કરી રહ્યું છે કે મોડેલ સ્કેલ એ બુદ્ધિ મેળવવાનો એકમાત્ર માર્ગ નથી. Terminal-Bench 2.1 benchmark પર, જે લાંબા સમય સુધી ચાલતા ટર્મિનલ કાર્યોનું મૂલ્યાંકન કરે છે, જ્યારે "thinking mode" સક્ષમ હોય ત્યારે મોડેલે 70.2% સ્કોર મેળવ્યો હતો. આ પ્રદર્શન તેને Tencent ના વિશાળ 295B-A21B Hy3 મોડેલની બરાબર પાછળ રાખે છે, પરંતુ DeepSeek-V4-Pro-Max અને Nemotron 3 Ultra જેવા ઘણા મોટા open-weights સિસ્ટમ્સ કરતા આગળ રાખે છે.
Datacurve DeepSWE benchmark પર આ તફાવત વધુ સ્પષ્ટ બને છે. Laguna S 2.1 એ 40.4% સ્કોર મેળવ્યો છે, જે એક ટ્રિલિયનથી વધુ પેરામીટર્સ ધરાવતા અનેક open-weight મોડેલ્સની સરખામણીમાં આશ્ચર્યજનક પરિણામ છે, જે 10% નો આંકડો પણ પાર કરવામાં નિષ્ફળ રહ્યા હતા. આ મોડેલ SWE-Bench Multilingual, SWE-Bench Pro, અને SWE Atlas માં પણ શ્રેષ્ઠ પ્રદર્શન દર્શાવે છે, જે જટિલ સોફ્ટવેર એન્જિનિયરિંગ વર્કફ્લોમાં તેની ઉપયોગિતા સાબિત કરે છે.
પર્સિસ્ટન્સ અને "Thinking" ની શક્તિ
Laguna S 2.1 માટે મુખ્ય તફાવત તેની "thinking mode" છે, જે pass-at-one રેટમાં મોટો સુધારો કરે છે. આ રીઝનિંગ સ્ટેપ વગર, Terminal-Bench સ્કોર 70.2% થી ઘટીને 60.4% થઈ જાય છે, અને DeepSWE સ્કોર 40.4% થી ઘટીને 16.5% થઈ જાય છે.
Poolside નો દાવો છે કે માત્ર બુદ્ધિ વધારવાને બદલે, તેઓએ ક્ષમતા તરફ દોરી જાય તેવા "behaviors" (વર્તણૂક) સુધારવા પર ધ્યાન કેન્દ્રિત કર્યું છે. આમાં વધારાનું વેરિફિકેશન, ધારણાઓને પૂર્વધારણા તરીકે સ્વીકારવાની વૃત્તિ ઘટાડવી અને પર્સિસ્ટન્સ (મક્કમતા) કેળવવાનો સમાવેશ થાય છે. દસ્તાવેજી ટ્રાયલ્સમાં, મોડેલે માત્ર 50 મિનિટમાં ખાલી ફોલ્ડરમાંથી એક કાર્યકારી બ્રાઉઝર એન્જિન બનાવ્યું હતું. વધુ આશ્ચર્યજનક રીતે, તેણે માત્ર 40 રીઝનિંગ સ્ટેપ્સનો ઉપયોગ કરીને અને માત્ર $0.088 ના ખર્ચે Erdos Problem #397—જે 1975 થી વણઉકેલાયેલું ગણિતનું પ્રશ્ન છે—તેનો ઉકેલ સ્વતંત્ર રીતે ફરીથી શોધી કાઢ્યો.
મોટા પાયે એજન્ટિક ટ્રેનિંગ
અગાઉના XS 2.1 વર્ઝનથી S 2.1 સુધીના પ્રદર્શનમાં આવેલો ઉછાળો નવા pre-training ડેટાને બદલે સઘન post-training દ્વારા આવ્યો હતો. એજન્ટિક ટ્રેનિંગ ફેઝમાં 409,000 અલગ-અલગ એન્વાયરમેન્ટ્સનો ઉપયોગ કરવામાં આવ્યો હતો, જેમાં નીચેનાનો સમાવેશ થાય છે:
- 83,000 ટર્મિનલ-વિશિષ્ટ કાર્યો માટેના એન્વાયરમેન્ટ્સ.
- 168,000 સોફ્ટવેર એન્જિનિયરિંગ વર્કફ્લો માટેના એન્વાયરમેન્ટ્સ.
- અંદાજે 17,000 રિપોઝીટરીઝમાંથી મેળવેલા 38,000 રિયલ-વર્લ્ડ કમિટ્સ.
આ ટ્રેનિંગ પ્રક્રિયાને 4,096 Nvidia H200 GPUs ના વિશાળ કમ્પ્યુટ ક્લસ્ટર દ્વારા ટેકો આપવામાં આવ્યો હતો. નોંધપાત્ર રીતે, S 2.1 એ શ્રેણીનું પ્રથમ મોડેલ છે જેને FP8 પ્રિસિઝનમાં reinforcement learning નો ઉપયોગ કરીને તાલીમ આપવામાં આવી છે. "reward hacking" ને રોકવા માટે—જ્યાં મોડેલ કાર્ય ઉકેલવાને બદલે અસ્તિત્વમાં રહેલા pull requests શોધી શકે છે—Poolside એ નેટવર્ક એક્સેસને પસંદગીયુક્ત રીતે બ્લોક કરવા માટે એક નવી sandbox સિસ્ટમ અમલમાં મૂકી છે.
સુલભતા અને ડિપ્લોયમેન્ટ
Laguna S 2.1 ને OpenMDW 1.1 લાયસન્સ (Linux Foundation દ્વારા સમર્થિત) હેઠળ રિલીઝ કરવામાં આવ્યું છે, જે વ્યાવસાયિક ઉપયોગ, ફેરફાર અને પુનઃવિતરણની મંજૂરી આપે છે. ડેવલપર્સ Hugging Face દ્વારા, અથવા Baseten, Vercel AI Gateway અને OpenRouter જેવી હોસ્ટેડ સેવાઓ દ્વારા મોડેલનો ઉપયોગ કરી શકે છે. OpenRouter મફતમાં નોંધપાત્ર 256K context window ઓફર કરે છે, જ્યારે પેઇડ ટાયર એક મિલિયન ટોકન્સ સુધી સપોર્ટ કરે છે.
મુખ્ય મુદ્દાઓ
- સ્કેલ કરતા કાર્યક્ષમતા: Laguna S 2.1 સાબિત કરે છે કે પર્સિસ્ટન્સ અને વેરિફિકેશન જેવા એજન્ટિક બિહેવિયર્સ નાના મોડેલ્સને ટ્રિલિયન-પેરામીટર સિસ્ટમ્સ કરતા વધુ સારું પ્રદર્શન કરવા દે છે.
- રીઝનિંગ આવશ્યક છે: જટિલ કાર્યો માટે "thinking mode" નિર્ણાયક છે, જે તમામ મુખ્ય કોડિંગ benchmarks માં પ્રદર્શનમાં નોંધપાત્ર વધારો કરે છે.
- એજન્ટિક ટ્રેનિંગની સફળતા: મોડેલની શક્તિ 409,000 વિશિષ્ટ એન્વાયરમેન્ટ્સ અને રિયલ-વર્લ્ડ કોડ કમિટ્સ પરના વિશાળ પાયાના post-training માંથી મળે છે.
