Poolside-এর Laguna S 2.1: ছোট ওপেন-ওয়েট মডেল কোডিং AI-এর সংজ্ঞা বদলে দিচ্ছে
Poolside তাদের Laguna S 2.1 প্রকাশ করেছে, যা একটি কম্প্যাক্ট ওপেন-ওয়েট কোডিং মডেল এবং এটি অনেক বড় প্রতিযোগী মডেলগুলোকে উল্লেখযোগ্যভাবে ছাড়িয়ে যাচ্ছে। প্যারামিটার সংখ্যার চেয়ে এজেন্টিক পারসিস্টেন্স (agentic persistence) এবং রিজনিং-এর (reasoning) ওপর গুরুত্ব দিয়ে এই রিলিজটি বিশেষায়িত LLM ডেভেলপমেন্টের ক্ষেত্রে একটি আমূল পরিবর্তন বা প্যারাডাইম শিফট নির্দেশ করছে।
ট্রিলিয়ন-প্যারামিটার বিশিষ্ট জায়ান্টদের ছাড়িয়ে যাওয়া
Laguna S 2.1 প্রমাণ করছে যে মডেলের স্কেল বা আকার বুদ্ধিমত্তার একমাত্র পথ নয়। Terminal-Bench 2.1 বেঞ্চমার্কে, যা দীর্ঘমেয়াদী টার্মিনাল টাস্কগুলো মূল্যায়ন করে, "thinking mode" চালু থাকলে মডেলটি ৭০.২% স্কোর অর্জন করেছে। এই পারফরম্যান্সের কারণে এটি টেনসেন্টের (Tencent) বিশাল ২৯৫B-A21B Hy3 মডেলের ঠিক পরেই অবস্থান করছে, তবে DeepSeek-V4-Pro-Max এবং Nemotron 3 Ultra-এর মতো অনেক বড় ওপেন-ওয়েট সিস্টেমগুলোকে পেছনে ফেলে দিয়েছে।
Datacurve DeepSWE বেঞ্চমার্কে এই ব্যবধান আরও স্পষ্ট হয়ে উঠেছে। Laguna S 2.1 স্কোর করেছে ৪০.৪%, যা এক ট্রিলিয়নেরও বেশি প্যারামিটার বিশিষ্ট বেশ কিছু ওপেন-ওয়েট মডেলের তুলনায় বিস্ময়কর—যে মডেলগুলো ১০% স্কোরও করতে ব্যর্থ হয়েছে। মডেলটি SWE-Bench Multilingual, SWE-Bench Pro এবং SWE Atlas-এর ক্ষেত্রেও অসাধারণ পারফরম্যান্স দেখিয়েছে, যা জটিল সফটওয়্যার ইঞ্জিনিয়ারিং ওয়ার্কফ্লোতে এর উপযোগিতা প্রমাণ করে।
পারসিস্টেন্স এবং "Thinking"-এর শক্তি
Laguna S 2.1-এর একটি প্রধান বৈশিষ্ট্য হলো এর "thinking mode", যা pass-at-one রেট নাটকীয়ভাবে উন্নত করে। এই রিজনিং ধাপটি ছাড়া Terminal-Bench স্কোর ৭০.২% থেকে কমে ৬০.৪% হয়ে যায় এবং DeepSWE স্কোর ৪০.৪% থেকে কমে ১৬.৫% হয়ে যায়।
Poolside যুক্তি দিচ্ছে যে, কেবল বুদ্ধিমত্তা বাড়ানোর পরিবর্তে তারা এমন "behaviors" বা আচরণের উন্নতির দিকে মনোনিবেশ করেছে যা সক্ষমতা বৃদ্ধিতে সহায়তা করে। এর মধ্যে রয়েছে বর্ধিত ভেরিফিকেশন, কোনো কিছুকে অনুমান হিসেবে ধরে নেওয়ার প্রবণতা কমানো এবং পারসিস্টেন্স বা অধ্যবসায় বৃদ্ধি করা। নথিবদ্ধ পরীক্ষায় দেখা গেছে, মডেলটি মাত্র ৫০ মিনিটে একটি খালি ফোল্ডার থেকে একটি কার্যকরী ব্রাউজার ইঞ্জিন তৈরি করেছে। আরও বিস্ময়কর বিষয় হলো, এটি মাত্র ৪০টি রিজনিং স্টেপ ব্যবহার করে এবং মাত্র $০.০৮৮ খরচ করে Erdos Problem #397-এর সমাধানটি স্বাধীনভাবে পুনরায় আবিষ্কার করেছে—যা ১৯৭৫ সাল থেকে অমীমাংসিত একটি গাণিতিক সমস্যা।
বৃহৎ পরিসরে এজেন্টিক ট্রেনিং
পূর্ববর্তী XS 2.1 ভার্সন থেকে S 2.1-এ পারফরম্যান্সের এই বিশাল লাফটি নতুন প্রি-ট্রেনিং ডেটার পরিবর্তে নিবিড় পোস্ট-ট্রেনিংয়ের মাধ্যমে এসেছে। এজেন্টিক ট্রেনিং পর্যায়ে ৪০৯,০০০টি স্বতন্ত্র এনভায়রনমেন্ট ব্যবহার করা হয়েছে, যার মধ্যে রয়েছে:
- ৮৩,০০০ টার্মিনাল-নির্দিষ্ট টাস্কের এনভায়রনমেন্ট।
- ১৬৮,০০০ সফটওয়্যার ইঞ্জিনিয়ারিং ওয়ার্কফ্লোর এনভায়রনমেন্ট।
- প্রায় ১৭,০০০টি রিপোজিটরি থেকে সংগৃহীত ৩৮,০০০টি রিয়েল-ওয়ার্ল্ড কমিট।
এই ট্রেনিং প্রক্রিয়াটি ৪,০৯৬টি Nvidia H200 GPU-এর একটি বিশাল কম্পিউট ক্লাস্টার দ্বারা সমর্থিত ছিল। উল্লেখযোগ্যভাবে, S 2.1 হলো এই সিরিজের প্রথম মডেল যা FP8 প্রিসিশনে রিইনফোর্সমেন্ট লার্নিং ব্যবহার করে প্রশিক্ষণপ্রাপ্ত। "reward hacking" প্রতিরোধ করতে—যেখানে একটি মডেল টাস্ক সমাধান করার পরিবর্তে বিদ্যমান পুল রিকোয়েস্টগুলো খুঁজতে পারে—Poolside নেটওয়ার্ক অ্যাক্সেস নির্বাচনীভাবে ব্লক করার জন্য একটি নতুন স্যান্ডবক্স সিস্টেম চালু করেছে।
অ্যাক্সেসিবিলিটি এবং ডেপ্লয়মেন্ট
Laguna S 2.1 OpenMDW 1.1 লাইসেন্সের অধীনে (Linux Foundation দ্বারা সমর্থিত) মুক্তি পেয়েছে, যা বাণিজ্যিক ব্যবহার, পরিবর্তন এবং পুনঃবিতরণের অনুমতি দেয়। ডেভেলপাররা Hugging Face-এর মাধ্যমে অথবা Baseten, Vercel AI Gateway এবং OpenRouter-এর মতো হোস্ট করা সার্ভিসের মাধ্যমে এই মডেলটি ব্যবহার করতে পারবেন। OpenRouter বিনামূল্যে একটি বিশাল ২৫৬K কনটেক্সট উইন্ডো অফার করে, এবং তাদের পেইড টিয়ারে দশ লক্ষ (one million) টোকেন পর্যন্ত সাপোর্ট রয়েছে।
মূল বিষয়সমূহ
- স্কেলের চেয়ে দক্ষতা বেশি গুরুত্বপূর্ণ: Laguna S 2.1 প্রমাণ করে যে পারসিস্টেন্স এবং ভেরিফিকেশনের মতো এজেন্টিক আচরণ ছোট মডেলগুলোকে ট্রিলিয়ন-প্যারামিটার সিস্টেমের চেয়েও উন্নত পারফরম্যান্স করতে সাহায্য করতে পারে।
- রিজনিং অপরিহার্য: জটিল কাজের জন্য "thinking mode" অত্যন্ত গুরুত্বপূর্ণ, যা সমস্ত প্রধান কোডিং বেঞ্চমার্কে পারফরম্যান্স উল্লেখযোগ্যভাবে বৃদ্ধি করে।
- এজেন্টিক ট্রেনিংয়ের সাফল্য: মডেলটির শক্তি এসেছে ৪০৯,০০০টি বিশেষায়িত এনভায়রনমেন্ট এবং রিয়েল-ওয়ার্ল্ড কোড কমিটের মাধ্যমে বিশাল পরিসরে সম্পন্ন পোস্ট-ট্রেনিং থেকে।
