একটি একক RTX 5090-এ পাঁচটি লোকালি চালানো LLM এজেন্টের একটি বেঞ্চমার্ক দেখায় যে, একটি ৩৫-বিলিয়ন-প্যারামিটার mixture-of-experts (MoE) মডেল একটি বাস্তবধর্মী কোডিং টাস্কে তার সমপর্যায়ের মডেলগুলোকে ছাড়িয়ে গেছে। পরীক্ষাটি কোনো ক্লাউড API ব্যবহার না করেই একটি বিদ্যমান অ্যাডমিন প্যানেলে একটি Tag Manager যুক্ত করার কাজ ছিল, যেখানে Qwen 3.6 35B-A3B স্পষ্ট বিজয়ী হিসেবে আবির্ভূত হয়েছে।

কেন এই পরীক্ষাটি গুরুত্বপূর্ণ

ব্যক্তিগত হার্ডওয়্যারে লার্জ ল্যাঙ্গুয়েজ মডেল চালানো ডেভেলপারদের API ফি এবং ডেটা-প্রাইভেসি সংক্রান্ত উদ্বেগ এড়াতে সাহায্য করে। তবুও "local agents" শব্দটি এখনও একটি বহুল আলোচিত শব্দ: তারা কি সত্যিই কোনো মানুষের সাহায্য ছাড়াই ফাইল এডিট করতে পারে, কমান্ড-লাইন টুল কল করতে পারে এবং প্রোডাকশন-রেডি কোড তৈরি করতে পারে? ক্লাউড পরিষেবা ছাড়া এই হাতে-কলমে তুলনাটি ডেভেলপারদের প্রযুক্তিটি বর্তমানে কোন অবস্থানে আছে সে সম্পর্কে একটি বাস্তব ধারণা দেয়।

হার্ডওয়্যার এবং টাস্ক

পাঁচটি মডেলই একই ওয়ার্কস্টেশনে চালানো হয়েছিল: একটি RTX 5090 GPU, যা একটি সাধারণ হাই-এন্ড কনজিউমার কার্ড, এবং কোনো বাহ্যিক পরিষেবা ব্যবহার করা হয়নি। টাস্কটি উদ্দেশ্যমূলকভাবে সহজ কিন্তু প্রতিনিধিত্বমূলক ছিল – একটি ইতিমধ্যে তৈরি করা অ্যাডমিন সেকশনে একটি Tag Manager কম্পোনেন্ট যুক্ত করা। সফল হওয়ার জন্য মডেলটিকে সঠিক সোর্স ফাইলগুলো খুঁজে বের করতে হবে, সেগুলো এডিট করতে হবে এবং নতুন ফিচারটি বিদ্যমান কার্যকারিতা নষ্ট না করে সঠিকভাবে ইন্টিগ্রেট হয়েছে কিনা তা যাচাই করতে হবে।

মডেলের পারফরম্যান্স

  • Qwen 3.6 35B-A3B (MoE) – স্বয়ংক্রিয়ভাবে কাজটি সম্পন্ন করেছে, অনুরোধ না করা সত্ত্বেও কিছু যুক্তিসঙ্গত উন্নতি যোগ করেছে এবং রান করার পর কোনো প্যাচ (patch) করার প্রয়োজন হয়নি।
  • Qwen 3.6 27B (dense) – টাস্কটি সম্পন্ন করেছে কিন্তু প্রায় দ্বিগুণ সংখ্যক ইন্টারঅ্যাকশন স্টেপ নিয়েছে এবং মাঝে মাঝে নির্দেশাবলী ভুলভাবে ব্যাখ্যা করেছে।
  • GLM-4.7-Flash (dense) – একটি কার্যকর ইমপ্লিমেন্টেশন তৈরি করেছে কিন্তু ভুল ফাইল-ম্যাচিং প্যাটার্ন ব্যবহার করেছে এবং সিকিউরিটি চেক বাদ দিয়েছে, যার ফলে কোডটি অরক্ষিত থেকে গেছে।
  • Qwythos-9B – কোনো বাস্তব টুল কার্যকর করতে পারেনি; এই ব্যর্থতা মডেলটির নিজস্ব ত্রুটি বা লোকাল সেটআপের কারণে হতে পারে, তবে পরীক্ষাটি এর কারণ আলাদাভাবে চিহ্নিত করতে পারেনি।
  • Nemotron-3-Nano (hybrid) – একটি লুপে আটকে গিয়েছিল, ইতিমধ্যে খুঁজে পাওয়া একটি ফোল্ডার খোঁজার জন্য ৪০টি টার্ন ব্যয় করেছে এবং এরপর আর কোনো উন্নতি করতে পারেনি।

ফলাফল যা প্রকাশ করে

আর্কিটেকচার কোনো নির্ভরযোগ্য নির্দেশক নয়

MoE মডেলটি, যা তার প্যারামিটারগুলোকে একাধিক এক্সপার্ট সাব-নেটওয়ার্কের মধ্যে ভাগ করে নেয়, সরাসরি জয়ী হয়েছে; অন্যদিকে dense এবং hybrid সংস্করণগুলোর মধ্যে সাফল্য এবং সম্পূর্ণ ব্যর্থতার মিশ্রণ দেখা গেছে। এটি নির্দেশ করে যে শুধুমাত্র আর্কিটেকচারাল পছন্দ টুল ব্যবহারের দক্ষতা নিশ্চিত করে না।

টুল ব্যবহার এখনও একটি বড় বাধা

পাঁচটি এজেন্টের কেউই পরীক্ষার জন্য সরবরাহ করা ডেডিকেটেড স্ক্রিনশট টুলটি ব্যবহার করেনি। সবাই ফাইল নেম অনুমান করে বা পরোক্ষভাবে কাজ চালানোর চেষ্টা করে ইমপ্রোভাইজ করার চেষ্টা করেছে। "কোড জেনারেট করতে পারা" এবং "এক্সটার্নাল ইউটিলিটি পরিচালনা করতে পারা"-র মধ্যে ব্যবধান এখনও অনেক বেশি।

লোকালি চালানোর অর্থ কেবল মডেল নয়, বরং পুরো স্ট্যাক ডিবাগ করা

পরীক্ষা শুরু করার আগেই দুটি মডেলের প্রম্পট টেমপ্লেটে তাৎক্ষণিক প্যাচ (on-the-fly patches) করার প্রয়োজন হয়েছিল। মডেল-নির্দিষ্ট বাগগুলো ঠিক করতে যে শ্রম ব্যয় হয়েছে, তা আসল Tag Manager কোড লেখার সময়ের চেয়েও বেশি ছিল, যা বর্তমান লোকাল ডিপ্লয়মেন্টগুলোর ভঙ্গুরতা তুলে ধরে।

সতর্কবার্তা

এই বেঞ্চমার্কটি একটি একক হার্ডওয়্যার কনফিগারেশন, একটি একক কোডিং সিনারিও এবং কয়েকটি মডেলের একটি ছোট সেটকে প্রতিফলিত করে। Qwen 3.6 35B-A3B এর আগে একটি রাউন্ডে ব্যর্থ হয়েছিল; এর আগের ব্যর্থতা ছিল একটি আকস্মিক ঘটনা। তাই এই ফলাফলগুলো নির্দেশক মাত্র, চূড়ান্ত নয়।

পরবর্তী লক্ষ্য

ভবিষ্যতের রাউন্ডগুলোতে টাস্ক সেট আরও বিস্তৃত করা, আরও বৈচিত্র্যময় টুলচেইন অন্তর্ভুক্ত করা এবং আরও বিস্তৃত হার্ডওয়্যারে পরীক্ষা করা প্রয়োজন হবে। পর্যবেক্ষকদের নজর রাখা উচিত যে MoE মডেলগুলো ধারাবাহিকভাবে dense এবং hybrid ডিজাইনের চেয়ে ভালো পারফর্ম করে কিনা, এবং ডেভেলপাররা কি এমন নির্ভরযোগ্য র‍্যাপার (wrapper) তৈরি করতে পারে যা ম্যানুয়াল বাগ-প্যাচিংয়ের প্রয়োজনীয়তা দূর করে।

সারকথা: একটি 35B MoE মডেল ইতিমধ্যেই একজন দক্ষ লোকাল কোডিং অ্যাসিস্ট্যান্ট হিসেবে কাজ করতে পারে, তবে বৃহত্তর ইকোসিস্টেম—টুল ইন্টিগ্রেশন, প্রম্পট ইঞ্জিনিয়ারিং এবং স্ট্যাবল রানটাইম—এখনও পিছিয়ে আছে। যতক্ষণ না এই অংশগুলো সঠিকভাবে কাজ করছে, ততক্ষণ ডেভেলপারদের "plug-and-play" লোকাল এজেন্ট সম্পর্কে প্রত্যাশা কিছুটা সীমিত রাখা উচিত।