एक सिंगल RTX 5090 पर पांच स्थानीय रूप से चलाए गए LLM एजेंट्स के बेंचमार्क से पता चलता है कि 35-बिलियन-पैरामीटर वाले mixture-of-experts (MoE) मॉडल ने एक वास्तविक कोडिंग कार्य में अपने साथियों को पीछे छोड़ दिया। इस परीक्षण में, बिना किसी क्लाउड API के एक मौजूदा एडमिन पैनल में Tag Manager जोड़ा गया, जिसमें Qwen 3.6 35B-A3B स्पष्ट विजेता बनकर उभरा।

यह परीक्षण क्यों महत्वपूर्ण है

पर्सनल हार्डवेयर पर लार्ज लैंग्वेज मॉडल्स को चलाने से डेवलपर्स API फीस और डेटा-प्राइवेसी की चिंताओं से बच सकते हैं। फिर भी "लोकल एजेंट्स" एक चर्चित शब्द (buzzword) बना हुआ है: क्या वे वास्तव में बिना किसी मानवीय सहायता के फाइलों को एडिट कर सकते हैं, कमांड-लाइन टूल्स को कॉल कर सकते हैं, और प्रोडक्शन-रेडी कोड तैयार कर सकते हैं? क्लाउड सेवाओं के बिना किया गया यह व्यावहारिक तुलनात्मक अध्ययन डेवलपर्स को यह समझने का एक ठोस आधार देता है कि तकनीक वर्तमान में किस स्तर पर है।

हार्डवेयर और कार्य

पांचों मॉडल एक ही वर्कस्टेशन पर चले: एक RTX 5090 GPU, जो कि एक विशिष्ट हाई-एंड कंज्यूमर कार्ड है, और इसमें किसी बाहरी सेवा का उपयोग नहीं किया गया। कार्य जानबूझकर सरल लेकिन प्रतिनिधि रखा गया था – पहले से बने एडमिन सेक्शन में एक Tag Manager कंपोनेंट जोड़ना। सफलता के लिए मॉडल को सही सोर्स फाइलों को ढूंढना, उन्हें एडिट करना और यह सत्यापित करना आवश्यक था कि नया फीचर मौजूदा कार्यक्षमता को बाधित किए बिना एकीकृत हो गया है।

मॉडल का प्रदर्शन

  • Qwen 3.6 35B-A3B (MoE) – कार्य को स्वायत्त रूप से पूरा किया, बिना मांगे ही कुछ समझदारी भरे सुधार किए, और इसके बाद किसी पैच की आवश्यकता नहीं पड़ी।
  • Qwen 3.6 27B (dense) – कार्य पूरा किया लेकिन इसमें लगभग दोगुने इंटरैक्शन स्टेप्स लगे और कभी-कभी निर्देशों की गलत व्याख्या की।
  • GLM-4.7-Flash (dense) – एक वर्किंग इम्प्लीमेंटेशन तैयार किया लेकिन गलत फाइल-मैचिंग पैटर्न का उपयोग किया और सुरक्षा जांच (security checks) छोड़ दी, जिससे कोड असुरक्षित रह गया।
  • Qwythos-9B – किसी भी वास्तविक टूल को निष्पादित नहीं किया; यह विफलता मॉडल की वजह से या लोकल सेटअप की वजह से हो सकती है, लेकिन परीक्षण इस कारण को अलग से स्पष्ट नहीं कर सका।
  • Nemotron-3-Nano (hybrid) – एक लूप में फंस गया, उस फोल्डर को खोजने में 40 टर्न खर्च कर दिए जिसे वह पहले ही ढूंढ चुका था, और उस बिंदु से आगे नहीं बढ़ सका।

परिणाम क्या दर्शाते हैं

आर्किटेक्चर एक विश्वसनीय संकेतक नहीं है

MoE मॉडल, जो अपने पैरामीटर्स को कई एक्सपर्ट सब-नेटवर्क्स में विभाजित करता है, स्पष्ट रूप से जीत गया, जबकि dense और hybrid वेरिएंट्स के परिणाम सफलता और पूर्ण विफलता के बीच बंटे रहे। यह सुझाव देता है कि केवल आर्किटेक्चरल विकल्प टूल-उपयोग की क्षमता की गारंटी नहीं देते हैं।

टूल का उपयोग अभी भी एक बड़ी बाधा है

पांचों एजेंट्स में से किसी ने भी परीक्षण के लिए दिए गए समर्पित स्क्रीनशॉट टूल का उपयोग नहीं किया। सभी ने या तो फाइल के नाम का अनुमान लगाकर या अप्रत्यक्ष तरीकों (workarounds) को अपनाकर काम चलाने की कोशिश की। "कोड जेनरेट कर सकता है" और "एक्सटर्नल यूटिलिटीज को संचालित कर सकता है" के बीच का अंतर अभी भी बहुत अधिक है।

लोकल पर चलाने का मतलब है केवल मॉडल ही नहीं, बल्कि पूरे स्टैक को डीबग करना

परीक्षण शुरू होने से पहले ही दो मॉडल्स के प्रॉम्प्ट टेम्पलेट्स में तुरंत सुधार (on-the-fly patches) करने की आवश्यकता पड़ी। मॉडल-विशिष्ट बग्स को ठीक करने में लगने वाला समय वास्तविक Tag Manager कोड लिखने में लगने वाले समय से कहीं अधिक था, जो यह दर्शाता है कि वर्तमान लोकल डिप्लॉयमेंट कितने नाजुक हैं।

सावधानी का एक नोट

यह बेंचमार्क एक ही हार्डवेयर कॉन्फ़िगरेशन, एक ही कोडिंग परिदृश्य और मॉडल्स के एक छोटे समूह को दर्शाता है। Qwen 3.6 35B-A3B पहले एक राउंड में विफल रहा था; उसकी पिछली विफलता महज एक इत्तेफाक थी। इसलिए, ये परिणाम सांकेतिक हैं, निर्णायक नहीं।

आगे क्या देखना चाहिए

भविष्य के राउंड में टास्क सेट का विस्तार करने, अधिक विविध टूलचेन शामिल करने और हार्डवेयर की एक विस्तृत श्रृंखला पर परीक्षण करने की आवश्यकता होगी। पर्यवेक्षकों को इस बात पर नज़र रखनी चाहिए कि क्या MoE मॉडल लगातार dense और hybrid डिज़ाइनों से बेहतर प्रदर्शन करते हैं, और क्या डेवलपर्स ऐसे विश्वसनीय रैपर्स (wrappers) बना सकते हैं जो मैन्युअल बग-पैचिंग की आवश्यकता को समाप्त कर दें।

निष्कर्ष: एक 35B MoE मॉडल पहले से ही एक सक्षम लोकल कोडिंग असिस्टेंट के रूप में कार्य कर सकता है, लेकिन व्यापक इकोसिस्टम—टूल इंटीग्रेशन, प्रॉम्प्ट इंजीनियरिंग और स्टेबल रनटाइम—अभी भी पीछे है। जब तक ये सभी हिस्से एक साथ नहीं जुड़ जाते, डेवलपर्स को "प्लग-एंड-प्ले" लोकल एजेंट्स के बारे में अपनी उम्मीदों को सीमित रखना चाहिए।