એક સિંગલ RTX 5090 પર લોકલી ચલાવવામાં આવેલા પાંચ LLM એજન્ટ્સના બેન્ચમાર્ક દર્શાવે છે કે 35-બિલિયન-પેરામીટર મિક્સચર-ઓફ-એક્સપર્ટ્સ (MoE) મોડેલે વાસ્તવિક કોડિંગ કાર્યમાં તેના સાથી મોડેલ્સ કરતા વધુ સારું પ્રદર્શન કર્યું છે. આ ટેસ્ટમાં, કોઈપણ ક્લાઉડ API વગર હાલના એડમિન પેનલમાં Tag Manager ઉમેરવામાં આવ્યો હતો, જેમાં Qwen 3.6 35B-A3B સ્પષ્ટ વિજેતા સાબિત થયું હતું.
આ ટેસ્ટ શા માટે મહત્વપૂર્ણ છે
પર્સનલ હાર્ડવેર પર લાર્જ લેંગ્વેજ મોડેલ્સ ચલાવવાથી ડેવલપર્સ API ફી અને ડેટા-પ્રાઇવસીની ચિંતાઓથી બચી શકે છે. તેમ છતાં, "લોકલ એજન્ટ્સ" હજુ પણ એક બઝવર્ડ છે: શું તેઓ ખરેખર માનવીય મદદ વગર ફાઇલો એડિટ કરી શકે છે, કમાન્ડ-લાઇન ટૂલ્સનો ઉપયોગ કરી શકે છે અને પ્રોડક્શન-રેડી કોડ તૈયાર કરી શકે છે? ક્લાઉડ સેવાઓ વગર કરવામાં આવેલ આ પ્રેક્ટિકલ સરખામણી ડેવલપર્સને ટેકનોલોજી અત્યારે કયા સ્તરે છે તેનો ચોક્કસ અંદાજ આપે છે.
હાર્ડવેર અને કાર્ય
પાંચેય મોડેલ્સ એક જ વર્કસ્ટેશન પર ચલાવવામાં આવ્યા હતા: એક RTX 5090 GPU, જે એક સામાન્ય હાઇ-એન્ડ કન્ઝ્યુમર કાર્ડ છે, અને કોઈ બાહ્ય સેવાઓનો ઉપયોગ કરવામાં આવ્યો ન હતો. કાર્ય જાણીજોઈને સરળ પણ પ્રતિનિધિત્વ કરતું રાખવામાં આવ્યું હતું – પહેલેથી બનેલા એડમિન સેક્શનમાં Tag Manager ઘટક ઉમેરવો. સફળતા માટે મોડેલે સાચી સોર્સ ફાઇલો શોધવી, તેને એડિટ કરવી અને નવી સુવિધા હાલની કાર્યક્ષમતાને બગાડ્યા વિના ઇન્ટિગ્રેટ થાય છે તેની ખાતરી કરવી જરૂરી હતી.
મોડેલનું પ્રદર્શન
- Qwen 3.6 35B-A3B (MoE) – કાર્ય સ્વાયત્ત રીતે પૂર્ણ કર્યું, માંગવામાં ન આવેલા સમજદારીભર્યા સુધારાઓ ઉમેર્યા અને રન પછી કોઈ પેચની જરૂર ન પડી.
- Qwen 3.6 27B (dense) – કાર્ય પૂર્ણ કર્યું પરંતુ લગભગ બમણા ઇન્ટરેક્શન સ્ટેપ્સ લીધા અને ક્યારેક સૂચનાઓનો ખોટો અર્થ કાઢ્યો.
- GLM-4.7-Flash (dense) – કાર્યરત અમલીકરણ તૈયાર કર્યું પરંતુ ખોટા ફાઇલ-મેચિંગ પેટર્નનો ઉપયોગ કર્યો અને સિક્યુરિટી ચેક્સ બાકી રાખ્યા, જેનાથી કોડ નબળો (vulnerable) બની ગયો.
- Qwythos-9B – કોઈપણ વાસ્તવિક ટૂલ્સનો ઉપયોગ કર્યો નહીં; આ નિષ્ફળતા મોડેલ પોતે અથવા લોકલ સેટઅપને કારણે હોઈ શકે છે, પરંતુ ટેસ્ટ તેના ચોક્કસ કારણને અલગ કરી શક્યો નહીં.
- Nemotron-3-Nano (hybrid) – લૂપમાં ફસાઈ ગયું, જે ફોલ્ડર તે પહેલેથી જ શોધી ચુક્યું હતું તેને શોધવામાં 40 ટર્ન વાપર્યા અને તે પછી આગળ વધી શક્યું નહીં.
પરિણામો શું દર્શાવે છે
આર્કિટેક્ચર એ વિશ્વસનીય અનુમાનિત પરિબળ નથી
MoE મોડેલ, જે તેના પેરામીટર્સને મલ્ટિપલ એક્સપર્ટ સબ-નેટવર્ક્સમાં વિભાજિત કરે છે, તે સ્પષ્ટ વિજેતા રહ્યું, જ્યારે dense અને hybrid વેરિઅન્ટ્સ સફળતા અને સંપૂર્ણ નિષ્ફળતા વચ્ચે વહેંચાયેલા હતા. આ સૂચવે છે કે માત્ર આર્કિટેક્ચરલ પસંદગીઓ ટૂલ-યુઝ ક્ષમતાની ખાતરી આપતી નથી.
ટૂલનો ઉપયોગ હજુ પણ એક મોટો અવરોધ છે
પાંચેય એજન્ટોમાંથી કોઈએ ટેસ્ટ માટે આપવામાં આવેલા ડેડિકેટેડ સ્ક્રીનશોટ ટૂલનો ઉપયોગ કર્યો નથી. દરેકે ફાઇલના નામ અનુમાન કરીને અથવા પરોક્ષ રીતે કામ ચલાવવાનો પ્રયાસ કરીને કામ કરવાની કોશિશ કરી. "કોડ જનરેટ કરી શકે છે" અને "બાહ્ય યુટિલિટીઝનું સંચાલન કરી શકે છે" વચ્ચેનો તફાવત હજુ પણ ઘણો મોટો છે.
લોકલી ચલાવવાનો અર્થ માત્ર મોડેલ જ નહીં, પણ આખા સ્ટેકને ડિબગ કરવાનો છે
ટેસ્ટ શરૂ થાય તે પહેલાં જ બે મોડેલ્સના પ્રોમ્પ્ટ ટેમ્પ્લેટ્સમાં તાત્કાલિક સુધારા (patches) કરવાની જરૂર પડી હતી. મોડેલ-વિશિષ્ટ બગ્સ સુધારવામાં ખર્ચાયેલ પ્રયાસ વાસ્તવિક Tag Manager કોડ લખવામાં ખર્ચાયેલા સમય કરતા પણ વધી ગયો હતો, જે દર્શાવે છે કે વર્તમાન લોકલ ડિપ્લોયમેન્ટ્સ કેટલા અસ્થિર છે.
સાવચેતી માટે નોંધ
આ બેન્ચમાર્ક એક સિંગલ હાર્ડવેર કોન્ફિગરેશન, એક સિંગલ કોડિંગ સિનારિયો અને મોડેલ્સના નાના સેટને પ્રતિબિંબિત કરે છે. Qwen 3.6 35B-A3B અગાઉના રાઉન્ડમાં નિષ્ફળ ગયું હતું; તેની અગાઉની નિષ્ફળતા એક અકસ્માત હતી. તેથી પરિણામો સૂચક છે, નિર્ણાયક નથી.
આગળ શું જોવું
ભવિષ્યના રાઉન્ડમાં કાર્ય સેટને વિસ્તારવાની, વધુ વૈવિધ્યસભર ટૂલચેઈન્સનો સમાવેશ કરવાની અને હાર્ડવેરની વિશાળ શ્રેણી પર ટેસ્ટ કરવાની જરૂર પડશે. નિરીક્ષકોએ ટ્રેક કરવું જોઈએ કે શું MoE મોડેલ્સ સતત dense અને hybrid ડિઝાઇન કરતા વધુ સારું પ્રદર્શન કરે છે, અને શું ડેવલપર્સ એવા વિશ્વસનીય રેપર્સ બનાવી શકે છે જે મેન્યુઅલ બગ-પેચિંગની જરૂરિયાતને દૂર કરે.
મુખ્ય વાત: 35B MoE મોડેલ પહેલેથી જ એક સક્ષમ લોકલ કોડિંગ આસિસ્ટન્ટ તરીકે કામ કરી શકે છે, પરંતુ વિશાળ ઇકોસિસ્ટમ—ટૂલ ઇન્ટિગ્રેશન, પ્રોમ્પ્ટ એન્જિનિયરિંગ અને સ્ટેબલ રનટાઇમ્સ—હજુ પણ પાછળ છે. જ્યાં સુધી આ તમામ ભાગો એકસાથે કામ ન કરે, ત્યાં સુધી ડેવલપર્સે "પ્લગ-એન્ડ-પ્લે" લોકલ એજન્ટ્સ વિશેની અપેક્ષાઓ પર કાબૂ રાખવો જોઈએ.
