Jaribio la kulinganisha (benchmark) la mawakala watano wa LLM wanaojiendesha ndani (locally run) kwenye RTX 5090 moja linaonyesha kuwa modeli ya mixture-of-experts (MoE) yenye vigezo (parameters) bilioni 35 ilifanya vizuri zaidi kuliko washindani wake katika kazi halisi ya uandishi wa kodi. Jaribio hilo, ambalo liliongeza Tag Manager kwenye paneli ya admin iliyokuwepo bila kutumia API za wingu (cloud APIs), lilimtangaza Qwen 3.6 35B-A3B kuwa mshindi dhahiri.
Kwa nini jaribio hili ni muhimu
Kuendesha modeli kubwa za lugha (large language models) kwenye vifaa vya binafsi kunawawezesha watengenezaji kuepuka ada za API na wasiwasi wa faragha ya data. Hata hivyo, "mawakala wa ndani" (local agents) bado ni neno maarufu tu: je, wanaweza kweli kuhariri faili, kuitia wito zana za command-line, na kutoa kodi iliyo tayari kwa matumizi ya uzalishaji (production-ready code) bila msaada wa binadamu? Ulinganishaji huu wa vitendo, uliotenganishwa na huduma za wingu, unawapa watengenezaji picha halisi ya hatua ambayo teknolojia imefikia.
Vifaa na kazi iliyofanyika
Modeli zote tano zilifanya kazi kwenye kituo kimoja cha kazi (workstation): GPU ya RTX 5090, kadi ya kawaida ya hali ya juu kwa watumiaji, na bila huduma za nje. Kazi hiyo ilikuwa rahisi kwa makusudi lakini inawakilisha hali halisi – kuongeza sehemu ya Tag Manager kwenye sehemu ya admin iliyokwishaundwa. Mafanikio yalitegemea modeli kupata faili sahihi za chanzo, kuzihariri, na kuhakikisha kuwa kipengele kipya kiliunganishwa bila kuharibu utendaji uliokuwepo.
Utendaji wa modeli
- Qwen 3.6 35B-A3B (MoE) – Ilimaliza kazi yenyewe, iliongeza maboresho ya busara ambayo hayakuombwa, na haikuhitaji marekebisho (patches) baada ya kukamilika.
- Qwen 3.6 27B (dense) – Ilikamilisha kazi lakini ilichukua takriban hatua mara mbili zaidi za mwingiliano na wakati mwingine ilitafsiri vibaya maelekezo.
- GLM-4.7-Flash (dense) – Ilitoa utekelezaji unaofanya kazi lakini ilitumia mifumo isiyo sahihi ya ulinganishaji wa faili na ilikosa ukaguzi wa usalama, hivyo kuacha kodi ikiwa hatarini.
- Qwythos-9B – Haikutumia zana yoyote halisi; kushindwa huku kunaweza kutokana na modeli yenyewe au mpangilio wa ndani, lakini jaribio haliwezi kutenga chanzo.
- Nemotron-3-Nano (hybrid) – Ilinaswa kwenye mzunguko (loop), ikitumia mizunguko 40 kutafuta folda ambayo ilikuwa tayari imeshaipata, na haikuendelea zaidi ya hatua hiyo.
Matokeo yanachofunua
Muundo (Architecture) si kigezo cha kuaminika cha utabiri
Modeli ya MoE, ambayo hugawanya vigezo vyake katika mitandao midogo ya wataalamu (expert sub-networks), ilishinda moja kwa moja, wakati matoleo ya dense na hybrid yaligawanyika kati ya mafanikio na kushindwa kabisa. Hii inadokeza kuwa uchaguzi wa muundo pekee hauhakikishii uwezo wa kutumia zana.
Matumizi ya zana bado ni kikwazo kikubwa
Hakuna mmoja kati ya mawakala watano aliyetumia zana maalum ya picha ya skrini (screenshot tool) iliyotolewa kwa ajili ya jaribio. Wote walijaribu kubuni mbinu, ama kwa kukisia majina ya faili au kwa kujaribu njia zisizo za moja kwa moja. Pengo kati ya "kuweza kuzalisha kodi" na "kuweza kuratibu zana za nje" bado ni kubwa.
Kuendesha ndani kunamaanisha kurekebisha mfumo (debugging the stack), si modeli pekee
Modeli mbili zilihitaji marekebisho ya haraka (on-the-fly patches) kwenye mifumo yao ya maelekezo (prompt templates) kabla hata jaribio halijaanza. Jitihada zilizotumika kurekebisha hitilafu maalum za modeli zilipita muda uliotumika kuandika kodi halisi ya Tag Manager, ikionyesha jinsi mifumo ya ndani ya sasa ilivyo dhaifu.
Angalizo
Jaribio hili linaakisi mpangilio mmoja wa vifaa, hali moja ya uandishi wa kodi, na seti ndogo ya modeli. Qwen 3.6 35B-A3B hapo awali ilifeli katika mzunguko wa awali; kushindwa kwake huko kulikuwa ni tukio la bahati mbaya. Kwa hivyo, matokeo haya ni ya kuonyesha tu, si ya uhakika wa kudumu.
Nini cha kufuatilia baadaye
Mizunguko ya baadaye itahitaji kupanua seti ya kazi, kujumuisha mfululizo wa zana (toolchains) tofauti zaidi, na kufanya majaribio kwenye aina pana zaidi ya vifaa. Watazamaji wanapaswa kufuatilia ikiwa modeli za MoE zinaendelea kufanya vizuri zaidi kuliko miundo ya dense na hybrid, na ikiwa watengenezaji wanaweza kujenga mifumo ya ziada (wrappers) inayofanya kazi vizuri inayoweza kuondoa hitaji la kurekebisha hitilafu kwa mkono.
Muhtasari: Modeli ya 35B MoE inaweza tayari kufanya kazi kama msaidizi wa uandishi wa kodi wa ndani mwenye uwezo, lakini mfumo mpana zaidi—uunganishaji wa zana, uhandisi wa maelekezo (prompt engineering), na mifumo thabiti ya uendeshaji (stable runtimes)—bado upo nyuma. Mpaka vipengele hivyo vitakapofanya kazi kwa pamoja, watengenezaji wanapaswa kupunguza matarajio yao kuhusu mawakala wa ndani wa "plug-and-play".
