Sebuah tolok ukur (benchmark) terhadap lima agen LLM yang dijalankan secara lokal pada satu RTX 5090 menunjukkan bahwa model mixture-of-experts (MoE) dengan 35 miliar parameter mengungguli rekan-rekannya dalam tugas pengodean dunia nyata. Pengujian tersebut, yang menambahkan Tag Manager ke panel admin yang sudah ada tanpa API cloud apa pun, menobatkan Qwen 3.6 35B-A3B sebagai pemenang mutlak.
Mengapa pengujian ini penting
Menjalankan model bahasa besar pada perangkat keras pribadi memungkinkan pengembang menghindari biaya API dan kekhawatiran privasi data. Namun, "agen lokal" masih menjadi istilah populer: dapatkah mereka benar-benar mengedit file, memanggil alat baris perintah (command-line tools), dan mengirimkan kode siap produksi tanpa bantuan manusia? Perbandingan langsung ini, yang tanpa layanan cloud, memberikan gambaran nyata bagi pengembang tentang sejauh mana teknologi ini telah berkembang.
Perangkat keras dan tugasnya
Kelima model dijalankan pada workstation yang sama: GPU RTX 5090, kartu konsumen kelas atas yang umum, dan tanpa layanan eksternal. Tugasnya sengaja dibuat sederhana namun representatif – menambahkan komponen Tag Manager ke bagian admin yang sudah dibangun. Keberhasilan membutuhkan model untuk menemukan file sumber yang benar, mengeditnya, dan memverifikasi bahwa fitur baru tersebut terintegrasi tanpa merusak fungsionalitas yang sudah ada.
Kinerja Model
- Qwen 3.6 35B-A3B (MoE) – Menyelesaikan tugas secara otonom, menambahkan peningkatan masuk akal yang tidak diminta, dan tidak memerlukan perbaikan pasca-berjalan.
- Qwen 3.6 27B (dense) – Menyelesaikan tugas tetapi membutuhkan langkah interaksi sekitar dua kali lipat lebih banyak dan sesekali salah menafsirkan instruksi.
- GLM-4.7-Flash (dense) – Menghasilkan implementasi yang berfungsi tetapi menggunakan pola pencocokan file yang salah dan mengabaikan pemeriksaan keamanan, sehingga membuat kode rentan.
- Qwythos-9B – Tidak mengeksekusi alat apa pun; kegagalan bisa berasal dari model itu sendiri atau dari pengaturan lokal, tetapi pengujian tidak dapat mengisolasi penyebabnya.
- Nemotron-3-Nano (hybrid) – Terjebak dalam loop, menghabiskan 40 putaran mencari folder yang sudah ditemukan, dan tidak pernah maju lebih jauh dari titik tersebut.
Apa yang diungkapkan oleh hasil tersebut
Arsitektur bukan prediktor yang andal
Model MoE, yang membagi parameternya ke dalam beberapa sub-jaringan ahli, menang mutlak, sementara varian dense dan hybrid terbagi antara keberhasilan dan kegagalan total. Ini menunjukkan bahwa pilihan arsitektur mentah tidak menjamin kompetensi penggunaan alat (tool-use).
Penggunaan alat tetap menjadi hambatan utama
Tidak ada dari kelima agen yang menggunakan alat tangkapan layar (screenshot tool) khusus yang disediakan untuk pengujian. Semua mencoba berimprovisasi, baik dengan menebak nama file atau mencoba solusi tidak langsung. Kesenjangan antara "dapat menghasilkan kode" dan "dapat mengorkestrasi utilitas eksternal" masih lebar.
Menjalankan secara lokal berarti melakukan debugging pada stack, bukan hanya model
Dua model memerlukan perbaikan pada template prompt secara langsung sebelum pengujian dapat dimulai. Upaya yang dihabiskan untuk memperbaiki bug spesifik model melampaui waktu yang dihabiskan untuk menulis kode Tag Manager yang sebenarnya, menyoroti betapa rapuhnya penerapan lokal saat ini.
Catatan peringatan
Benchmark ini mencerminkan satu konfigurasi perangkat keras, satu skenario pengodean, dan rangkaian model yang kecil. Qwen 3.6 35B-A3B sebelumnya sempat gagal dalam putaran awal; kegagalan sebelumnya hanyalah sebuah kebetulan. Oleh karena itu, hasilnya bersifat indikatif, bukan definitif.
Apa yang perlu diperhatikan selanjutnya
Putaran mendatang perlu memperluas set tugas, menyertakan rangkaian alat (toolchain) yang lebih beragam, dan menguji pada rentang perangkat keras yang lebih luas. Pengamat harus memantau apakah model MoE secara konsisten mengungguli desain dense dan hybrid, dan apakah pengembang dapat membangun wrapper yang andal yang menghilangkan kebutuhan akan perbaikan bug manual.
Kesimpulan: Model MoE 35B sudah dapat bertindak sebagai asisten pengodean lokal yang kompeten, tetapi ekosistem yang lebih luas—integrasi alat, rekayasa prompt (prompt engineering), dan runtime yang stabil—masih tertinggal. Sampai bagian-bagian tersebut selaras, pengembang harus menahan ekspektasi tentang agen lokal yang "plug-and-play".
