Eksperimen seorang pengembang solo menggunakan tiga model Claude berhasil memangkas biaya API bulanan sebesar 35% dan mengurangi latensi median tugas dari 42 detik menjadi 27 detik. Dengan mengarahkan tugas-tugas sederhana yang rendah ambiguitas ke model Haiku yang murah, pekerjaan rutin ke Sonnet, dan mencadangkan Opus yang berat untuk masalah berisiko tinggi, penulis membuktikan bahwa kebiasaan menggunakan “model terbaik untuk segalanya” adalah kebiasaan yang mahal.
Mengapa perutean itu penting
Penulis menjalankan agen pengkodean otonom yang menerima aliran tugas pengembangan yang stabil—perbaikan lint, penambahan fitur, tinjauan keamanan, dan sesi debugging mendalam. Selama berbulan-bulan, agen tersebut mengirim setiap permintaan ke Opus, model Claude yang paling mumpuni, dengan asumsi bahwa kualitas yang lebih tinggi akan selalu lebih berharga daripada harga. Opus mengenakan harga premium per token, sehingga tagihannya membengkak tanpa terkendali.
Ketika penulis memperkenalkan skema perutean bertingkat, pengeluaran turun menjadi 65% dari tingkat aslinya dan penggunaan Opus turun menjadi 11% dari total tugas.
Cara kerja sistem tiga tingkat
Logika perutean bergantung pada ambiguitas, bukan pada berapa banyak baris kode yang disentuh oleh suatu tugas. Penulis mendefinisikan tiga kategori:
- Haiku – tugas deterministik dengan ambiguitas rendah. Contoh: memperbaiki peringatan lint, mengubah nama variabel, meringkas file log. Jawaban yang benar biasanya hanya berupa satu baris kode atau teks.
- Sonnet – pekerja utama default. Menangani implementasi fitur, perbaikan bug rutin, dan refaktor standar di mana masalahnya jelas tetapi solusinya mungkin melibatkan beberapa langkah.
- Opus – pekerjaan berisiko tinggi dan ambiguitas tinggi. Keputusan arsitektur, audit keamanan, sesi debugging yang kompleks, atau tugas apa pun di mana jalur yang benar tidak jelas dan kesalahan langkah dapat merusak pipeline.
Sebuah tabel pencarian statis memetakan setiap permintaan yang masuk ke model yang sesuai berdasarkan aturan ini. Penulis mencoba model “pintar” yang akan memutuskan tingkatan secara langsung, tetapi penggunaan token tambahan menghapus semua penghematan. Aturan statis sederhana mencakup sekitar 80% beban kerja dan menjaga sistem tetap murah serta dapat diprediksi.
Jaring pengaman eskalasi
Model murah tetap bisa melakukan kesalahan. Untuk mencegah respons Haiku atau Sonnet yang salah merusak proses build, sistem melakukan eskalasi permintaan setelah dua kegagalan, mempromosikannya ke tingkat berikutnya. Jaring pengaman ini menangkap kesalahan lebih dini dan menjaga pipeline tetap berjalan lancar tanpa intervensi manual.
Angka yang berbicara sendiri
Setelah empat minggu menjalankan router bertingkat, penulis mencatat perubahan berikut:
- Pengeluaran API turun menjadi 65% dari biaya asli (pengurangan sebesar 35%).
- Waktu penyelesaian median turun dari 42 detik menjadi 27 detik.
- Penggunaan Opus menyusut dari menangani setiap permintaan menjadi hanya 11% dari total tugas.
Angka-angka ini menunjukkan bahwa sebagian besar pekerjaan pengembangan dapat didelegasikan ke model yang lebih murah tanpa penurunan kualitas yang nyata, sementara masalah tersulit tetap mendapatkan manfaat dari jendela konteks Opus yang lebih besar.
Pelajaran bagi pengembang lain
- Mulai dari yang rendah, bukan yang tinggi. Sebagian besar tugas pengkodean harian tidak memerlukan model yang paling kuat. Menjadikan Sonnet sebagai default untuk tugas-tugas yang ambigu menghemat lebih banyak uang daripada memaksakan semuanya melalui Haiku.
- Ukur tingkat kesulitan, bukan ukuran. Perbaikan race condition satu baris bisa lebih sulit daripada melakukan refaktor pada seluruh file. Lakukan perutean berdasarkan seberapa ambigu solusinya, bukan berdasarkan jumlah baris yang diubah.
- Pantau tingkat eskalasi. Meningkatnya jumlah eskalasi menandakan bahwa aturan statis tidak lagi sesuai dengan beban kerja. Sesuaikan kategori sebelum model murah mulai menyebabkan lebih banyak kegagalan pada pipeline.
Mencadangkan model termahal untuk masalah tersulit dan membiarkan model yang lebih murah menangani sisanya menjaga pengembangan berbantuan AI tetap cepat dan terjangkau. Keuntungan sebenarnya terletak pada strategi perutean yang disiplin yang mencocokkan alat yang tepat untuk pekerjaan yang tepat.
