Metode baru ABSeeker, “Answer-Backtracked Credit Assignment” (ABC), memungkinkan agen pencarian jangka panjang (long-horizon) untuk mendapatkan kredit atas setiap langkah individu, alih-alih hanya untuk jawaban akhir, dan model dengan 4 miliar parameter yang dilatih dengannya sudah dapat menandingi atau melampaui pesaing yang jauh lebih besar.
Terobosan ini penting karena sebagian besar agen yang ada saat ini hanya dinilai di akhir tugas. Jika jawaban akhirnya benar, seluruh proses dianggap baik; jika salah, seluruh urutan dianggap buruk. Umpan balik yang bersifat "semua atau tidak sama sekali" (all-or-nothing) ini menyembunyikan sinyal pembelajaran yang sebenarnya—langkah-langkah baik yang kebetulan diikuti oleh kesalahan, atau klik yang tidak berguna yang secara beruntung mengarah pada hasil yang benar. Pendekatan ABSeeker menulis ulang aturan tersebut.
Mengapa pendekatan lama kurang efektif
Saat sebuah agen melakukan pencarian, menulis kode, atau mengumpulkan bukti, ia biasanya melakukan banyak tindakan: mengajukan kueri, membuka halaman, menjalankan perintah, memeriksa status sistem, dan sebagainya. Dalam satu sesi lima belas langkah, satu kesalahan langkah dapat menggagalkan jawaban akhir, meskipun langkah-langkah sebelumnya sudah tepat. Sebaliknya, sebuah sesi yang berakhir dengan jawaban yang benar mungkin saja bergantung pada keberuntungan semata, di mana sebagian besar langkahnya tidak memberikan nilai tambah. Melatih model hanya berdasarkan hasil akhir memaksa model untuk memperlakukan seluruh lintasan sebagai satu kotak hitam (black box), sehingga sulit untuk mempelajari sub-perilaku mana yang sebenarnya berguna.
Situasi ini mencerminkan proses debugging dalam rekayasa perangkat lunak. Pengembang menelusuri setiap baris, mengisolasi panggilan yang gagal, dan memperbaikinya. Namun, agen tidak diberikan "tanda terima" (receipt) yang sebanding atas pekerjaan internal mereka. Tanpa jejak audit tersebut, pengembang tidak dapat mengetahui apakah sebuah peningkatan disebabkan oleh penalaran yang lebih baik atau sekadar kebetulan, dan mereka tidak dapat memperbaiki kebiasaan buruk secara sistematis.
Bagaimana ABC mengatur ulang credit assignment
Answer-Backtracked Credit Assignment bekerja secara terbalik dari jawaban akhir yang benar. Metode ini pertama-tama mengekstrak petunjuk penting yang menjadi dasar jawaban tersebut—potongan bukti tertentu, hasil perantara, atau pemeriksaan status. Kemudian, ia menelusuri kembali jejak yang tercatat, memberikan skor pada setiap tindakan berdasarkan petunjuk tersebut. Tindakan yang berkontribusi langsung pada petunjuk yang dibutuhkan akan mendapatkan kredit positif; tindakan yang tidak relevan atau merugikan akan menerima skor negatif atau nol.
Dua rezim pelatihan dibangun berdasarkan penilaian ini:
- ABC-SFT (Supervised Fine-Tuning) mengatur ulang bobot fungsi kerugian (loss function) sehingga langkah-langkah dengan kredit lebih tinggi memengaruhi model secara lebih kuat. Model belajar untuk memprioritaskan tindakan yang secara historis mengarah pada petunjuk yang berguna.
- ABC-GRPO (Gradient-based Reward Policy Optimization) memperlakukan skor per langkah sebagai sinyal imbalan (reward signal) untuk pembelajaran penguatan (reinforcement learning), memperkuat bagian-bagian spesifik dari pencarian yang membantu jawaban muncul.
Dengan mengubah label lulus/gagal biner menjadi peta kontribusi yang granular, ABC memberikan sinyal pembelajaran yang jauh lebih kaya kepada model.
Hasil awal menunjukkan hasil yang signifikan
Para peneliti menerapkan ABC pada model 4 miliar parameter yang sederhana, yang dilengkapi dengan lapisan manajemen konteks untuk melacak status pencarian yang terus berkembang. Dalam tugas-tugas tolok ukur (benchmark) yang biasanya menguntungkan agen yang jauh lebih besar, model yang dilatih dengan ABC mampu menandingi atau mengungguli sistem yang lebih besar tersebut. Peningkatan performa tersebut terjadi tanpa menambah ukuran model, yang menunjukkan bahwa penugasan kredit (credit assignment) yang lebih baik dapat menjadi pengganti jumlah parameter mentah.
Poin utamanya sederhana: berikan model "tanda terima" yang jelas tentang apa yang berhasil, dan ia dapat mengekstrak lebih banyak nilai dari jumlah data pelatihan yang sama.
Apa artinya ini bagi agen di dunia nyata
Setiap agen yang melakukan pekerjaan multi-langkah—asisten pengodean, bot tinjauan literatur, alat dukungan pelanggan—bergantung pada jejak tindakannya. ABC menunjukkan bahwa menjaga dan mengevaluasi jejak tersebut bukanlah sekadar fitur tambahan yang menyenangkan; itu sangat penting untuk pembelajaran yang efektif.
- Agen pengodean perlu mencatat rencana, setiap perintah yang dikeluarkan, dan hasil pengujian yang memvalidasi kode tersebut.
- Agen riset harus menyimpan kueri yang mereka kirim, sumber yang mereka buka, dan bukti yang mereka ekstrak.
- Agen dukungan harus mencatat setiap pemeriksaan status dan titik keputusan yang mengarah pada penyelesaian masalah.
Ketika jejak-jejak ini tersedia, ABC dapat memberikan kredit secara tepat, memungkinkan model untuk memperkuat kebiasaan baik dan membuang jalan pintas beruntung yang jika tidak dilakukan, akan disalahartikan sebagai keahlian.
Sanggahan dan hambatan praktis
Manfaat ABC disertai dengan kompleksitas tambahan.
Intinya
Answer-Backtracked Credit Assignment mengubah paradigma tentang cara kita melatih agen untuk mencari, menulis kode, dan menalar. Dengan memberikan imbalan pada langkah-langkah yang tepat di sepanjang proses, alih-alih hanya pada hasil akhirnya, metode ini memungkinkan model berukuran moderat untuk belajar seefektif model yang jauh lebih besar. Bagi siapa pun yang membangun agen untuk tugas multi-langkah, mengadopsi rezim pelatihan berbasis jejak (trace-centric) bukanlah sebuah pilihan—melainkan jalan menuju AI yang andal, dapat diaudit, dan pada akhirnya lebih cerdas.
