Lima ejen Gemini 3.5 Flash yang bekerjasama dalam masa nyata telah menyelesaikan 87% daripada set 30 soalan Project Euler, mengatasi lima ejen yang berjalan secara solo (72%) dan kedua-dua garis dasar undian majoriti (80% solo, 90% kolaboratif). Pelaksanaan kolaboratif juga memendekkan purata masa pelaksanaan sebanyak empat minit, menurun daripada 14 minit bagi setiap masalah kepada 10 minit, dengan kebanyakan penyelesaian diperoleh dalam masa kurang daripada lima minit.

Mengapa eksperimen ini penting

Pembantu pengekodan AI sudah pun merangka petikan kod, menyahpepijat kod, dan menjana keseluruhan program. Penyelidik biasanya menguji satu model pada satu prom dan menilai jawapannya. Ujian ini bertanyakan soalan yang berbeza: bolehkah sekumpulan ejen yang berkongsi penemuan semasa mereka bekerja mengatasi pendekatan "kebijaksanaan orang ramai" (wisdom of the crowd) yang sekadar mengira jawapan bebas?

Masalah Project Euler berfungsi sebagai penanda aras standard untuk pemikiran algoritma. Ia menggabungkan wawasan matematik dan pengekodan yang cekap, menjadikannya proksi yang baik untuk tugas pengaturcaraan dunia nyata di mana ketepatan dan kelajuan adalah penting.

Bagaimana ujian ini disediakan

  • Ejen: Lima instans Gemini 3.5 Flash yang diakses melalui platform Antigravity.
  • Senario:
    1. Setiap ejen menangani setiap masalah secara bersendirian, melaporkan jawapannya sendiri.
    2. Lima ejen yang sama bekerjasama dalam masa nyata, menyiarkan hasil perantaraan dan mengesahkan langkah satu sama lain.
    3. Bagi kedua-dua tetapan, pengumpul undian majoriti yang ringkas menggabungkan kelima-lima jawapan bebas tersebut.
  • Metrik: Ketepatan (peratusan jawapan yang betul) dan masa larian (purata masa bagi setiap masalah, ditambah dengan taburan masa penyelesaian).

Apa yang didedahkan oleh angka tersebut

  • Ketepatan solo: 72%
  • Ketepatan kolaboratif: 87%
  • Ketepatan undian majoriti solo: 80%
  • Ketepatan undian majoriti kolaboratif: 90%

Masa larian menurun daripada purata 14 minit bagi ejen solo kepada 10 minit bagi kumpulan kolaboratif. Kebanyakan larian kolaboratif selesai dalam masa kurang daripada lima minit, manakala percubaan solo kerap mencapai had masa tamat (timeout) 30 minit.

Pemerhatian utama yang menjelaskan jurang tersebut

  • Mustahil bagi seorang, boleh bagi ramai – Pada satu masalah, semua ejen solo gagal, namun pasukan kolaboratif bertukar-tukar hasil separa dan secara kolektif mencapai jawapan yang betul.
  • Mengesan ralat melalui semakan silang – Ejen individu kadangkala terperangkap dalam perangkap logik; kumpulan tersebut mengesan kesilapan ini dengan membandingkan nota dalam masa nyata.
  • Penumpuan pantas – Apabila mana-mana ejen menemui nilai perantaraan yang penting, ia menyiarkan penemuan tersebut, membolehkan ejen lain melangkau kerja yang berulang dan menumpu kepada penyelesaian akhir dengan lebih cepat.

Kos dan had yang tersembunyi

Eksperimen ini hanya menggunakan lima ejen; masih tidak jelas sama ada kecekapan yang sama boleh diskalakan kepada berpuluh-puluh atau beratus-ratus ejen. Tambahan pula, pengumpul undian majoriti masih menunjukkan prestasi yang baik (90% dengan kolaborasi).

Apa yang perlu diperhatikan seterusnya

  • Eksperimen penskalaan – Adakah seratus ejen masih akan meningkatkan ketepatan, atau adakah beban penyelarasan (coordination overhead) akan mendominasi?
  • Pengkhususan peranan – Menugaskan tugas khusus (contohnya, satu ejen fokus pada teori nombor, satu lagi pada pengoptimuman) boleh mempertingkatkan manfaat berbanding kolaborasi bentuk bebas.
  • Penanda aras yang lebih luas – Mengaplikasikan rangka kerja yang sama kepada cabaran penjanaan kod, suite penyahpepijatan, atau binaan perisian dunia nyata akan menguji sama ada peningkatan tersebut kekal di luar teka-teki matematik.

Kesimpulan

Kolaborasi masa nyata dalam kalangan ejen pengekodan AI boleh meningkatkan kadar kejayaan dan kelajuan dalam tugas algoritma, mengatasi percubaan solo dan juga undian orang ramai yang ringkas. Pendekatan ini menunjukkan potensi, tetapi kebolehskalaan dan keberkesanan kosnya kekal sebagai persoalan terbuka yang perlu dijawab oleh penyelidikan masa hadapan.

Sumber: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0