વાસ્તવિક સમયમાં (real time) સાથે મળીને કામ કરતા પાંચ Gemini 3.5 Flash એજન્ટોએ 30 પ્રશ્નોના Project Euler સેટના 87% ઉકેલી દીધા, જે પાંચ સિંગલ (solo) એજન્ટો (72%) અને બંને મેજોરિટી-વોટ બેઝલાઇન્સ (80% સિંગલ, 90% સહયોગી) કરતા વધુ સારું પરિણામ હતું. સહયોગી રન (collaborative run) એ સરેરાશ એક્ઝિક્યુશન સમયમાં પણ ચાર મિનિટનો ઘટાડો કર્યો, જે પ્રતિ સમસ્યા 14 મિનિટથી ઘટીને 10 મિનિટ થઈ ગઈ, જેમાં મોટાભાગના ઉકેલો પાંચ મિનિટથી ઓછા સમયમાં મળી ગયા.

આ પ્રયોગ શા માટે મહત્વપૂર્ણ છે

AI કોડિંગ આસિસ્ટન્ટ્સ પહેલેથી જ સ્નિપેટ્સ ડ્રાફ્ટ કરે છે, કોડ ડિબગ કરે છે અને આખા પ્રોગ્રામ્સ જનરેટ કરે છે. સંશોધકો સામાન્ય રીતે એક પ્રોમ્પ્ટ પર સિંગલ મોડેલનું પરીક્ષણ કરે છે અને તેના જવાબને ગ્રેડ કરે છે. આ પરીક્ષણ એક અલગ પ્રશ્ન પૂછે છે: શું એજન્ટોનું એવું જૂથ જે કામ કરતી વખતે તારણો શેર કરે છે, તે માત્ર સ્વતંત્ર જવાબોની ગણતરી કરતા "wisdom of the crowd" (ભીડનું જ્ઞાન) અભિગમ કરતા વધુ સારું પ્રદર્શન કરી શકે છે?

Project Euler ના પ્રશ્નો અલ્ગોરિધમિક વિચારધારા માટે એક સ્ટાન્ડર્ડ બેન્ચમાર્ક તરીકે કામ કરે છે. તેઓ ગાણિતિક સમજ અને કાર્યક્ષમ કોડિંગનું મિશ્રણ છે, જે તેમને વાસ્તવિક દુનિયાના પ્રોગ્રામિંગ કાર્યો માટે એક સારો પ્રોક્સી બનાવે છે જ્યાં સચોટતા અને ઝડપ મહત્વની હોય છે.

પરીક્ષણ કેવી રીતે સેટ કરવામાં આવ્યું હતું

  • એજન્ટ્સ: Antigravity પ્લેટફોર્મ દ્વારા એક્સેસ કરવામાં આવેલા Gemini 3.5 Flash ના પાંચ ઇન્સ્ટન્સ.
  • દૃશ્યો (Scenarios):
    1. દરેક એજન્ટે દરેક સમસ્યાને એકલા ઉકેલી, અને પોતાનો જવાબ રિપોર્ટ કર્યો.
    2. એ જ પાંચ એજન્ટોએ વાસ્તવિક સમયમાં સહયોગ કર્યો, જેમાં તેઓ મધ્યવર્તી પરિણામો બ્રોડકાસ્ટ કરતા અને એકબીજાના સ્ટેપ્સની પુષ્ટિ કરતા હતા.
    3. બંને સેટઅપ માટે, એક સાદા મેજોરિટી-વોટ એગ્રીગેટરે પાંચ સ્વતંત્ર જવાબોને જોડ્યા.
  • મેટ્રિક્સ: સચોટતા (સાચા જવાબોની ટકાવારી) અને રનટાઇમ (પ્રતિ સમસ્યા સરેરાશ સમય, વત્તા પૂર્ણ થવાના સમયનું વિતરણ).

આંકડા શું દર્શાવે છે

  • સિંગલ સચોટતા: 72%
  • સહયોગી સચોટતા: 87%
  • સિંગલ મેજોરિટી-વોટ સચોટતા: 80%
  • સહયોગી મેજોરિટી-વોટ સચોટતા: 90%

સિંગલ એજન્ટો માટે સરેરાશ રનટાઇમ 14 મિનિટ થી ઘટીને સહયોગી જૂથ માટે 10 મિનિટ થઈ ગઈ. મોટાભાગના સહયોગી રન પાંચ મિનિટથી ઓછા સમયમાં પૂર્ણ થયા, જ્યારે સિંગલ પ્રયાસો વારંવાર 30 મિનિટની ટાઈમઆઉટ મર્યાદા સુધી પહોંચતા હતા.

તફાવત સમજાવતા મુખ્ય અવલોકનો

  • એક માટે અશક્ય, અનેક માટે શક્ય – એક જ સમસ્યા પર તમામ સિંગલ એજન્ટો નિષ્ફળ ગયા, તેમ છતાં સહયોગી ટીમે આંશિક પરિણામોની આપ-લે કરી અને સામૂહિક રીતે સાચા જવાબ પર પહોંચી.
  • ક્રોસ-ચેકિંગ દ્વારા ભૂલો પકડવી – વ્યક્તિગત એજન્ટો ક્યારેક તાર્કિક જાળમાં ફસાઈ જતા હતા; જૂથે વાસ્તવિક સમયમાં નોટ્સની સરખામણી કરીને આ ભૂલો પકડી લીધી.
  • ઝડપી કન્વર્જન્સ (Rapid convergence) – જ્યારે કોઈ પણ એજન્ટે મહત્વપૂર્ણ મધ્યવર્તી મૂલ્ય શોધી કાઢ્યું, ત્યારે તેણે તે તારણ બ્રોડકાસ્ટ કર્યું, જેનાથી અન્ય એજન્ટોને બિનજરૂરી કામ છોડીને ઝડપથી અંતિમ ઉકેલ પર પહોંચવામાં મદદ મળી.

છુપા ખર્ચ અને મર્યાદાઓ

આ પ્રયોગમાં માત્ર પાંચ એજન્ટોનો ઉપયોગ કરવામાં આવ્યો હતો; તે સ્પષ્ટ નથી કે આ જ કાર્યક્ષમતા ડઝનબંધ કે સેંકડો એજન્ટો સુધી સ્કેલ થઈ શકશે કે નહીં. તદુપરાંત, મેજોરિટી-વોટ એગ્રીગેટરે હજુ પણ સારું પ્રદર્શન કર્યું (સહયોગ સાથે 90%).

આગળ શું જોવું

  • સ્કેલિંગ પ્રયોગો – શું સો એજન્ટો હજુ પણ સચોટતામાં સુધારો કરશે, કે પછી સંકલનનો વધારાનો બોજ (coordination overhead) મુખ્ય બની જશે?
  • ભૂમિકા વિશિષ્ટતા (Role specialization) – ચોક્કસ કાર્યો સોંપવાથી (દા.ત., એક એજન્ટ નંબર થીયરી પર ધ્યાન કેન્દ્રિત કરે છે, બીજો ઓપ્ટિમાઇઝેશન પર) મુક્ત-સ્વરૂપ સહયોગ કરતા વધુ ફાયદા મળી શકે છે.
  • વ્યાપક બેન્ચમાર્ક – કોડ-જનરેશન પડકારો, ડિબગિંગ સુટ્સ અથવા વાસ્તવિક દુનિયાના સોફ્ટવેર બિલ્ડ્સ પર સમાન ફ્રેમવર્ક લાગુ કરવાથી એ ચકાસવામાં આવશે કે આ ફાયદા ગાણિતિક કોયડાઓથી આગળ પણ ટકી રહે છે કે નહીં.

મુખ્ય તારણ

AI કોડિંગ એજન્ટો વચ્ચે વાસ્તવિક સમયમાં સહયોગ કરવાથી અલ્ગોરિધમિક કાર્યોમાં સફળતાનો દર અને ઝડપ બંને વધી શકે છે, જે સિંગલ પ્રયાસો અને સાદા ક્રાઉડ વોટ કરતા પણ વધુ સારું પ્રદર્શન કરે છે. આ અભિગમ આશાસ્પદ છે, પરંતુ તેની સ્કેલેબિલિટી અને ખર્ચ-અસરકારકતા હજુ પણ ખુલ્લા પ્રશ્નો છે જેનો જવાબ ભવિષ્યના સંશોધનોએ આપવો પડશે.

સ્ત્રોત: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0