അഞ്ച് Gemini 3.5 Flash ഏജന്റുകൾ തത്സമയം (real time) ഒന്നിച്ച് പ്രവർത്തിച്ചപ്പോൾ, 30 ചോദ്യങ്ങളുള്ള ഒരു Project Euler സെറ്റിൽ 87% ഉത്തരങ്ങൾ കണ്ടെത്തി. ഇത് ഒറ്റയ്ക്ക് പ്രവർത്തിച്ച അഞ്ച് ഏജന്റുകളെക്കാൾ (72%) മികച്ചതായിരുന്നു. കൂടാതെ, മെയ്ജോറിറ്റി വോട്ട് (majority-vote) അടിസ്ഥാനമാക്കിയുള്ള രണ്ട് രീതികളേക്കാളും (ഒറ്റയ്ക്ക് 80%, സഹകരണത്തോടെ 90%) ഇത് മികച്ച പ്രകടനം കാഴ്ചവെച്ചു. സഹകരണത്തോടെയുള്ള ഈ രീതി ശരാശരി പ്രവർത്തന സമയം നാല് മിനിറ്റ് കുറയ്ക്കുകയും ചെയ്തു; അതായത് ഒരു പ്രശ്നത്തിന് വേണ്ടിവന്ന 14 മിനിറ്റ് സമയം 10 മിനിറ്റായി കുറഞ്ഞു, മിക്ക ഉത്തരങ്ങളും അഞ്ച് മിനിറ്റിൽ താഴെ സമയം കൊണ്ട് ലഭിച്ചു.

ഈ പരീക്ഷണം പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്

AI കോഡിംഗ് അസിസ്റ്റന്റുകൾ ഇപ്പോൾ തന്നെ കോഡ് സ്നിപ്പറ്റുകൾ തയ്യാറാക്കാനും, കോഡിലെ പിഴവുകൾ തിരുത്താനും (debug), മുഴുവൻ പ്രോഗ്രാമുകളും നിർമ്മിക്കാനും സഹായിക്കുന്നുണ്ട്. ഗവേഷകർ സാധാരണയായി ഒരു പ്രോംപ്റ്റിൽ ഒരു മോഡലിനെ മാത്രം പരീക്ഷിക്കുകയും അതിന്റെ ഉത്തരം വിലയിരുത്തുകയും ചെയ്യുന്നു. എന്നാൽ ഈ പരീക്ഷണം മറ്റൊരു ചോദ്യമാണ് ഉന്നയിക്കുന്നത്: ജോലി ചെയ്യുന്നതിനിടയിൽ കണ്ടെത്തുന്ന കാര്യങ്ങൾ പരസ്പരം പങ്കുവെക്കുന്ന ഒരു കൂട്ടം ഏജന്റുകൾക്ക്, സ്വതന്ത്രമായ ഉത്തരങ്ങൾ മാത്രം കണക്കാക്കുന്ന "wisdom of the crowd" രീതിയെക്കാൾ മികച്ച പ്രകടനം കാഴ്ചവെക്കാൻ കഴിയുമോ?

അൽഗോരിതമിക് ചിന്താഗതിയുടെ (algorithmic thinking) ഒരു മാനദണ്ഡമായി Project Euler പ്രശ്നങ്ങൾ പ്രവർത്തിക്കുന്നു. അവ ഗണിതശാസ്ത്രപരമായ ഉൾക്കാഴ്ചയും കാര്യക്ഷമമായ കോഡിംഗും സമന്വയിപ്പിക്കുന്നു, അതിനാൽ കൃത്യതയും വേഗതയും പ്രധാനമായ യഥാർത്ഥ ലോക പ്രോഗ്രാമിംഗ് ജോലികൾക്ക് ഇവ മികച്ചൊരു മാതൃകയാണ്.

പരീക്ഷണം എങ്ങനെയാണ് ക്രമീകരിച്ചത്

  • ഏജന്റുകൾ: Antigravity പ്ലാറ്റ്‌ഫോം വഴി ലഭ്യമാക്കിയ അഞ്ച് Gemini 3.5 Flash ഇൻസ്റ്റൻസുകൾ.
  • സാഹചര്യങ്ങൾ:
    1. ഓരോ ഏജന്റും ഓരോ പ്രശ്നവും ഒറ്റയ്ക്ക് പരിഹരിക്കുകയും സ്വന്തം ഉത്തരം റിപ്പോർട്ട് ചെയ്യുകയും ചെയ്തു.
    2. അതേ അഞ്ച് ഏജന്റുകൾ തത്സമയം സഹകരിക്കുകയും ഇടക്കാല ഫലങ്ങൾ (intermediate results) പങ്കുവെക്കുകയും പരസ്പരം ഘട്ടങ്ങൾ സ്ഥിരീകരിക്കുകയും ചെയ്തു.
    3. രണ്ട് രീതികളിലും, അഞ്ച് സ്വതന്ത്ര ഉത്തരങ്ങളെ ഒരു ലളിതമായ മെയ്ജോറിറ്റി വോട്ട് അഗ്രഗേറ്റർ (majority-vote aggregator) ഉപയോഗിച്ച് സംയോജിപ്പിച്ചു.
  • മാപദങ്ങൾ: കൃത്യത (ശരിയായ ഉത്തരങ്ങളുടെ ശതമാനം), റൺടൈം (ഒരു പ്രശ്നത്തിനായുള്ള ശരാശരി സമയം, കൂടാതെ പൂർത്തീകരണ സമയത്തിന്റെ വിതരണം).

കണക്കുകൾ എന്ത് വെളിപ്പെടുത്തുന്നു

  • ഒറ്റയ്ക്കുള്ള കൃത്യത: 72%
  • സഹകരണത്തോടെയുള്ള കൃത്യത: 87%
  • ഒറ്റയ്ക്കുള്ള മെയ്ജോറിറ്റി വോട്ട് കൃത്യത: 80%
  • സഹകരണത്തോടെയുള്ള മെയ്ജോറിറ്റി വോട്ട് കൃത്യത: 90%

ഒറ്റയ്ക്ക് പ്രവർത്തിക്കുന്ന ഏജന്റുകൾക്ക് ശരാശരി 14 മിനിറ്റ് എടുത്തിരുന്ന സ്ഥാനത്ത്, സഹകരിക്കുന്ന ഗ്രൂപ്പിന് അത് 10 മിനിറ്റായി കുറഞ്ഞു. സഹകരിക്കുന്ന രീതിയിൽ മിക്ക പ്രക്രിയകളും അഞ്ച് മിനിറ്റിനുള്ളിൽ പൂർത്തിയായി, എന്നാൽ ഒറ്റയ്ക്ക് ശ്രമിച്ചപ്പോൾ പലപ്പോഴും 30 മിനിറ്റ് സമയപരിധി (timeout limit) പിന്നിടുകയും ചെയ്തിരുന്നു.

വ്യത്യാസത്തിന് കാരണമായ പ്രധാന നിരീക്ഷണങ്ങൾ

  • ഒരാൾക്ക് അസാധ്യമായത് പലർക്കും സാധ്യമാകുന്നു – ഒരു പ്രത്യേക പ്രശ്നത്തിൽ എല്ലാ ഒറ്റപ്പെട്ട ഏജന്റുകളും പരാജയപ്പെട്ടെങ്കിലും, സഹകരിക്കുന്ന ടീം ഭാഗികമായ ഫലങ്ങൾ കൈമാറുകയും കൂട്ടമായി ശരിയായ ഉത്തരത്തിൽ എത്തുകയും ചെയ്തു.
  • ക്രോസ്-ചെക്കിംഗിലൂടെ പിഴവുകൾ കണ്ടെത്തുന്നു – വ്യക്തിഗത ഏജന്റുകൾ ചിലപ്പോൾ യുക്തിപരമായ പിഴവുകളിൽ (logical traps) അകപ്പെട്ടുപോയി; എന്നാൽ ഗ്രൂപ്പ് തത്സമയം വിവരങ്ങൾ താരതമ്യം ചെയ്തതിലൂടെ ഈ തെറ്റുകൾ തിരുത്തി.
  • വേഗത്തിലുള്ള ഏകീകരണം (Rapid convergence) – ഏതെങ്കിലും ഒരു ഏജന്റ് നിർണ്ണായകമായ ഒരു ഇടക്കാല മൂല്യം കണ്ടെത്തിയാൽ, അത് മറ്റുള്ളവരെ അറിയിക്കുന്നു. ഇത് മറ്റുള്ളവർക്ക് ആവർത്തന ജോലികൾ ഒഴിവാക്കാനും വേഗത്തിൽ അന്തിമ ഉത്തരത്തിൽ എത്താനും സഹായിക്കുന്നു.

മറഞ്ഞിരിക്കുന്ന ചിലവുകളും പരിമിതികളും

പരീക്ഷണത്തിൽ അഞ്ച് ഏജന്റുകൾ മാത്രമാണ് ഉപയോഗിച്ചത്; ഇതേ കാര്യക്ഷമത ഡസൻ കണക്കിന് അല്ലെങ്കിൽ നൂറുകണക്കിന് ഏജന്റുകൾ ഉപയോഗിക്കുമ്പോഴും ലഭിക്കുമോ എന്നത് ഇപ്പോഴും വ്യക്തമല്ല. കൂടാതെ, മെയ്ജോറിറ്റി വോട്ട് അഗ്രഗേറ്റർ ഇപ്പോഴും മികച്ച രീതിയിൽ പ്രവർത്തിക്കുന്നുണ്ട് (സഹകരണത്തോടെ 90%).

ഇനി ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ

  • സ്കെയിലിംഗ് പരീക്ഷണങ്ങൾ – നൂറോളം ഏജന്റുകൾ ഉപയോഗിക്കുമ്പോഴും കൃത്യത വർദ്ധിക്കുമോ, അതോ ഏകോപനത്തിനായുള്ള അധിക പരിശ്രമം (coordination overhead) തടസ്സമാകുമോ?
  • ചുമതലകളുടെ പ്രത്യേകവൽക്കരണം (Role specialization) – ഓരോ ഏജന്റിനും പ്രത്യേക ജോലികൾ നൽകുന്നത് (ഉദാഹരണത്തിന്, ഒരാൾ നമ്പർ തിയറിയിലും മറ്റൊരാൾ ഒപ്റ്റിമൈസേഷനിലും ശ്രദ്ധ കേന്ദ്രീകരിക്കുക) സഹകരണത്തിന്റെ ഗുണങ്ങൾ വർദ്ധിപ്പിക്കും.
  • വിപുലമായ മാനദണ്ഡങ്ങൾ – ഇതേ രീതി കോഡ് ജനറേഷൻ വെല്ലുവിളികൾക്കോ, ഡിബഗ്ഗിംഗ് സ്യൂട്ടുകൾക്കോ, യഥാർത്ഥ ലോക സോഫ്റ്റ്‌വെയർ നിർമ്മാണത്തിനോ ഉപയോഗിക്കുന്നത് ഈ നേട്ടങ്ങൾ ഗണിതശാസ്ത്രപരമായ പസിലുകൾക്ക് അപ്പുറവും നിലനിൽക്കുമോ എന്ന് പരിശോധിക്കും.

ചുരുക്കം

അൽഗോരിതമിക് ജോലികളിൽ AI കോഡിംഗ് ഏജന്റുകൾ തമ്മിലുള്ള തത്സമയ സഹകരണം വിജയശതമാനവും വേഗതയും വർദ്ധിപ്പിക്കും; ഇത് ഒറ്റപ്പെട്ട ശ്രമങ്ങളെക്കാളും ലളിതമായ വോട്ടിംഗ് രീതിയെക്കാളും മികച്ചതാണ്. ഈ സമീപനം പ്രതീക്ഷാജനകമാണെങ്കിലും, ഇതിന്റെ സ്കെയിലബിലിറ്റിയും (scalability) ചെലവ്ക്ഷമതയും ഭാവി ഗവേഷണങ്ങൾ കണ്ടെത്തേണ്ട ചോദ്യങ്ങളാണ്.

Source: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0