रिअल-टाइममध्ये एकत्र काम करणाऱ्या पाच Gemini 3.5 Flash एजंट्सनी 30 प्रश्नांच्या Project Euler संचातील 87% प्रश्न सोडवले, जे पाच स्वतंत्रपणे काम करणाऱ्या एजंट्सपेक्षा (72%) आणि दोन्ही majority-vote बेसलाईन्सपेक्षा (80% सोलो, 90% कोलॅबोरेटिव्ह) अधिक चांगले होते. कोलॅबोरेटिव्ह रनमुळे सरासरी एक्झिक्यूशन वेळेत देखील चार मिनिटांची बचत झाली, जी प्रति प्रश्न 14 मिनिटांवरून 10 मिनिटांवर आली, आणि बहुतेक उत्तरे पाच मिनिटांच्या आत मिळाली.

हा प्रयोग का महत्त्वाचा आहे

AI कोडिंग असिस्टंट्स आधीच कोड स्निपेट्स तयार करणे, कोडमधील त्रुटी शोधणे (debug) आणि संपूर्ण प्रोग्राम तयार करणे अशी कामे करत आहेत. संशोधक सहसा एका प्रॉम्प्टवर सिंगल मॉडेलची चाचणी घेतात आणि त्याच्या उत्तराचे मूल्यांकन करतात. ही चाचणी एक वेगळा प्रश्न विचारते: काम करताना आपले निष्कर्ष एकमेकांशी शेअर करणाऱ्या एजंट्सचा समूह, केवळ स्वतंत्र उत्तरांची गणना करणाऱ्या "wisdom of the crowd" (गर्दीचे ज्ञान) दृष्टिकोनापेक्षा अधिक चांगली कामगिरी करू शकतो का?

Project Euler मधील प्रश्न अल्गोरिदमिक विचारसरणीसाठी एक मानक बेंचमार्क म्हणून काम करतात. ते गणितीय अंतर्दृष्टी आणि कार्यक्षम कोडिंग यांचे मिश्रण आहेत, ज्यामुळे ते वास्तविक जगातील प्रोग्रामिंग कामांसाठी, जिथे अचूकता आणि वेग महत्त्वाचा असतो, एक उत्तम पर्याय ठरतात.

चाचणी कशी आयोजित केली होती

  • एजंट्स: Antigravity प्लॅटफॉर्मद्वारे प्रवेश केलेले Gemini 3.5 Flash चे पाच इन्स्टन्स.
  • परिस्थिती (Scenarios):
    1. प्रत्येक एजंटने प्रत्येक प्रश्न स्वतंत्रपणे सोडवला आणि स्वतःचे उत्तर दिले.
    2. तेच पाच एजंट्स रिअल-टाइममध्ये एकमेकांशी सहकार्य करत होते, मध्यवर्ती निकाल प्रसारित करत होते आणि एकमेकांच्या पायऱ्यांची (steps) खात्री करत होते.
    3. दोन्ही सेटअपसाठी, एका साध्या majority-vote अ‍ॅग्रिगेटरने पाच स्वतंत्र उत्तरांचे एकत्रीकरण केले.
  • मेट्रिक्स: अचूकता (बरोबर उत्तरांची टक्केवारी) आणि रनटाइम (प्रति प्रश्न सरासरी वेळ, आणि पूर्ण होण्याच्या वेळेचे वितरण).

आकडेवारी काय दर्शवते

  • सोलो अचूकता: 72 %
  • कोलॅबोरेटिव्ह अचूकता: 87 %
  • सोलो majority-vote अचूकता: 80 %
  • कोलॅबोरेटिव्ह majority-vote अचूकता: 90 %

सोलो एजंट्ससाठी सरासरी रनटाइम 14 मिनिटांवरून कोलॅबोरेटिव्ह ग्रुपसाठी 10 मिनिटांवर आला. बहुतेक कोलॅबोरेटिव्ह रन पाच मिनिटांच्या आत पूर्ण झाले, तर सोलो प्रयत्नांनी वारंवार 30 मिनिटांची टाइमआउट मर्यादा ओलांडली.

तफावत स्पष्ट करणारी मुख्य निरीक्षणे

  • एकासाठी अशक्य, अनेकांसाठी शक्य – एका विशिष्ट प्रश्नावर सर्व सोलो एजंट्स अपयशी ठरले, तरीही कोलॅबोरेटिव्ह टीमने अंशतः निकाल एकमेकांशी शेअर केले आणि एकत्रितपणे योग्य उत्तरापर्यंत पोहोचले.
  • क्रॉस-चेकिंगद्वारे त्रुटी शोधणे – वैयक्तिक एजंट्स कधीकधी तार्किक जाळ्यात (logical traps) अडकत होते; रिअल-टाइममध्ये माहितीची तुलना करून ग्रुपने या चुका पकडल्या.
  • जलद अभिसरण (Rapid convergence) – जेव्हा एखाद्या एजंटला एखादे महत्त्वाचे मध्यवर्ती मूल्य सापडले, तेव्हा त्याने तो निष्कर्ष प्रसारित केला, ज्यामुळे इतरांना अनावश्यक काम टाळता आले आणि अंतिम उत्तरापर्यंत वेगाने पोहोचता आले.

छुपे खर्च आणि मर्यादा

या प्रयोगात केवळ पाच एजंट्सचा वापर केला गेला; हीच कार्यक्षमता डझनावारी किंवा शेकडो एजंट्सपर्यंत वाढवता येईल की नाही, हे अद्याप स्पष्ट नाही. शिवाय, majority-vote अ‍ॅग्रिगेटरने देखील चांगली कामगिरी केली (सहकार्यासह 90%).

पुढे काय पाहावे

  • स्केलिंग प्रयोग – शंभर एजंट्समुळे अचूकता वाढेल की समन्वयाचा भार (coordination overhead) वाढेल?
  • भूमिकेचे विशेषीकरण (Role specialization) – विशिष्ट कार्ये सोपवणे (उदा. एक एजंट नंबर थिअरीवर लक्ष केंद्रित करतो, दुसरा ऑप्टिमायझेशनवर) मुक्त सहकार्यापेक्षा अधिक फायदे मिळवून देऊ शकते.
  • व्यापक बेंचमार्क – कोड-जनरेशन आव्हाने, डीबगिंग सूट्स किंवा वास्तविक जगातील सॉफ्टवेअर बिल्ड्सना हाच फ्रेमवर्क लागू केल्यास, हे फायदे गणितीय कोडी सोडवण्यापलीकडे टिकतात का, याची चाचणी घेता येईल.

निष्कर्ष

AI कोडिंग एजंट्समधील रिअल-टाइम सहकार्य अल्गोरिदमिक कामांवरील यश दर आणि वेग दोन्ही वाढवू शकते, जे सोलो प्रयत्न आणि साध्या क्राउड वोटपेक्षाही सरस आहे. हा दृष्टिकोन आशादायक आहे, परंतु त्याची स्केलेबिलिटी आणि किफायतशीरपणा हे अद्याप unanswered प्रश्न आहेत, ज्यांची उत्तरे भविष्यातील संशोधनाला द्यावी लागतील.

स्रोत: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0