वास्तविक समय (real time) में मिलकर काम करने वाले पांच Gemini 3.5 Flash एजेंटों ने 30-प्रश्नों के Project Euler सेट का 87% हल कर लिया, जो अकेले काम करने वाले पांच एजेंटों (72%) और दोनों 'मेजॉरिटी-वोट' (majority-vote) बेसलाइन (80% अकेले, 90% सहयोगात्मक) से बेहतर था। सहयोगात्मक रन ने औसत निष्पादन समय (execution time) को भी चार मिनट कम कर दिया, जो प्रति समस्या 14 मिनट से घटकर 10 मिनट रह गया, जिसमें अधिकांश समाधान पांच मिनट से भी कम समय में मिल गए।
यह प्रयोग क्यों महत्वपूर्ण है
AI कोडिंग असिस्टेंट पहले से ही कोड स्निपेट्स (snippets) तैयार करते हैं, कोड को डीबग करते हैं और पूरे प्रोग्राम जेनरेट करते हैं। शोधकर्ता आमतौर पर एक प्रॉम्प्ट पर एकल मॉडल का परीक्षण करते हैं और उसके उत्तर को ग्रेड देते हैं। यह परीक्षण एक अलग प्रश्न पूछता है: क्या एजेंटों का एक समूह, जो काम करते समय अपने निष्कर्ष साझा करते हैं, उस "विजडम ऑफ द क्राउड" (wisdom of the crowd) दृष्टिकोण से बेहतर प्रदर्शन कर सकता है जो केवल स्वतंत्र उत्तरों की गणना करता है?
Project Euler की समस्याएं एल्गोरिद्मिक सोच (algorithmic thinking) के लिए एक मानक बेंचमार्क के रूप में काम करती हैं। वे गणितीय अंतर्दृष्टि और कुशल कोडिंग का मिश्रण हैं, जो उन्हें वास्तविक दुनिया के प्रोग्रामिंग कार्यों के लिए एक अच्छा विकल्प बनाते हैं जहाँ सटीकता और गति मायने रखती है।
परीक्षण कैसे तैयार किया गया था
- एजेंट: Antigravity प्लेटफॉर्म के माध्यम से एक्सेस किए गए Gemini 3.5 Flash के पांच इंस्टेंस।
- परिदृश्य:
- प्रत्येक एजेंट ने हर समस्या को अकेले हल किया और अपना उत्तर रिपोर्ट किया।
- उन्हीं पांच एजेंटों ने वास्तविक समय में सहयोग किया, मध्यवर्ती परिणामों (intermediate results) का प्रसारण किया और एक-दूसरे के चरणों की पुष्टि की।
- दोनों सेटअपों के लिए, एक साधारण 'मेजॉरिटी-वोट' एग्रीगेटर ने पांच स्वतंत्र उत्तरों को संयोजित किया।
- मेट्रिक्स: सटीकता (सही उत्तरों का प्रतिशत) और रनटाइम (प्रति समस्या औसत समय, साथ ही पूर्ण होने के समय का वितरण)।
आंकड़े क्या दर्शाते हैं
- अकेले की सटीकता: 72%
- सहयोगात्मक सटीकता: 87%
- अकेले की मेजॉरिटी-वोट सटीकता: 80%
- सहयोगात्मक मेजॉरिटी-वोट सटीकता: 90%
अकेले एजेंटों के लिए औसत रनटाइम 14 मिनट से घटकर सहयोगात्मक समूह के लिए 10 मिनट हो गया। अधिकांश सहयोगात्मक रन पांच मिनट से कम में समाप्त हो गए, जबकि अकेले किए गए प्रयासों में अक्सर 30-मिनट की टाइमआउट सीमा लग जाती थी।
मुख्य अवलोकन जो इस अंतर को समझाते हैं
- एक के लिए असंभव, कई के लिए संभव – एक ही समस्या पर सभी अकेले एजेंट विफल रहे, फिर भी सहयोगात्मक टीम ने आंशिक परिणामों का आदान-प्रदान किया और सामूहिक रूप से सही उत्तर तक पहुँचे।
- क्रॉस-चेकिंग के माध्यम से त्रुटियों को पकड़ना – व्यक्तिगत एजेंट कभी-कभी तार्किक जाल (logical traps) में फंस जाते थे; समूह ने वास्तविक समय में नोट्स की तुलना करके इन गलतियों को पकड़ लिया।
- तेजी से अभिसरण (Rapid convergence) – जब किसी भी एजेंट ने कोई महत्वपूर्ण मध्यवर्ती मान (intermediate value) खोजा, तो उसने उस निष्कर्ष का प्रसारण किया, जिससे अन्य एजेंटों को अनावश्यक काम छोड़ने और अंतिम समाधान तक तेजी से पहुँचने में मदद मिली।
छिपी हुई लागत और सीमाएं
प्रयोग में केवल पांच एजेंटों का उपयोग किया गया था; यह अभी भी स्पष्ट नहीं है कि क्या यही दक्षता दर्जनों या सैकड़ों एजेंटों तक स्केल (scale) हो सकती है। इसके अलावा, मेजॉरिटी-वोट एग्रीगेटर ने अभी भी अच्छा प्रदर्शन किया (सहयोग के साथ 90%)।
आगे क्या देखने की आवश्यकता है
- स्केलिंग प्रयोग – क्या सौ एजेंट अभी भी सटीकता में सुधार करेंगे, या समन्वय का बोझ (coordination overhead) हावी हो जाएगा?
- भूमिका विशेषज्ञता – विशिष्ट कार्य सौंपना (जैसे, एक एजेंट नंबर थ्योरी पर ध्यान केंद्रित करता है, दूसरा ऑप्टिमाइज़ेशन पर) मुक्त-रूप सहयोग की तुलना में लाभ को बढ़ा सकता है।
- व्यापक बेंचमार्क – कोड-जेनरेशन चुनौतियों, डीबगिंग सुइट्स, या वास्तविक दुनिया के सॉफ्टवेयर बिल्ड्स पर उसी ढांचे को लागू करने से यह परीक्षण होगा कि क्या लाभ गणितीय पहेलियों से परे भी बने रहते हैं।
निष्कर्ष
AI कोडिंग एजेंटों के बीच वास्तविक समय का सहयोग एल्गोरिद्मिक कार्यों पर सफलता दर और गति दोनों को बढ़ा सकता है, जो अकेले किए गए प्रयासों और यहाँ तक कि एक साधारण क्राउड वोट से भी बेहतर प्रदर्शन करता है। यह दृष्टिकोण आशाजनक है, लेकिन इसकी स्केलेबिलिटी और लागत-प्रभावशीलता अभी भी खुले प्रश्न हैं जिनका उत्तर भविष्य के शोध को देना होगा।
स्रोत: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
