ఐదు Gemini 3.5 Flash ఏజెంట్లు రియల్ టైమ్లో కలిసి పనిచేయడం ద్వారా 30 ప్రశ్నల Project Euler సెట్లో 87% పరిష్కరించాయి. ఇది విడివిడిగా పనిచేసిన ఐదు ఏజెంట్ల (72%) మరియు మెజారిటీ-ఓట్ బేస్లైన్ల (80% సోలో, 90% కొలాబరేటివ్) కంటే మెరుగైన ఫలితం. కొలాబరేటివ్ రన్ సగటు అమలు సమయాన్ని కూడా నాలుగు నిమిషాలు తగ్గించింది; అంటే సమస్యకు 14 నిమిషాల నుండి 10 నిమిషాలకు తగ్గింది, మరియు చాలా పరిష్కారాలు ఐదు నిమిషాల కంటే తక్కువ సమయంలోనే వచ్చాయి.
ఈ ప్రయోగం ఎందుకు ముఖ్యమైనది
AI కోడింగ్ అసిస్టెంట్లు ఇప్పటికే కోడ్ స్నిప్పెట్లను డ్రాఫ్ట్ చేయడం, కోడ్ను డీబగ్ చేయడం మరియు పూర్తి ప్రోగ్రామ్లను రూపొందించడం వంటి పనులు చేస్తున్నాయి. పరిశోధకులు సాధారణంగా ఒక ప్రాంప్ట్పై ఒకే మోడల్ను పరీక్షించి, దాని సమాధానాన్ని గ్రేడ్ చేస్తారు. ఈ పరీక్ష ఒక భిన్నమైన ప్రశ్నను అడుగుతుంది: పని చేసేటప్పుడు తమ పరిశోధనలను పంచుకునే ఏజెంట్ల సమూహం, కేవలం స్వతంత్ర సమాధానాలను లెక్కించే "wisdom of the crowd" విధానం కంటే మెరుగైన ఫలితాలను ఇవ్వగలదా?
Project Euler సమస్యలు అల్గారిథమిక్ ఆలోచనా విధానానికి ఒక ప్రామాణిక బెంచ్మార్క్గా పనిచేస్తాయి. ఇవి గణిత అవగాహన మరియు సమర్థవంతమైన కోడింగ్ను మిళితం చేస్తాయి, తద్వారా ఖచ్చితత్వం మరియు వేగం ముఖ్యమైన నిజ ప్రపంచ ప్రోగ్రామింగ్ పనులకు ఇవి ఒక మంచి ప్రతిరూపంగా నిలుస్తాయి.
పరీక్ష ఎలా నిర్వహించబడింది
- ఏజెంట్లు: Antigravity ప్లాట్ఫారమ్ ద్వారా యాక్సెస్ చేయబడిన ఐదు Gemini 3.5 Flash ఇన్స్టెన్స్లు.
- సన్నివేశాలు:
- ప్రతి ఏజెంట్ ప్రతి సమస్యను విడివిడిగా పరిష్కరించి, తన స్వంత సమాధానాన్ని నివేదించింది.
- అదే ఐదు ఏజెంట్లు రియల్ టైమ్లో కలిసి పనిచేస్తూ, మధ్యంతర ఫలితాలను బ్రాడ్కాస్ట్ చేస్తూ మరియు ఒకరికొకరు దశలను ధృవీకరించుకుంటూ పనిచేశాయి.
- రెండు సెటప్ల కోసం, ఒక సాధారణ మెజారిటీ-ఓట్ అగ్రిగేటర్ ఐదు స్వతంత్ర సమాధానాలను కలిపి ఫలితాన్ని ఇచ్చింది.
- మెట్రిక్స్: ఖచ్చితత్వం (సరైన సమాధానాల శాతం) మరియు రన్టైమ్ (సమస్యకు సగటు సమయం, మరియు పూర్తి కావడానికి పట్టే సమయాల పంపిణీ).
గణాంకాలు ఏమి చెబుతున్నాయి
- సోలో ఖచ్చితత్వం: 72%
- కొలాబరేటివ్ ఖచ్చితత్వం: 87%
- సోలో మెజారిటీ-ఓట్ ఖచ్చితత్వం: 80%
- కొలాబరేటివ్ మెజారిటీ-ఓట్ ఖచ్చితత్వం: 90%
సోలో ఏజెంట్ల కోసం సగటున 14 నిమిషాల నుండి కొలాబరేటివ్ గ్రూప్ కోసం 10 నిమిషాలకు రన్టైమ్ తగ్గింది. చాలా కొలాబరేటివ్ రన్లు ఐదు నిమిషాల కంటే తక్కువ సమయంలోనే పూర్తయ్యాయి, అయితే సోలో ప్రయత్నాలు తరచుగా 30 నిమిషాల టైమ్-అవుట్ పరిమితిని చేరుకున్నాయి.
ఈ వ్యత్యాసానికి కారణమైన కీలక పరిశీలనలు
- ఒక్కరికి అసాధ్యం, అందరికీ సాధ్యం – ఒకే సమస్యపై సోలో ఏజెంట్లన్నీ విఫలమయ్యాయి, కానీ కొలాబరేటివ్ టీమ్ మధ్యంతర ఫలితాలను పంచుకోవడం ద్వారా సామూహికంగా సరైన సమాధానానికి చేరుకుంది.
- క్రాస్-చెకింగ్ ద్వారా తప్పులను గుర్తించడం – వ్యక్తిగత ఏజెంట్లు కొన్నిసార్లు లాజికల్ ట్రాప్స్లో పడిపోయాయి; సమూహం రియల్ టైమ్లో సమాచారాన్ని పోల్చడం ద్వారా ఈ తప్పులను గుర్తించింది.
- వేగవంతమైన కన్వర్జెన్స్ – ఏదైనా ఏజెంట్ ఒక కీలకమైన మధ్యంతర విలువను కనుగొన్నప్పుడు, అది ఆ విషయాన్ని బ్రాడ్కాస్ట్ చేస్తుంది, దీనివల్ల మిగిలిన వారు అనవసరమైన పనులను వదిలేసి, వేగంగా తుది పరిష్కారం వైపు వెళ్లగలుగుతారు.
దాగి ఉన్న ఖర్చులు మరియు పరిమితులు
ఈ ప్రయోగంలో కేవలం ఐదు ఏజెంట్లు మాత్రమే ఉపయోగించబడ్డాయి; ఇదే సామర్థ్యం డజన్ల కొద్దీ లేదా వందల కొద్దీ ఏజెంట్లకు వర్తిస్తుందో లేదో ఇంకా స్పష్టంగా తెలియదు. అంతేకాకుండా, మెజారిటీ-ఓట్ అగ్రిగేటర్ ఇప్పటికీ బాగానే పనిచేసింది (కొలాబరేషన్తో 90%).
తదుపరి ఏం గమనించాలి
- స్కేలింగ్ ప్రయోగాలు – వంద ఏజెంట్లు ఉన్నా ఖచ్చితత్వం పెరుగుతుందా, లేదా సమన్వయ భారము (coordination overhead) ఎక్కువగా ఉంటుందా?
- పాత్రల ప్రత్యేకత (Role specialization) – నిర్దిష్ట పనులను కేటాయించడం (ఉదాహరణకు, ఒక ఏజెంట్ నంబర్ థియరీపై, మరొకరు ఆప్టిమైజేషన్పై దృష్టి సారించడం) సాధారణ కొలాబరేషన్ కంటే ఎక్కువ ప్రయోజనాలను అందించవచ్చు.
- విస్తృతమైన బెంచ్మార్క్లు – ఇదే ఫ్రేమ్వర్క్ను కోడ్-జనరేషన్ సవాళ్లు, డీబగ్గింగ్ సూట్లు లేదా నిజ ప్రపంచ సాఫ్ట్వేర్ బిల్డ్లకు వర్తింపజేయడం ద్వారా, ఈ లాభాలు గణిత పజిల్స్ మాత్రమే కాకుండా ఇతర రంగాల్లో కూడా కొనసాగుతాయో లేదో పరీక్షించవచ్చు.
ముగింపు
AI కోడింగ్ ఏజెంట్ల మధ్య రియల్ టైమ్ కొలాబరేషన్ అల్గారిథమిక్ పనులలో విజయావకాశాలను మరియు వేగాన్ని పెంచుతుంది, ఇది సోలో ప్రయత్నాల కంటే మరియు సాధారణ క్రౌడ్ ఓట్ కంటే కూడా మెరుగ్గా ఉంటుంది. ఈ విధానం ఆశాజనకంగా ఉంది, కానీ దీని స్కేలబిలిటీ మరియు ఖర్చు-సమర్థత (cost-effectiveness) భవిష్యత్తు పరిశోధనలు సమాధానం ఇవ్వాల్సిన ప్రశ్నలుగా మిగిలి ఉన్నాయి.
మూలం: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0
