ಐದು Gemini 3.5 Flash ಏಜೆಂಟ್‌ಗಳು ನೈಜ ಸಮಯದಲ್ಲಿ (real time) ಒಟ್ಟಾಗಿ ಕೆಲಸ ಮಾಡುವ ಮೂಲಕ 30 ಪ್ರಶ್ನೆಗಳ Project Euler ಸೆಟ್‌ನ ಶೇಕಡಾ 87 ರಷ್ಟು ಭಾಗವನ್ನು ಪರಿಹರಿಸಿದವು. ಇದು ಏಕಾಂಗಿಯಾಗಿ ಕೆಲಸ ಮಾಡಿದ ಐದು ಏಜೆಂಟ್‌ಗಳಿಗಿಂತ (72%) ಮತ್ತು ಎರಡೂ majority-vote baseline ಗಳಿಗಿಂತ (80% ಏಕಾಂಗಿ, 90% ಸಹಯೋಗದೊಂದಿಗೆ) ಉತ್ತಮವಾಗಿತ್ತು. ಸಹಯೋಗದ ಪ್ರಕ್ರಿಯೆಯು ಸರಾಸರಿ ಕಾರ್ಯಗತಗೊಳಿಸುವ ಸಮಯವನ್ನು ನಾಲ್ಕು ನಿಮಿಷಗಳಷ್ಟು ಕಡಿಮೆ ಮಾಡಿತು; ಇದು ಪ್ರತಿ ಸಮಸ್ಯೆಗೆ 14 ನಿಮಿಷಗಳಿಂದ 10 ನಿಮಿಷಗಳಿಗೆ ಇಳಿಕೆಯಾಯಿತು ಮತ್ತು ಹೆಚ್ಚಿನ ಪರಿಹಾರಗಳು ಐದು ನಿಮಿಷಗಳಿಗಿಂತ ಕಡಿಮೆ ಸಮಯದಲ್ಲಿ ಲಭ್ಯವಾದವು.

ಈ ಪ್ರಯೋಗ ಏಕೆ ಮುಖ್ಯ

AI ಕೋಡಿಂಗ್ ಅಸಿಸ್ಟೆಂಟ್‌ಗಳು ಈಗಾಗಲೇ ಸ್ನಿಪ್ಪೆಟ್‌ಗಳನ್ನು (snippets) ಸಿದ್ಧಪಡಿಸುವುದು, ಕೋಡ್ ಅನ್ನು ಡಿಬಗ್ ಮಾಡುವುದು ಮತ್ತು ಸಂಪೂರ್ಣ ಪ್ರೋಗ್ರಾಂಗಳನ್ನು ರಚಿಸುವುದನ್ನು ಮಾಡುತ್ತಿವೆ. ಸಂಶೋಧಕರು ಸಾಮಾನ್ಯವಾಗಿ ಒಂದು ಪ್ರಾಂಪ್ಟ್ ಮೇಲೆ ಒಂದೇ ಮಾಡೆಲ್ ಅನ್ನು ಪರೀಕ್ಷಿಸುತ್ತಾರೆ ಮತ್ತು ಅದರ ಉತ್ತರವನ್ನು ಗ್ರೇಡ್ ಮಾಡುತ್ತಾರೆ. ಈ ಪರೀಕ್ಷೆಯು ವಿಭಿನ್ನ ಪ್ರಶ್ನೆಯನ್ನು ಕೇಳುತ್ತದೆ: ಕೆಲಸ ಮಾಡುವಾಗ ತಮ್ಮ ಸಂಶೋಧನೆಗಳನ್ನು ಹಂಚಿಕೊಳ್ಳುವ ಏಜೆಂಟ್‌ಗಳ ಗುಂಪು, ಕೇವಲ ಸ್ವತಂತ್ರ ಉತ್ತರಗಳನ್ನು ಎಣಿಸುವ "wisdom of the crowd" ವಿಧಾನಕ್ಕಿಂತ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಬಲ್ಲದೇ?

Project Euler ಸಮಸ್ಯೆಗಳು ಅಲ್ಗಾರಿದಮಿಕ್ ಚಿಂತನೆಗೆ (algorithmic thinking) ಒಂದು ಪ್ರಮಾಣಿತ ಮಾನದಂಡವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ. ಅವು ಗಣಿತದ ಒಳನೋಟ ಮತ್ತು ದಕ್ಷ ಕೋಡಿಂಗ್ ಅನ್ನು ಒಳಗೊಂಡಿರುವುದರಿಂದ, ನಿಖರತೆ ಮತ್ತು ವೇಗ ಮುಖ್ಯವಾಗುವ ನೈಜ ಪ್ರೋಗ್ರಾಮಿಂಗ್ ಕಾರ್ಯಗಳಿಗೆ ಇವು ಉತ್ತಮ ಪ್ರತಿನಿಧಿಯಾಗಿವೆ.

ಪರೀಕ್ಷೆಯನ್ನು ಹೇಗೆ ರೂಪಿಸಲಾಯಿತು

  • ಏಜೆಂಟ್‌ಗಳು: Antigravity ಪ್ಲಾಟ್‌ಫಾರ್ಮ್ ಮೂಲಕ ಪ್ರವೇಶಿಸಿದ Gemini 3.5 Flash ನ ಐದು ಇನ್‌ಸ್ಟೆನ್ಸ್‌ಗಳು.
  • ಸನ್ನಿವೇಶಗಳು:
    1. ಪ್ರತಿಯೊಬ್ಬ ಏಜೆಂಟ್ ಪ್ರತಿಯೊಂದು ಸಮಸ್ಯೆಯನ್ನು ಏಕಾಂಗಿಯಾಗಿ ಎದುರಿಸಿತು ಮತ್ತು ತನ್ನದೇ ಆದ ಉತ್ತರವನ್ನು ವರದಿ ಮಾಡಿತು.
    2. ಅದೇ ಐದು ಏಜೆಂಟ್‌ಗಳು ನೈಜ ಸಮಯದಲ್ಲಿ ಸಹಯೋಗ ನಡೆಸಿದವು, ಮಧ್ಯಂತರ ಫಲಿತಾಂಶಗಳನ್ನು ಪ್ರಸಾರ ಮಾಡಿದವು ಮತ್ತು ಪರಸ್ಪರ ಹಂತಗಳನ್ನು ಖಚಿತಪಡಿಸಿಕೊಂಡವು.
    3. ಎರಡೂ ಸೆಟಪ್‌ಗಳಿಗಾಗಿ, ಸರಳ majority-vote aggregator ಐದು ಸ್ವತಂತ್ರ ಉತ್ತರಗಳನ್ನು ಸಂಯೋಜಿಸಿತು.
  • ಮಾನದಂಡಗಳು (Metrics): ನಿಖರತೆ (ಸರಿಯಾದ ಉತ್ತರಗಳ ಶೇಕಡಾವಾರು) ಮತ್ತು ರನ್‌ಟೈಮ್ (ಪ್ರತಿ ಸಮಸ್ಯೆಗೆ ಸರಾಸರಿ ಸಮಯ, ಜೊತೆಗೆ ಪೂರ್ಣಗೊಳಿಸುವ ಸಮಯದ ವಿತರಣೆ).

ಅಂಕಿಅಂಶಗಳು ಏನನ್ನು ಬಹಿರಂಗಪಡಿಸುತ್ತವೆ

  • ಏಕಾಂಗಿ ನಿಖರತೆ: 72 %
  • ಸಹಯೋಗದ ನಿಖರತೆ: 87 %
  • ಏಕಾಂಗಿ majority-vote ನಿಖರತೆ: 80 %
  • ಸಹಯೋಗದ majority-vote ನಿಖರತೆ: 90 %

ಏಕಾಂಗಿ ಏಜೆಂಟ್‌ಗಳ ಸರಾಸರಿ ರನ್‌ಟೈಮ್ 14 ನಿಮಿಷಗಳಿಂದ ಸಹಯೋಗದ ಗುಂಪಿಗೆ 10 ನಿಮಿಷಗಳಿಗೆ ಇಳಿಕೆಯಾಯಿತು. ಹೆಚ್ಚಿನ ಸಹಯೋಗದ ಪ್ರಕ್ರಿಯೆಗಳು ಐದು ನಿಮಿಷಗಳಿಗಿಂತ ಕಡಿಮೆ ಸಮಯದಲ್ಲಿ ಪೂರ್ಣಗೊಂಡವು, ಆದರೆ ಏಕಾಂಗಿ ಪ್ರಯತ್ನಗಳು ಪದೇ ಪದೇ 30-ನಿಮಿಷಗಳ ಟೈಮೌಟ್ ಮಿತಿಯನ್ನು ತಲುಪುತ್ತಿದ್ದವು.

ಅಂತರವನ್ನು ವಿವರಿಸುವ ಪ್ರಮುಖ ಅವಲೋಕನಗಳು

  • ಒಬ್ಬರಿಗೆ ಅಸಾಧ್ಯ, ಹಲವರಿಗೆ ಸಾಧ್ಯ – ಒಂದು ಸಮಸ್ಯೆಯಲ್ಲಿ ಎಲ್ಲಾ ಏಕಾಂಗಿ ಏಜೆಂಟ್‌ಗಳು ವಿಫಲವಾದವು, ಆದರೆ ಸಹಯೋಗದ ತಂಡವು ಭಾಗಶಃ ಫಲಿತಾಂಶಗಳನ್ನು ವಿನಿಮಯ ಮಾಡಿಕೊಂಡಿತು ಮತ್ತು ಸಾಮೂಹಿಕವಾಗಿ ಸರಿಯಾದ ಉತ್ತರವನ್ನು ಕಂಡುಕೊಂಡಿತು.
  • ಕ್ರಾಸ್-ಚೆಕಿಂಗ್ ಮೂಲಕ ತಪ್ಪುಗಳನ್ನು ಪತ್ತೆಹಚ್ಚುವುದು – ವೈಯಕ್ತಿಕ ಏಜೆಂಟ್‌ಗಳು ಕೆಲವೊಮ್ಮೆ ತಾರ್ಕಿಕ ಬಲೆಗೆ ಬೀಳುತ್ತಿದ್ದರು; ಗುಂಪು ನೈಜ ಸಮಯದಲ್ಲಿ ಮಾಹಿತಿಯನ್ನು ಹೋಲಿಕೆ ಮಾಡುವ ಮೂಲಕ ಈ ತಪ್ಪುಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಿತು.
  • ವೇಗದ ಏಕೀಕರಣ (Rapid convergence) – ಯಾವುದೇ ಏಜೆಂಟ್ ನಿರ್ಣಾಯಕ ಮಧ್ಯಂತರ ಮೌಲ್ಯವನ್ನು ಕಂಡುಕೊಂಡಾಗ, ಅದು ಆ ಸಂಶೋಧನೆಯನ್ನು ಪ್ರಸಾರ ಮಾಡಿತು, ಇದರಿಂದ ಇತರರು ಅನಗತ್ಯ ಕೆಲಸವನ್ನು ಬಿಟ್ಟುಕೊಟ್ಟು ಅಂತಿಮ ಪರಿಹಾರವನ್ನು ವೇಗವಾಗಿ ಕಂಡುಕೊಳ್ಳಲು ಸಾಧ್ಯವಾಯಿತು.

ಅಡಗಿರುವ ವೆಚ್ಚಗಳು ಮತ್ತು ಮಿತಿಗಳು

ಈ ಪ್ರಯೋಗದಲ್ಲಿ ಕೇವಲ ಐದು ಏಜೆಂಟ್‌ಗಳನ್ನು ಬಳಸಲಾಗಿದೆ; ಇದೇ ದಕ್ಷತೆಯು ಡಜನ್‌ಗಟ್ಟಲೆ ಅಥವಾ ನೂರಾರು ಏಜೆಂಟ್‌ಗಳಿಗೆ ಅನ್ವಯವಾಗುತ್ತದೆಯೇ ಎಂಬುದು ಇನ್ನೂ ಅಸ್ಪಷ್ಟವಾಗಿದೆ. ಅಷ್ಟೇ ಅಲ್ಲದೆ, majority-vote aggregator ಇನ್ನೂ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿತು (ಸಹಯೋಗದೊಂದಿಗೆ 90 %).

ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು

  • ಸ್ಕೇಲಿಂಗ್ ಪ್ರಯೋಗಗಳು – ನೂರು ಏಜೆಂಟ್‌ಗಳಿದ್ದರೂ ನಿಖರತೆ ಸುಧಾರಿಸುತ್ತದೆಯೇ ಅಥವಾ ಸಮನ್ವಯದ ಹೊರೆ (coordination overhead) ಹೆಚ್ಚಾಗುತ್ತದೆಯೇ?
  • ಪಾತ್ರದ ವಿಶೇಷೀಕರಣ – ನಿರ್ದಿಷ್ಟ ಕಾರ್ಯಗಳನ್ನು ನಿಯೋಜಿಸುವುದು (ಉದಾಹರಣೆಗೆ, ಒಬ್ಬ ಏಜೆಂಟ್ ಸಂಖ್ಯೆ ಸಿದ್ಧಾಂತದ ಮೇಲೆ ಗಮನಹರಿಸುವುದು, ಇನ್ನೊಬ್ಬನು ಆಪ್ಟಿಮೈಸೇಶನ್ ಮೇಲೆ ಗಮನಹರಿಸುವುದು) ಮುಕ್ತ ಸಹಯೋಗಕ್ಕಿಂತ ಹೆಚ್ಚಿನ ಪ್ರಯೋಜನಗಳನ್ನು ನೀಡಬಹುದು.
  • ವ್ಯಾಪಕವಾದ ಮಾನದಂಡಗಳು – ಕೋಡ್-ಜನರೇಷನ್ ಸವಾಲುಗಳು, ಡಿಬಗ್ಗಿಂಗ್ ಸೂಟ್‌ಗಳು ಅಥವಾ ನೈಜ ಪ್ರಪಂಚದ ಸಾಫ್ಟ್‌ವೇರ್ ಬಿಲ್ಡ್‌ಗಳಿಗೆ ಇದೇ ಚೌಕಟ್ಟನ್ನು ಅನ್ವಯಿಸುವುದು, ಈ ಲಾಭಗಳು ಗಣಿತದ ಒಗಟುಗಳಿಗಿಂತ ಮೀರಿದ ಕ್ಷೇತ್ರಗಳಲ್ಲೂ ಉಳಿಯುತ್ತವೆಯೇ ಎಂದು ಪರೀಕ್ಷಿಸುತ್ತದೆ.

ಸಾರಾಂಶ

AI ಕೋಡಿಂಗ್ ಏಜೆಂಟ್‌ಗಳ ನಡುವಿನ ನೈಜ ಸಮಯದ ಸಹಯೋಗವು ಅಲ್ಗಾರಿದಮಿಕ್ ಕಾರ್ಯಗಳಲ್ಲಿ ಯಶಸ್ಸಿನ ದರ ಮತ್ತು ವೇಗ ಎರಡನ್ನೂ ಹೆಚ್ಚಿಸಬಲ್ಲದು, ಇದು ಏಕಾಂಗಿ ಪ್ರಯತ್ನಗಳು ಮತ್ತು ಸರಳ ಕ್ರಾಡ್ ವೋಟ್ (crowd vote) ಅನ್ನು ಮೀರಿಸುತ್ತದೆ. ಈ ವಿಧಾನವು ಭರವಸೆಯನ್ನು ತೋರಿಸುತ್ತದೆ, ಆದರೆ ಅದರ ಸ್ಕೇಲೆಬಿಲಿಟಿ ಮತ್ತು ವೆಚ್ಚ-ಪರಿಣಾಮಕಾರಿತ್ವವು ಭವಿಷ್ಯದ ಸಂಶೋಧನೆಗಳು ಉತ್ತರಿಸಬೇಕಾದ ಪ್ರಶ್ನೆಗಳಾಗಿ ಉಳಿದಿವೆ.

ಮೂಲ: https://dev.to/ykdap/for-coding-agents-real-time-collaboration-beats-the-wisdom-of-the-crowd-1kj0