ABSeeker ನ ಹೊಸ “Answer-Backtracked Credit Assignment” (ABC) ವಿಧಾನವು ದೀರ್ಘಾವಧಿಯ ಹುಡುಕಾಟ ಏಜೆಂಟ್‌ಗಳಿಗೆ (long-horizon search agents) ಕೇವಲ ಅಂತಿಮ ಉತ್ತರವನ್ನಷ್ಟೇ ಅಲ್ಲದೆ, ಪ್ರತಿಯೊಂದು ಹಂತಕ್ಕೂ ಕ್ರೆಡಿಟ್ ಪಡೆಯಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ. ಇದರೊಂದಿಗೆ ತರಬೇತಿ ಪಡೆದ 4 ಬಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್ ಈಗಾಗಲೇ ದೊಡ್ಡ ಮಟ್ಟದ ಸ್ಪರ್ಧಿಗಳಿಗೆ ಸಮನಾಗಿ ಅಥವಾ ಅವುಗಳನ್ನು ಮೀರಿ ನಿಲ್ಲಬಲ್ಲದು.

ಈ ಮೈಲಿಗಲ್ಲು ಬಹಳ ಮುಖ್ಯವಾಗಿದೆ ಏಕೆಂದರೆ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಹೆಚ್ಚಿನ ಏಜೆಂಟ್‌ಗಳನ್ನು ಕೇವಲ ಕಾರ್ಯದ ಕೊನೆಯಲ್ಲಿ ಮಾತ್ರ ನಿರ್ಣಯಿಸಲಾಗುತ್ತದೆ. ಅಂತಿಮ ಉತ್ತರ ಸರಿಯಾಗಿದ್ದರೆ ಇಡೀ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಉತ್ತಮ ಎಂದು ಗುರುತಿಸಲಾಗುತ್ತದೆ; ಒಂದು ವೇಳೆ ತಪ್ಪಾಗಿದ್ದರೆ ಇಡೀ ಸರಣಿಯನ್ನು ಕೆಟ್ಟದ್ದು ಎಂದು ಗುರುತಿಸಲಾಗುತ್ತದೆ. ಈ 'ಎಲ್ಲವೂ ಅಥವಾ ಏನೂ ಇಲ್ಲದ' (all-or-nothing) ಪ್ರತಿಕ್ರಿಯೆಯು ನಿಜವಾದ ಕಲಿಕೆಯ ಸಂಕೇತವನ್ನು ಮರೆಮಾಚುತ್ತದೆ—ಅಂದರೆ, ಒಂದು ತಪ್ಪು ಹಂತದ ನಂತರ ನಡೆದ ಉತ್ತಮ ಕ್ರಮಗಳು ಅಥವಾ ಅದೃಷ್ಟವಶಾತ್ ಸರಿಯಾದ ಫಲಿತಾಂಶಕ್ಕೆ ಕಾರಣವಾದ ಪ್ರಯೋಜನವಿಲ್ಲದ ಕ್ಲಿಕ್‌ಗಳು ಇವುಗಳ ನಿಜವಾದ ಮೌಲ್ಯವನ್ನು ಇದು ತೋರಿಸುವುದಿಲ್ಲ. ABSeeker ನ ಈ ವಿಧಾನವು ಆ ನಿಯಮಾವಳಿಯನ್ನೇ ಬದಲಾಯಿಸುತ್ತದೆ.

ಹಳೆಯ ವಿಧಾನವು ಏಕೆ ಅಸಮರ್ಥವಾಗಿದೆ

ಒಂದು ಏಜೆಂಟ್ ಹುಡುಕಾಟ ನಡೆಸಿದಾಗ, ಕೋಡ್ ಬರೆದಾಗ ಅಥವಾ ಪುರಾವೆಗಳನ್ನು ಸಂಗ್ರಹಿಸಿದಾಗ ಅದು ಸಾಮಾನ್ಯವಾಗಿ ಅನೇಕ ಕ್ರಮಗಳನ್ನು ತೆಗೆದುಕೊಳ್ಳುತ್ತದೆ: ಪ್ರಶ್ನೆಗಳನ್ನು ಕೇಳುವುದು, ಪುಟಗಳನ್ನು ತೆರೆಯುವುದು, ಕಮಾಂಡ್‌ಗಳನ್ನು ಚಲಾಯಿಸುವುದು, ಸಿಸ್ಟಮ್ ಸ್ಥಿತಿಯನ್ನು ಪರಿಶೀಲಿಸುವುದು ಇತ್ಯಾದಿ. ಹದಿನೈದು ಹಂತಗಳ ಪ್ರಕ್ರಿಯೆಯಲ್ಲಿ, ಹಿಂದಿನ ಹಂತಗಳು ಸರಿಯಾಗಿದ್ದರೂ ಸಹ, ಕೇವಲ ಒಂದು ತಪ್ಪು ಹಂತವು ಅಂತಿಮ ಉತ್ತರವನ್ನು ಹಾಳುಮಾಡಬಹುದು. ಇದಕ್ಕೆ ವ್ಯತಿರಿಕ್ತವಾಗಿ, ಸರಿಯಾದ ಉತ್ತರದಿಂದ ಕೊನೆಗೊಳ್ಳುವ ಒಂದು ಪ್ರಕ್ರಿಯೆಯು ಕೇವಲ ಅದೃಷ್ಟದ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರಬಹುದು ಮತ್ತು ಅದರಲ್ಲಿ ಹೆಚ್ಚಿನ ಹಂತಗಳು ಯಾವುದೇ ಮೌಲ್ಯವನ್ನು ಹೊಂದಿಲ್ಲದಿರಬಹುದು. ಕೇವಲ ಅಂತಿಮ ಫಲಿತಾಂಶದ ಮೇಲೆ ತರಬೇತಿ ಮಾಡುವುದು ಮಾಡೆಲ್ ಅನ್ನು ಇಡೀ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಒಂದು 'ಬ್ಲಾಕ್ ಬಾಕ್ಸ್' (black box) ಆಗಿ ಪರಿಗಣಿಸಲು ಒತ್ತಾಯಿಸುತ್ತದೆ, ಇದರಿಂದ ಯಾವ ಉಪ-ವರ್ತನೆಗಳು (sub-behaviors) ನಿಜವಾಗಿಯೂ ಉಪಯುಕ್ತವಾಗಿವೆ ಎಂಬುದನ್ನು ಕಲಿಯುವುದು ಕಷ್ಟವಾಗುತ್ತದೆ.

ಈ ಪರಿಸ್ಥಿತಿಯು ಸಾಫ್ಟ್‌ವೇರ್ ಎಂಜಿನಿಯರಿಂಗ್‌ನಲ್ಲಿನ ડીಬಗ್ಗಿಂಗ್ (debugging) ಪ್ರಕ್ರಿಯೆಯನ್ನು ಹೋಲುತ್ತದೆ. ಡೆವಲಪರ್‌ಗಳು ಪ್ರತಿಯೊಂದು ಸಾಲನ್ನು ಪತ್ತೆಹಚ್ಚುತ್ತಾರೆ, ವಿಫಲವಾದ ಕರೆಯನ್ನು (call) ಪ್ರತ್ಯೇಕಿಸುತ್ತಾರೆ ಮತ್ತು ಅದನ್ನು ಸರಿಪಡಿಸುತ್ತಾರೆ. ಆದರೆ, ಏಜೆಂಟ್‌ಗಳಿಗೆ ಅವರ ಆಂತರಿಕ ಕೆಲಸದ ಅಂತಹ ಯಾವುದೇ "ರಸೀದಿ" (receipt) ಅಥವಾ ದಾಖಲೆ ನೀಡಿಲ್ಲ. ಅಂತಹ ಆಡಿಟ್ ಟ್ರೈಲ್ (audit trail) ಇಲ್ಲದೆ, ಸುಧಾರಣೆಯು ಉತ್ತಮ ತರ್ಕದಿಂದ ಬಂದಿದೆಯೇ ಅಥವಾ ಕೇವಲ ಆಕಸ್ಮಿಕವೇ ಎಂಬುದನ್ನು ಡೆವಲಪರ್‌ಗಳು ಹೇಳಲು ಸಾಧ್ಯವಿಲ್ಲ ಮತ್ತು ಅವರು ಕೆಟ್ಟ ಅಭ್ಯಾಸಗಳನ್ನು ವ್ಯವಸ್ಥಿತವಾಗಿ ತಿದ್ದಲು ಸಾಧ್ಯವಿಲ್ಲ.

ABC ಹೇಗೆ ಕ್ರೆಡಿಟ್ ಅಸೈನ್‌ಮೆಂಟ್ ಅನ್ನು ಮರುರೂಪಿಸುತ್ತದೆ

Answer-Backtracked Credit Assignment ವಿಧಾನವು ಸರಿಯಾದ ಅಂತಿಮ ಉತ್ತರವನ್ನೇ ಆಧರಿಸಿ ಹಿಂದಿನ ಹಂತಗಳಿಗೆ ಹೋಗುತ್ತದೆ. ಇದು ಮೊದಲು ಉತ್ತರದ ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುವ ಅಗತ್ಯವಾದ ಸುಳಿವುಗಳನ್ನು—ನಿರ್ದಿಷ್ಟ ಪುರಾವೆಗಳು, ಮಧ್ಯಂತರ ಫಲಿತಾಂಶಗಳು ಅಥವಾ ಸ್ಟೇಟ್ ಚೆಕ್‌ಗಳನ್ನು—ಹೊರತೆಗೆಯುತ್ತದೆ. ನಂತರ ಇದು ದಾಖಲಾದ ಟ್ರೇಸ್ (trace) ಮೂಲಕ ಹಿಂದಕ್ಕೆ ಹೋಗಿ, ಆ ಸುಳಿವುಗಳಿಗೆ ಅನುಗುಣವಾಗಿ ಪ್ರತಿಯೊಂದು ಕ್ರಮವನ್ನು ಸ್ಕೋರ್ ಮಾಡುತ್ತದೆ. ಅಗತ್ಯವಾದ ಸುಳಿವುಗಳಿಗೆ ನೇರವಾಗಿ ಕೊಡುಗೆ ನೀಡಿದ ಕ್ರಮವು ಸಕಾರಾತ್ಮಕ ಕ್ರೆಡಿಟ್ ಪಡೆಯುತ್ತದೆ; ಅಪ್ರಸ್ತುತ ಅಥವಾ ಹಾನಿಕಾರಕ ಕ್ರಮವು ನಕಾರಾತ್ಮಕ ಅಥವಾ ಶೂನ್ಯ ಸ್ಕೋರ್ ಪಡೆಯುತ್ತದೆ.

ಈ ಸ್ಕೋರಿಂಗ್ ಆಧಾರದ ಮೇಲೆ ಎರಡು ತರಬೇತಿ ವಿಧಾನಗಳಿವೆ:

  • ABC-SFT (Supervised Fine-Tuning) ಲಾಸ್ ಫಂಕ್ಷನ್ ಅನ್ನು ಮರು-ತೂಕಗೊಳಿಸುತ್ತದೆ (re-weights), ಇದರಿಂದ ಹೆಚ್ಚಿನ ಕ್ರೆಡಿಟ್ ಹೊಂದಿರುವ ಹಂತಗಳು ಮಾಡೆಲ್ ಮೇಲೆ ಹೆಚ್ಚು ಪ್ರಭಾವ ಬೀರುತ್ತವೆ. ಇದು ಐತಿಹಾಸಿಕವಾಗಿ ಉಪಯುಕ್ತ ಸುಳಿವುಗಳಿಗೆ ಕಾರಣವಾದ ಕ್ರಮಗಳಿಗೆ ಆದ್ಯತೆ ನೀಡಲು ಮಾಡೆಲ್ ಕಲಿಸುತ್ತದೆ.
  • ABC-GRPO (Gradient-based Reward Policy Optimization) ಪ್ರತಿ ಹಂತದ ಸ್ಕೋರ್‌ಗಳನ್ನು ರಿಇನ್‌ಫೋರ್ಸ್‌ಮೆಂಟ್ ಲರ್ನಿಂಗ್ (reinforcement learning) ಗಾಗಿ ರಿವಾರ್ಡ್ ಸಿಗ್ನಲ್ ಆಗಿ ಪರಿಗಣಿಸುತ್ತದೆ, ಇದು ಉತ್ತರ ಹೊರಹೊಮ್ಮಲು ಸಹಾಯ ಮಾಡಿದ ಹುಡುಕಾಟದ ನಿರ್ದಿಷ್ಟ ಭಾಗಗಳನ್ನು ಬಲಪಡಿಸುತ್ತದೆ.

ಬೈನರಿ ಪಾಸ್/ಫೇಲ್ (pass/fail) ಲೇಬಲ್ ಅನ್ನು ಕೊಡುಗೆಯ ವಿವರವಾದ ನಕ್ಷೆಯನ್ನಾಗಿ ಪರಿವರ್ತಿಸುವ ಮೂಲಕ, ABC ಮಾಡೆಲ್‌ಗೆ ಅತ್ಯಂತ ಶ್ರೀಮಂತ ಕಲಿಕೆಯ ಸಂಕೇತವನ್ನು ನೀಡುತ್ತದೆ.

ಆರಂಭಿಕ ಫಲಿತಾಂಶಗಳು ಸ್ಪಷ್ಟವಾಗಿ ಮಾತನಾಡುತ್ತವೆ

ಸಂಶೋಧಕರು ABC ಅನ್ನು ವಿಕಸನಗೊಳ್ಳುತ್ತಿರುವ ಹುಡುಕಾಟದ ಸ್ಥಿತಿಯನ್ನು (search state) ಟ್ರ್ಯಾಕ್ ಮಾಡುವ ಕಾಂಟೆಕ್ಸ್ಟ್-ಮ್ಯಾನೇಜ್‌ಮೆಂಟ್ ಲೇಯರ್ ಹೊಂದಿರುವ ಸಾಧಾರಣ 4 ಬಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್‌ಗೆ ಅನ್ವಯಿಸಿದರು. ಸಾಂಪ್ರದಾಯಿಕವಾಗಿ ದೊಡ್ಡ ಏಜೆಂಟ್‌ಗಳಿಗೆ ಅನುಕೂಲಕರವಾಗಿರುವ ಬೆಂಚ್‌ಮಾರ್ಕ್ ಕಾರ್ಯಗಳಲ್ಲಿ, ABC ತರಬೇತಿ ಪಡೆದ ಮಾಡೆಲ್ ಆ ದೊಡ್ಡ ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಸಮನಾಗಿ ಅಥವಾ ಅವುಗಳನ್ನು ಮೀರಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿತು. ಮಾಡೆಲ್ ಗಾತ್ರವನ್ನು ಹೆಚ್ಚಿಸದೆ ಈ ಕಾರ್ಯಕ್ಷಮತೆಯ ಲಾಭ ಸಿಕ್ಕಿದೆ, ಇದು ಉತ್ತಮ ಕ್ರೆಡಿಟ್ ಅಸೈನ್‌ಮೆಂಟ್ ಮಾಡೆಲ್‌ನ ಪ್ಯಾರಾಮೀಟರ್ ಸಂಖ್ಯೆಯನ್ನು ಮೀರಿಸಬಲ್ಲದು ಎಂಬುದನ್ನು ಸೂಚಿಸುತ್ತದೆ.

ಇದರ ಮುಖ್ಯ ಸಾರಾಂಶ ಸರಳವಾಗಿದೆ: ಮಾಡೆಲ್‌ಗೆ ಯಾವುದು ಕೆಲಸ ಮಾಡಿತು ಎಂಬುದರ ಸ್ಪಷ್ಟವಾದ ರಸೀದಿಯನ್ನು ನೀಡಿ, ಆಗ ಅದು ಅಷ್ಟೇ ಪ್ರಮಾಣದ ತರಬೇತಿ ಡೇಟಾದಿಂದ ಹೆಚ್ಚಿನ ಮೌಲ್ಯವನ್ನು ಹೊರತೆಗೆಯಬಲ್ಲದು.

ನೈಜ ಪ್ರಪಂಚದ ಏಜೆಂಟ್‌ಗಳಿಗೆ ಇದರ ಅರ್ಥವೇನು

ಬಹು-ಹಂತದ ಕೆಲಸವನ್ನು ಮಾಡುವ ಯಾವುದೇ ಏಜೆಂಟ್—ಕೋಡಿಂಗ್ ಅಸಿಸ್ಟೆಂಟ್‌ಗಳು, ಸಾಹಿತ್ಯ ವಿಮರ್ಶಾ ಬಾಟ್‌ಗಳು, ಗ್ರಾಹಕ ಸೇವಾ ಸಾಧನಗಳು—ಅದರ ಕ್ರಮಗಳ ಟ್ರೇಸ್ (trace) ಮೇಲೆ ಅವಲಂಬಿತವಾಗಿರುತ್ತದೆ. ಆ ಟ್ರೇಸ್ ಅನ್ನು ಉಳಿಸಿಕೊಳ್ಳುವುದು ಮತ್ತು ಮೌಲ್ಯಮಾಪನ ಮಾಡುವುದು ಕೇವಲ ಒಂದು ಹೆಚ್ಚುವರಿ ವೈಶಿಷ್ಟ್ಯವಲ್ಲ; ಇದು ಪರಿಣಾಮಕಾರಿ ಕಲಿಕೆಗೆ ಅತ್ಯಗತ್ಯ ಎಂದು ABC ತೋರಿಸುತ್ತದೆ.

  • ಕೋಡಿಂಗ್ ಏಜೆಂಟ್‌ಗಳು (Coding agents) ಯೋಜನೆಯನ್ನು, ನೀಡಲಾದ ಪ್ರತಿಯೊಂದು ಕಮಾಂಡ್ ಅನ್ನು ಮತ್ತು ಕೋಡ್ ಅನ್ನು ದೃಢೀಕರಿಸುವ ಪರೀಕ್ಷಾ ಫಲಿತಾಂಶಗಳನ್ನು ಲಾಗ್ ಮಾಡಬೇಕಾಗುತ್ತದೆ.
  • ಸಂಶೋಧನಾ ಏಜೆಂಟ್‌ಗಳು (Research agents) ತಾವು ಕಳುಹಿಸಿದ ಪ್ರಶ್ನೆಗಳು, ತೆರೆದ ಮೂಲಗಳು ಮತ್ತು ಹೊರತೆಗೆದ ಪುರಾವೆಗಳನ್ನು ಉಳಿಸಿಕೊಳ್ಳಬೇಕು.
  • ಸಪೋರ್ಟ್ ಏಜೆಂಟ್‌ಗಳು (Support agents) ಪರಿಹಾರಕ್ಕೆ ಕಾರಣವಾದ ಪ್ರತಿಯೊಂದು ಸ್ಟೇಟ್ ಚೆಕ್ ಮತ್ತು ನಿರ್ಧಾರದ ಹಂತಗಳನ್ನು ದಾಖಲಿಸಬೇಕು.

ಈ ಟ್ರೇಸ್‌ಗಳು ಲಭ್ಯವಿದ್ದಾಗ, ABC ನಿಖರವಾದ ಕ್ರೆಡಿಟ್ ಅನ್ನು ನೀಡಬಲ್ಲದು, ಇದು ಮಾಡೆಲ್ ಉತ್ತಮ ಅಭ್ಯಾಸಗಳನ್ನು ಬಲಪಡಿಸಲು ಮತ್ತು ಕೌಶಲ್ಯ ಎಂದು ತಪ್ಪಾಗಿ ಭಾವಿಸಬಹುದಾದ ಅದೃಷ್ಟದ ಶಾರ್ಟ್‌ಕಟ್‌ಗಳನ್ನು ಕೈಬಿಡಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ.

ವಿರೋಧಾಭಿಪ್ರಾಯಗಳು ಮತ್ತು ಪ್ರಾಯೋಗಿಕ ಅಡೆತಡೆಗಳು

ABC ನ ಪ್ರಯೋಜನಗಳು ಹೆಚ್ಚುವರಿ ಸಂಕೀರ್ಣತೆಯೊಂದಿಗೆ ಬರುತ್ತವೆ.

ಸಾರಾಂಶ

Answer-Backtracked Credit Assignment ಎಂಬುದು ಏಜೆಂಟ್‌ಗಳಿಗೆ ಹುಡುಕಾಟ (search), ಕೋಡಿಂಗ್ (code) ಮತ್ತು ತರ್ಕ (reason) ಮಾಡುವುದನ್ನು ಕಲಿಸುವ ವಿಧಾನವನ್ನೇ ಬದಲಾಯಿಸುತ್ತದೆ. ಕೇವಲ ಅಂತಿಮ ಗುರಿಯ ಬದಲಿಗೆ, ದಾರಿಯಲ್ಲಿ ಮಾಡುವ ಸರಿಯಾದ ಕ್ರಮಗಳಿಗೆ ಪ್ರತಿಫಲ ನೀಡುವ ಮೂಲಕ, ಇದು ಮಧ್ಯಮ ಗಾತ್ರದ ಮಾಡೆಲ್‌ಗಳು ದೊಡ್ಡ ಮಾಡೆಲ್‌ಗಳಷ್ಟೇ ಪರಿಣಾಮಕಾರಿಯಾಗಿ ಕಲಿಯಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ. ಹಲವು ಹಂತಗಳ ಕೆಲಸಗಳನ್ನು ಮಾಡಬೇಕಾದ ಏಜೆಂಟ್‌ಗಳನ್ನು ನಿರ್ಮಿಸುವ ಯಾರಿಗಾದರೂ, ಟ್ರೇಸ್-ಸೆಂಟ್ರಿಕ್ (trace-centric) ತರಬೇತಿ ವಿಧಾನವನ್ನು ಅಳವಡಿಸಿಕೊಳ್ಳುವುದು ಕೇವಲ ಆಯ್ಕೆಯಲ್ಲ—ಅದು ನಂಬಲರ್ಹ, ಪರಿಶೀಲಿಸಬಹುದಾದ (auditable) ಮತ್ತು ಅಂತಿಮವಾಗಿ ಹೆಚ್ಚು ಬುದ್ಧಿವಂತ AI ನಿರ್ಮಿಸುವ ಹಾದಿಯಾಗಿದೆ.