ಹೊಸ “proactive memory” ಮಾಡ್ಯೂಲ್, ಮೂಲ ಮಾಡೆಲ್ ಅನ್ನು ಫೈನ್-ಟ್ಯೂನ್ ಮಾಡದೆಯೇ, ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿ (LLM) ಏಜೆಂಟ್ಗಳು ಕಾರ್ಯದ ಅಗತ್ಯತೆಗಳು, ಪರಿಸರದ ಸತ್ಯಾಂಶಗಳು ಮತ್ತು ಹಿಂದಿನ ವೈಫಲ್ಯಗಳನ್ನು ಪತ್ತೆಹಚ್ಚಲು ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ. ಬೆಂಚ್ಮಾರ್ಕ್ ಪರೀಕ್ಷೆಗಳಲ್ಲಿ, ಈ ಬದಲಾವಣೆಯು Terminal-Bench 2.0 ನಲ್ಲಿ Sonnet 4.5 ರ ಸ್ಕೋರ್ ಅನ್ನು 8.3 ಶೇಕಡಾ ಪಾಯಿಂಟ್ಗಳಷ್ಟು ಮತ್ತು τ2-Bench ಸೂಟ್ನಲ್ಲಿ 6.8 ಪಾಯಿಂಟ್ಗಳಷ್ಟು ಹೆಚ್ಚಿಸಿದೆ; SETA-ತರಬೇತಿ ಪಡೆದ ಮೆಮೊರಿ ಏಜೆಂಟ್, ನೋಡಿರದ ಸಮಸ್ಯೆಗಳ ಮೇಲೆ ಫ್ರೋಜನ್ ಮಾಡೆಲ್ನ pass@1 ಅನ್ನು 37.6% ರಿಂದ 41.1% ಕ್ಕೆ ಏರಿಸಿದೆ.
ಏಜೆಂಟ್ಗಳು ದಾರಿ ತಪ್ಪುವುದು ಏಕೆ
ಒಂದು LLM-ಚಾಲಿತ ಏಜೆಂಟ್ ಹಲವು ಹಂತಗಳ ಪ್ರಕ್ರಿಯೆಯನ್ನು ಅನುಸರಿಸಿದಾಗ, ಅದರ ಆಂತರಿಕ “ಸ್ಥಿತಿ” (state) ಕ್ಷೀಣಿಸುತ್ತದೆ. ಸಂಶೋಧಕರು ಇದನ್ನು “behavioral state decay” ಎಂದು ಕರೆಯುತ್ತಾರೆ: ಮಾಡೆಲ್ ಹಿಂದಿನ ಸೂಚನೆಗಳು, ಪ್ರಮುಖ ಸತ್ಯಾಂಶಗಳು ಅಥವಾ ತಾನು ಈಗಾಗಲೇ ಮಾಡಿದ ತಪ್ಪುಗಳನ್ನು ಮರೆತುಬಿಡುತ್ತದೆ. ಇದರ ಪರಿಣಾಮವಾಗಿ, ಕಾರ್ಯವು ಪೂರ್ಣಗೊಳ್ಳುವ ಮೊದಲೇ ತಪ್ಪು ನಿರ್ಧಾರಗಳ ಸರಣಿ ಉಂಟಾಗಿ ಕೆಲಸವು ಅರ್ಧಕ್ಕೆ ನಿಂತುಹೋಗುತ್ತದೆ.
ಇದಕ್ಕೆ ಸಾಮಾನ್ಯ ಪರಿಹಾರವೆಂದರೆ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋವನ್ನು (context window) ದೊಡ್ಡದಾಗಿಸುವುದು—ಅಂದರೆ ಮಾಡೆಲ್ ಏಕಕಾಲದಲ್ಲಿ ಗಮನಿಸಬಹುದಾದ ಪಠ್ಯದ ಪ್ರಮಾಣವನ್ನು ಹೆಚ್ಚಿಸುವುದು. ಇದು ಕಾರ್ಯವು ವಿಂಡೋದ ಮಿತಿಯನ್ನು ಮೀರುವವರೆಗೆ ಮಾತ್ರ ಸಹಾಯ ಮಾಡುತ್ತದೆ; ಹಳೆಯ ಮಾಹಿತಿಯು ಕೈಬಿಡಲ್ಪಡುತ್ತದೆ ಮತ್ತು ಕ್ಷೀಣಿಸುವಿಕೆ ಮತ್ತೆ ಪ್ರಾರಂಭವಾಗುತ್ತದೆ.
ಅಗತ್ಯವಿದ್ದಾಗ ಮಾತ್ರ ಕಾರ್ಯನಿರ್ವಹಿಸುವ ನೆನಪೋಲೆ
ಈ ಹೊಸ ವಿಧಾನವು ಒಂದು ಲಘು ಸಹಾಯಕ ಮೆಮೊರಿ ಏಜೆಂಟ್ ಅನ್ನು ಸೇರಿಸುತ್ತದೆ, ಇದು ಮುಖ್ಯ ಮಾಡೆಲ್ನ ತರ್ಕದ ಹಾದಿಯನ್ನು (reasoning trace) ಗಮನಿಸುತ್ತದೆ ಮತ್ತು ಅಗತ್ಯವಿರುವ ನಿರ್ದಿಷ್ಟ ನೆನಪೋಲೆಗಳನ್ನು ನೀಡುತ್ತದೆ. ಹಿಂದಿನ ತುಣುಕುಗಳ ಸ್ಥಿರ ಪಟ್ಟಿಯನ್ನು ಬಳಸುವ ಬದಲು, ಮೆಮೊರಿ ಮಾಡ್ಯೂಲ್ ಯಾವಾಗ ಮತ್ತು ಏನನ್ನು ಪ್ರದರ್ಶಿಸಬೇಕೆಂದು ನಿರ್ಧರಿಸುತ್ತದೆ; ಮುಖ್ಯ ಮಾಡೆಲ್ ದಾರಿ ತಪ್ಪುತ್ತಿರುವಂತೆ ಕಂಡಾಗ ಮಾತ್ರ ಇದು ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ.
ಮೆಮೊರಿ ಲರ್ನರ್ ಪ್ರತ್ಯೇಕವಾಗಿ ತರಬೇತಿ ಪಡೆಯುವುದರಿಂದ, ಪ್ರಾಥಮಿಕ ಕ್ರಿಯಾ ಮಾಡೆಲ್ ಫ್ರೋಜನ್ ಆಗಿಯೇ ಇರುತ್ತದೆ. ಈ ಪ್ರತ್ಯೇಕತೆಯು ದೀರ್ಘಾವಧಿಯ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳಲ್ಲಿ ಗಮನಾರ್ಹ ಲಾಭಗಳನ್ನು ನೀಡುತ್ತದೆ ಎಂದು ಅಧ್ಯಯನವು ತೋರಿಸುತ್ತದೆ, ಇದು ಸಕ್ರಿಯ ನೆನಪೋಲೆಗಳು ಸೀಮಿತ ಕಾಂಟೆಕ್ಸ್ಟ್ ವಿಂಡೋವನ್ನು ಪರಿಹರಿಸಬಲ್ಲವು ಎಂಬುದನ್ನು ಸಾಬೀತುಪಡಿಸುತ್ತದೆ.
ಅಂಕಿಅಂಶಗಳು ಏನು ಹೇಳುತ್ತವೆ
- Terminal-Bench 2.0: Sonnet 4.5 ತನ್ನ ಮೂಲ ಮಟ್ಟಕ್ಕಿಂತ (baseline) 8.3 ಪಾಯಿಂಟ್ಗಳಷ್ಟು ಏರಿಕೆ ಕಂಡಿದೆ.
- τ2-Bench suite: ಇದೇ ಮಾಡೆಲ್ 6.8 ಪಾಯಿಂಟ್ಗಳಷ್ಟು ಸುಧಾರಿಸಿದೆ.
- Held-out ಪರೀಕ್ಷೆಗಳ ಮೇಲಿನ Pass@1: SETA-ತರಬೇತಿ ಪಡೆದ ಮೆಮೊರಿ ಏಜೆಂಟ್ ಫ್ರೋಜನ್ ಮಾಡೆಲ್ ಅನ್ನು 37.6% ರಿಂದ 41.1% ಕ್ಕೆ ಏರಿಸಿದೆ.
ಈ ಸುಧಾರಣೆಗಳು ಮುಖ್ಯ ಮಾಡೆಲ್ನ ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ಫೈನ್-ಟ್ಯೂನಿಂಗ್ ಇಲ್ಲದೆಯೇ ಸಂಭವಿಸುತ್ತವೆ, ಆದ್ದರಿಂದ ಮೆಮೊರಿ ಘಟಕವನ್ನು ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ನಿಯೋಜನೆಗಳಲ್ಲಿ (deployments) ಸೇರಿಸಬಹುದು ಅಥವಾ ತೆಗೆದುಹಾಕಬಹುದು.
ಪ್ರಸ್ತುತ ಕೆಲಸದ ಮಿತಿಗಳು
ಪ್ರಯೋಗಗಳು ಈ ಕೆಳಗಿನವುಗಳನ್ನು ಪರೀಕ್ಷಿಸದೆ ನಿಂತಿದೆ:
- Scale (ವ್ಯಾಪ್ತಿ): ಮಲ್ಟಿ-ಬಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್ಗಳು ಅಥವಾ ಲಕ್ಷಾಂತರ ಹಂತಗಳವರೆಗೆ ನಡೆಯುವ ಕಾರ್ಯಗಳೊಂದಿಗೆ ಮೆಮೊರಿ ಮಾಡ್ಯೂಲ್ ಇದೇ ರೀತಿಯಲ್ಲಿ ವರ್ತಿಸುತ್ತದೆ ಎಂಬುದಕ್ಕೆ ಇನ್ನೂ ಯಾವುದೇ ಪುರಾವೆಗಳಿಲ್ಲ.
- Production cost (ಉತ್ಪಾದನಾ ವೆಚ್ಚ): ನೆನಪೋಲೆಗಳನ್ನು ಸಂಗ್ರಹಿಸುವುದು ಮತ್ತು ಮರಳಿ ಪಡೆಯುವುದು ಹೆಚ್ಚಿನ ಹೊರೆಯಾಗಬಹುದು (overhead), ಆದರೆ ನೈಜ ಪ್ರಪಂಚದ ವ್ಯವಸ್ಥೆಯಲ್ಲಿ ಅಗತ್ಯವಿರುವ ಹೆಚ್ಚುವರಿ ಮೆಮೊರಿ ಅಥವಾ ಕಂಪ್ಯೂಟ್ ಅನ್ನು ಈ ಅಧ್ಯಯನವು ಪ್ರಮಾಣೀಕರಿಸಿಲ್ಲ.
ಮುಂದೆ ಏನನ್ನು ಗಮನಿಸಬೇಕು
ಭವಿಷ್ಯದ ಬೆಂಚ್ಮಾರ್ಕ್ ಸೂಟ್ಗಳು ಕೇವಲ ಕಾಂಟೆಕ್ಸ್ಟ್ ಗಾತ್ರಕ್ಕಿಂತ ಹೆಚ್ಚಿನದನ್ನು ಅಳೆಯಬೇಕಾಗುತ್ತದೆ. ಸ್ಥಿತಿ ಕ್ಷೀಣಿಸುವಿಕೆಯನ್ನು (state decay) ಸ್ಪಷ್ಟವಾಗಿ ಪತ್ತೆಹಚ್ಚುವ ಮತ್ತು ಸಕ್ರಿಯ ನೆನಪೋಲೆ ವ್ಯವಸ್ಥೆಗಳಿಗೆ ಪ್ರತಿಫಲ ನೀಡುವ ಪರೀಕ್ಷೆಗಳು ಏಜೆಂಟ್ನ ದೀರ್ಘಕಾಲದ ವಿಶ್ವಾಸಾರ್ಹತೆಯ ಬಗ್ಗೆ ಸ್ಪಷ್ಟ ಚಿತ್ರಣವನ್ನು ನೀಡುತ್ತವೆ. ಸಂಶೋಧಕರು ಸಕ್ರಿಯ ನೆನಪಿನ ಶಕ್ತಿಯು ಮಾಡೆಲ್ ಗಾತ್ರ ಮತ್ತು ಕಾರ್ಯಾಚರಣೆಯ ವೆಚ್ಚ ಎರಡರಲ್ಲೂ ಸಮರ್ಥವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತದೆ ಎಂಬುದನ್ನು ತೋರಿಸಬೇಕಾಗುತ್ತದೆ.
Takeaway: ಸಣ್ಣದಾದ, ಪ್ರತ್ಯೇಕವಾಗಿ ತರಬೇತಿ ಪಡೆದ ಮೆಮೊರಿ ಮಾಡ್ಯೂಲ್ ದೊಡ್ಡ ಭಾಷಾ ಮಾದರಿ ಏಜೆಂಟ್ಗಳಿಗೆ 'ವಾಚ್ಡಾಗ್' (watchdog) ಆಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಬಹುದು, ಇದು ಕಾರ್ಯವು ದಾರಿ ತಪ್ಪುವ ಮೊದಲೇ ವಿಚಲನೆಯನ್ನು ಪತ್ತೆಹಚ್ಚಿ ಸರಿಪಡಿಸುತ್ತದೆ.
