SkewAdam ಎಂಬುದು Mixture-of-Experts ತರಬೇತಿಯ ಮೆಮೊರಿಯನ್ನು 60% ಕ್ಕಿಂತ ಹೆಚ್ಚು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ನಿಖರತೆಯಲ್ಲಿ ಗಮನಾರ್ಹ ಏರಿಕೆಯನ್ನು ನೀಡುತ್ತದೆ, ಇದು 6.78 ಬಿಲಿಯನ್-ಪ್ಯಾರಾಮೀಟರ್ MoE ಮಾಡೆಲ್ ಅನ್ನು ಒಂದೇ 40 GB GPU ನಲ್ಲಿ ಅಳವಡಿಸಲು ಡೆವಲಪರ್ಗಳಿಗೆ ಅನುವು ಮಾಡಿಕೊಡುತ್ತದೆ.
MoE ತರಬೇತಿಯು ಮೆಮೊರಿ ಮಿತಿಯನ್ನು (memory wall) ಏಕೆ ಎದುರಿಸುತ್ತದೆ
Mixture-of-Experts ಆರ್ಕಿಟೆಕ್ಚರ್ಗಳು ಒಂದು 'ಡೆನ್ಸ್ ಬ್ಯಾಕ್ಬೋನ್' (dense backbone) ಅನ್ನು ಉಳಿಸಿಕೊಳ್ಳುತ್ತಾ, ಪ್ರತಿಯೊಂದು ಇನ್ಪುಟ್ ಅನ್ನು "ಎಕ್ಸ್ಪರ್ಟ್" (expert) ಸಬ್-ನೆಟ್ವರ್ಕ್ಗಳ ಸಣ್ಣ ಉಪಸಮೂಹದ ಮೂಲಕ ಕಳುಹಿಸುತ್ತವೆ. ಇದರ ಪ್ರಯೋಜನವೆಂದರೆ, ಕಂಪ್ಯೂಟ್ ಸಾಮರ್ಥ್ಯದಲ್ಲಿ ಸಮಾನुಪಾತಿಕ ಬೆಳವಣಿಗೆಯಿಲ್ಲದೆ ಬಿಲಿಯನ್ಗಟ್ಟಲೆ ಪ್ಯಾರಾಮೀಟರ್ಗಳಿಗೆ ವಿಸ್ತರಿಸಬಹುದಾದ ಮಾಡೆಲ್ ಸಿಗುತ್ತದೆ. ಪ್ರಾಯೋಗಿಕವಾಗಿ, ಆಪ್ಟಿಮೈಸರ್—ವಿಶೇಷವಾಗಿ ಹೆಚ್ಚಿನ ತಂಡಗಳು ಬಳಸುವ AdamW ವಿಧವು—GPU RAM ನ ಬಹುಪಾಲು ಭಾಗವನ್ನು ಬಳಸಿಕೊಳ್ಳುತ್ತದೆ. 6.78 B-ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್ಗಾಗಿ, ಆಪ್ಟಿಮೈಸರ್ನ ಮೊಮೆಂಟಮ್ (momentum) ಮತ್ತು ವೇರಿಯನ್ಸ್ (variance) ಟೆನ್ಸರ್ಗಳು ಮಾತ್ರ ಸುಮಾರು 50 GB ಅನ್ನು ಬಯಸುತ್ತವೆ. ಇದಕ್ಕೆ ಆಕ್ಟಿವೇಶನ್ಗಳು ಮತ್ತು ಮಾಡೆಲ್ ತೂಕಗಳನ್ನು (weights) ಸೇರಿಸಿದರೆ, ಪೀಕ್ ಮೆಮೊರಿ 81.4 GB ತಲುಪುತ್ತದೆ, ಇದು ಮಲ್ಟಿ-GPU ಸೆಟಪ್ಗಳು ಅಥವಾ ನಿಧಾನಗತಿಯ ತರಬೇತಿ ವೇಳಾಪಟ್ಟಿಗಳಿಗೆ ಒತ್ತಾಯಿಸುತ್ತದೆ.
SkewAdam ಏನನ್ನು ವಿಭಿನ್ನವಾಗಿ ಮಾಡುತ್ತದೆ
SkewAdam ಹೊಸ ಕಲಿಕೆಯ ನಿಯಮವನ್ನು (learning rule) ಕಂಡುಹಿಡಿಯುವುದಿಲ್ಲ. ಇದು Adam ನ ಮೊಮೆಂಟ್ಸ್ (moments) ಎಲ್ಲಿ ಇರಬೇಕು ಎಂಬುದನ್ನು ಮರುಹೊಂದಿಸುತ್ತದೆ:
- ಡೆನ್ಸ್ ಬ್ಯಾಕ್ಬೋನ್ ಪೂರ್ಣ-ನಿಖರತೆಯ ಮೊಮೆಂಟಮ್ ಅನ್ನು ಕಾಯ್ದುಕೊಳ್ಳುತ್ತದೆ, ಇದು ಡೆನ್ಸ್ ಲೇಯರ್ಗಳಿಗೆ ಅಗತ್ಯವಿರುವ ಸುಗಮ ಅಪ್ಡೇಟ್ಗಳನ್ನು ಉಳಿಸಿಕೊಳ್ಳುತ್ತದೆ.
- ಎಕ್ಸ್ಪರ್ಟ್ ಬ್ಯಾಂಕ್ ವೇರಿಯನ್ಸ್ನ ಫ್ಯಾಕ್ಟರ್ಡ್ ಅಪ್ರೊಕ್ಸಿಮೇಶನ್ ಅನ್ನು ಸಂಗ್ರಹಿಸುತ್ತದೆ, ಇದು ಪ್ರತಿ ಎಕ್ಸ್ಪರ್ಟ್ಗಾಗಿ ಇರಿಸಲಾದ ಡೇಟಾವನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
- ಯಾವ ಎಕ್ಸ್ಪರ್ಟ್ಗಳನ್ನು ಸಕ್ರಿಯಗೊಳಿಸಬೇಕು ಎಂದು ನಿರ್ಧರಿಸುವ ರೂಟರ್ (router), ನಿಖರವಾದ ಸೆಕೆಂಡ್-ಮೊಮೆಂಟ್ ಅಂದಾಜನ್ನು ಕಾಯ್ದುಕೊಳ್ಳುತ್ತದೆ.
ಈ ಮೂರು ಘಟಕಗಳನ್ನು ಪ್ರತ್ಯೇಕ "ಟಿಯರ್ಗಳಾಗಿ" (tiers) ಪರಿಗಣಿಸುವ ಮೂಲಕ, ಆಪ್ಟಿಮೈಸರ್ ಕಡಿಮೆ ಮುಖ್ಯವಾದ ಕಡೆ ಅನಗತ್ಯ ನಿಖರತೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ ಮತ್ತು ಹೆಚ್ಚು ಮುಖ್ಯವಾದ ಕಡೆ ಅದನ್ನು ಉಳಿಸಿಕೊಳ್ಳುತ್ತದೆ.
ಅಳೆಯಬಹುದಾದ ಪ್ರಭಾವ
ಅದೇ 6.78 B-ಪ್ಯಾರಾಮೀಟರ್ MoE ಮಾಡೆಲ್ ಅನ್ನು SkewAdam ನೊಂದಿಗೆ ಚಲಾಯಿಸುವುದರಿಂದ ಈ ಕೆಳಗಿನ ಫಲಿತಾಂಶಗಳು ಸಿಗುತ್ತವೆ:
- ಪೀಕ್ GPU ಮೆಮೊರಿ: 31.3 GB (81.4 GB ನಿಂದ ಇಳಿಕೆಯಾಗಿದೆ)
- ಆಪ್ಟಿಮೈಸರ್-ಸ್ಟೇಟ್ ಫುಟ್ಪ್ರಿಂಟ್: 1.29 GB (50 GB ನಿಂದ ಇಳಿಕೆಯಾಗಿದೆ)
ಕಡಿಮೆ ಮಾಡಲಾದ ಸ್ಟೇಟ್ ಒಂದೇ 40 GB ಆಕ್ಸಿಲರೇಟರ್ನೊಳಗೆ ಸುಲಭವಾಗಿ ಹೊಂದುತ್ತದೆ.
ಕೇವಲ ಉಳಿತಾಯವಲ್ಲ, ನಿಖರತೆಯಲ್ಲೂ ಲಾಭ
ಮೆಮೊರಿ ಕಡಿತವು ಹೆಚ್ಚಾಗಿ ಮಾಡೆಲ್ ಗುಣಮಟ್ಟವನ್ನು ಹಾನಿಗೊಳಿಸುತ್ತದೆ, ಆದರೆ SkewAdam ಪರ್ಪ್ಲೆಕ್ಸಿಟಿ (perplexity)—ಇದು ಒಂದು ಪ್ರಮಾಣಿತ ಭಾಷಾ-ಮಾಡೆಲ್ ಮೆಟ್ರಿಕ್—ಅನ್ನು 126.8 (AdamW) ನಿಂದ 108.4 ಕ್ಕೆ ಸುಧಾರಿಸುತ್ತದೆ. ಇದು ಅದೇ ಕಾರ್ಯದಲ್ಲಿ Muon (120.2) ಮತ್ತು Lion (393.7) ಅನ್ನು ಮೀರಿಸುತ್ತದೆ. ಮೂರೂ ಟಿಯರ್ಗಳಲ್ಲಿ ಮೊಮೆಂಟಮ್ ಅನ್ನು ಉಳಿಸಿಕೊಳ್ಳುವುದರಿಂದ ಈ ಏರಿಕೆ ಕಂಡುಬರುತ್ತದೆ ಎಂದು ಲೇಖಕರು ಹೇಳುತ್ತಾರೆ; Adafactor ನಂತಹ ಮೊಮೆಂಟಮ್ ಅನ್ನು ಸಂಪೂರ್ಣವಾಗಿ ಬಿಟ್ಟುಬಿಡುವ ವಿಧಾನಗಳು ಹಿಂದೆ ಉಳಿಯುತ್ತವೆ.
ಮುಕ್ತ ಪ್ರಶ್ನೆಗಳು
SkewAdam ನ ಫಲಿತಾಂಶಗಳನ್ನು 6.78 B-ಪ್ಯಾರಾಮೀಟರ್ ಮಾಡೆಲ್ ಮೇಲೆ ಪ್ರದರ್ಶಿಸಲಾಗಿದೆ. ಇದೇ ರೀತಿಯ ಮೆಮೊರಿ-ಸ್ಟೇಟ್ ಅನುಪಾತಗಳು ಇನ್ನೂ ದೊಡ್ಡದಾದ ಮಾಡೆಲ್ಗಳಿಗೆ ಅಥವಾ ಭಾಷಾ ಮಾಡೆಲಿಂಗ್ ಹೊರತಾದ ಕಾರ್ಯಗಳಿಗೆ ಅನ್ವಯಿಸುತ್ತವೆಯೇ ಎಂಬುದು ಇನ್ನೂ ಅಸ್ಪಷ್ಟವಾಗಿದೆ.
ಗಮನಿಸಬೇಕಾದ ಅಂಶಗಳು
- ದೊಡ್ಡ MoE ಕಾನ್ಫಿಗರೇಶನ್ಗಳ ಮೇಲಿನ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು (ಹತ್ತಾರು ಬಿಲಿಯನ್ ಪ್ಯಾರಾಮೀಟರ್ಗಳು).
- ಓಪನ್-ಸೋರ್ಸ್ ಫ್ರೇಮ್ವರ್ಕ್ಗಳ ಅಳವಡಿಕೆ ಮತ್ತು ಜನಪ್ರಿಯ ತರಬೇತಿ ಸ್ಕ್ರಿಪ್ಟ್ಗಳಲ್ಲಿ ಸೇರ್ಪಡೆ.
- ಕನ್ವರ್ಜೆನ್ಸ್ ವೇಗ (convergence speed) ಅಥವಾ ವಿಭಿನ್ನ ಲರ್ನಿಂಗ್-ರೇಟ್ ವೇಳಾಪಟ್ಟಿಗಳ ಅಡಿಯಲ್ಲಿ ಸ್ಥಿರತೆಯಂತಹ ಗುಪ್ತ ವಹಿವಾಟುಗಳ (trade-offs) ಬಗ್ಗೆ ಸಮುದಾಯದ ಪ್ರತಿಕ್ರಿಯೆ.
ಮೂಲ: ಆಪ್ಟಿಮೈಸರ್ನ ವಿನ್ಯಾಸ ಮತ್ತು ಪ್ರಾಯೋಗಿಕ ಫಲಿತಾಂಶಗಳನ್ನು ವಿವರಿಸುವ ಡೆವಲಪರ್ ಪೋಸ್ಟ್.
