ಸಂಶೋಧಕರು ReBA routing ಅನ್ನು ಪರಿಚಯಿಸಿದ್ದಾರೆ, ಇದು ಮಲ್ಟಿಮೋಡಲ್ mixture-of-experts (MoE) ಮಾದರಿಗಳಲ್ಲಿ ದೃಶ್ಯ (visual) ಮತ್ತು ಪಠ್ಯ (textual) ಟೋಕನ್ಗಳನ್ನು ಸಮತೋಲನದಲ್ಲಿಡಲು ಸಹಾಯ ಮಾಡುವ ಜಿಯೋಮೆಟ್ರಿ-ಮಾರ್ಗದರ್ಶಿತ ಟೋಕನ್-ರೂಟಿಂಗ್ ಯೋಜನೆಯಾಗಿದೆ. ಚಿತ್ರದ ರೆಸಲ್ಯೂಶನ್ (resolution) ಹೆಚ್ಚಾದಾಗ, ಸಾಂಪ್ರದಾಯಿಕ ರೂಟರ್ಗಳು ಸಾಮಾನ್ಯವಾಗಿ ವಿಫಲವಾಗುವ ಸಂದರ್ಭದಲ್ಲಿಯೂ ಈ ವಿಧಾನವು ತರಬೇತಿಯನ್ನು ಸ್ಥಿರವಾಗಿರಿಸುತ್ತದೆ ಎಂದು ಆರಂಭಿಕ ಪ್ರಯೋಗಗಳು ತೋರಿಸಿವೆ.
ವಿಷನ್-ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾದರಿಗಳಿಗೆ ಹೊಸ ರೂಟರ್ ಏಕೆ ಬೇಕು?
ವಿಷನ್-ಲ್ಯಾಂಗ್ವೇಜ್ ಮಾದರಿಗಳು ಎರಡು ವಿಭಿನ್ನ ಪ್ರವಾಹಗಳನ್ನು ಸ್ವೀಕರಿಸುತ್ತವೆ: ನೂರಾರು ಇಮೇಜ್ ಪ್ಯಾಚ್ಗಳು (image patches) ಮತ್ತು ಕೆಲವೇ ಕೆಲವು ಪದಗಳ ಟೋಕನ್ಗಳು. ಸ್ಟ್ಯಾಂಡರ್ಡ್ MoE ರೂಟರ್ಗಳು ಪ್ರತಿಯೊಂದು ಟೋಕನ್ ಅನ್ನು ಒಂದೇ ರೀತಿಯ ಡೇಟಾ ಎಂದು ಪರಿಗಣಿಸುತ್ತವೆ, ಇದರಿಂದಾಗಿ ಇಮೇಜ್ ಪ್ಯಾಚ್ಗಳು ಕೆಲವು ಎಕ್ಸ್ಪರ್ಟ್ಗಳ ಮೇಲೆ ಅತಿಯಾದ ಹೊರೆಯಾಗುತ್ತವೆ ಮತ್ತು ಪಠ್ಯ ಟೋಕನ್ಗಳು ಬಳಕೆಯಾಗದೆ ಉಳಿಯುತ್ತವೆ. ಪ್ರಸ್ತುತ ಇರುವ ಕೆಲಸಗಳು, ಪ್ರತಿ ಎಕ್ಸ್ಪರ್ಟ್ಗೆ ನಿಯೋಜಿಸಲಾದ ಟೋಕನ್ಗಳ ಒಟ್ಟು ಸಂಖ್ಯೆಯನ್ನು ಸಮಾನೀಕರಿಸುವ ಮೂಲಕ ಈ ಹೊರೆಯನ್ನು ಸರಿಪಡಿಸಲು ಪ್ರಯತ್ನಿಸುತ್ತವೆ. ಆದರೆ, ಚಿತ್ರಗಳ ಬೃಹತ್ ಹೊರೆಯು ಪಠ್ಯದ ಸಣ್ಣ ಹೊರೆಯನ್ನು ಮರೆಮಾಚಬಹುದು, ಇದರಿಂದಾಗಿ ಕಾರ್ಯಕ್ಷಮತೆ ಕುಸಿಯುವವರೆಗೆ ಅಸಮತೋಲನವು ಎದ್ದು ಕಾಣುವುದಿಲ್ಲ.
ReBA ರೂಟಿಂಗ್ ವಿಧಾನವನ್ನು ಹೇಗೆ ಬದಲಾಯಿಸುತ್ತದೆ
ReBA ರೂಟಿಂಗ್ ಪ್ರಕ್ರಿಯೆಗೆ ಒಂದು modality boundary ಅನ್ನು ಸೇರಿಸುತ್ತದೆ. ಪ್ಯಾಚ್ಗಳು ಮತ್ತು ಪದಗಳನ್ನು ಬೆರೆಸುವ ಏಕೈಕ ಪೂಲ್ ಬದಲಿಗೆ, ಇದು ಇಮೇಜ್ ಟೋಕನ್ಗಳ ಜಿಯೋಮೆಟ್ರಿಕ್ ವಿನ್ಯಾಸವನ್ನು ಗೌರವಿಸುವ ಪ್ರತ್ಯೇಕ ಮಾರ್ಗಗಳನ್ನು ನಿರ್ಮಿಸುತ್ತದೆ. ಪ್ರತಿಯೊಂದು ಇಮೇಜ್ ಇನ್ಸ್ಟೆನ್ಸ್ (image instance) ಒಂದೇ ರೀತಿಯ ಒಟ್ಟಾರೆ ತೂಕವನ್ನು ಪಡೆಯುತ್ತದೆ, ಇದು ಯಾವುದೇ ಒಬ್ಬ ಎಕ್ಸ್ಪರ್ಟ್ bottleneck ಆಗದಂತೆ ತಡೆಯುತ್ತದೆ. ಪ್ಯಾಚ್ಗಳ ಸ್ಪೇಷಿಯಲ್ ಜೋಡಣೆಯ ಮಾರ್ಗದರ್ಶನದಲ್ಲಿ, ಇನ್ಪುಟ್ ರೆಸಲ್ಯೂಶನ್ ಬದಲಾದಾಗಲೂ ಸಿಸ್ಟಮ್ ಸ್ಥಿರವಾಗಿರುತ್ತದೆ.
ಲೇಖಕರು ವರದಿ ಮಾಡಿದ ಪ್ರಮುಖ ಪ್ರಯೋಜನಗಳು:
- ದೃಶ್ಯ ಮತ್ತು ಭಾಷಾ ಟೋಕನ್ಗಳ ನಡುವೆ ಸ್ಪಷ್ಟವಾದ ವಿಭಜನೆಯನ್ನು ಮಾಡುತ್ತದೆ.
- ಬ್ಯಾಚ್ನಲ್ಲಿರುವ ಪ್ರತಿಯೊಂದು ಚಿತ್ರದಿಂದ ಸಮಾನವಾದ ಕೊಡುಗೆಯನ್ನು ಖಚಿತಪಡಿಸುತ್ತದೆ.
- ಒಂದು ಮಾಲಿಟಿ (modality) ಕಾರಣದಿಂದ ಎಕ್ಸ್ಪರ್ಟ್ಗಳ ಮೇಲೆ ಅತಿಯಾದ ಹೊರೆಯಾಗುವುದನ್ನು ತಡೆಯುತ್ತದೆ.
- ಇಮೇಜ್ ಪ್ಯಾಚ್ಗಳ ಸಂಖ್ಯೆ ಹೆಚ್ಚಾದಾಗಲೂ ಸಮತೋಲನವನ್ನು ಕಾಯ್ದುಕೊಳ್ಳುತ್ತದೆ.
ಹಲವಾರು ಬೆಂಚ್ಮಾರ್ಕ್ ಸೆಟ್ಟಿಂಗ್ಗಳಲ್ಲಿ, ಬ್ಯಾಚ್ಗೆ ಎಷ್ಟು ಪ್ಯಾಚ್ಗಳನ್ನು ಸೇರಿಸಿದರೂ ReBA ಎಕ್ಸ್ಪರ್ಟ್ ಪೂಲ್ ಅನ್ನು ಸಮಾನವಾಗಿ ಬಳಸುವಂತೆ ಮಾಡಿತು ಮತ್ತು ಸಾಂಪ್ರದಾಯಿಕ auxiliary-loss ವಿಧಾನಕ್ಕಿಂತ ಉತ್ತಮವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸಿತು.
ಮಿತಿಗಳು ಮತ್ತು ಮುಕ್ತ ಪ್ರಶ್ನೆಗಳು
ಈ ಅಧ್ಯಯನವು ವೇಗ ಅಥವಾ ಮೆಮೊರಿ ಬಳಕೆಯ ಬಗ್ಗೆ ಅಂಕಿಅಂಶಗಳನ್ನು ನೀಡಿಲ್ಲ, ಆದ್ದರಿಂದ ಹೆಚ್ಚುವರಿ ರೂಟಿಂಗ್ ಲಾಜಿಕ್ ಗುಪ್ತ ವೆಚ್ಚಗಳನ್ನು (hidden costs) ಹೆಚ್ಚಿಸುತ್ತದೆಯೇ ಎಂಬುದು ನಮಗೆ ತಿಳಿದಿಲ್ಲ. ಲೇಖಕರು ಒಂದು ಚಿತ್ರದ ಎಲ್ಲಾ ಪ್ಯಾಚ್ಗಳು ಒಂದೇ ಘಟಕವಾಗಿ ಕಾರ್ಯನಿರ್ವಹಿಸುತ್ತವೆ ಎಂದು ಭಾವಿಸಿದ್ದಾರೆ; ವಿಭಿನ್ನ ರೆಸಲ್ಯೂಶನ್ಗಳ ಚಿತ್ರಗಳನ್ನು ಬೆರೆಸುವ ಅಥವಾ ಭಾಗಶಃ ಮಾಸ್ಕ್ ಮಾಡಿದ ಪ್ರದೇಶಗಳನ್ನು ಹೊಂದಿರುವ ಬ್ಯಾಚ್ಗಳಲ್ಲಿ ಈ ಊಹೆ ತಪ್ಪಾಗಬಹುದು.
ಮುಂದೆ ಗಮನಿಸಬೇಕಾದ ಅಂಶಗಳು
- Performance-vs-efficiency trade-offs: ಭವಿಷ್ಯದ ಕೆಲಸಗಳು ReBA ಸೇರಿಸುವ ಯಾವುದೇ ಓವರ್ಹೆಡ್ ಅನ್ನು (overhead) ಅಳೆಯಬೇಕಾಗುತ್ತದೆ.
- Mixed-batch behavior: ಹೈ-ರೆಸಲ್ಯೂಶನ್ ಮತ್ತು ಲೋ-ರೆಸಲ್ಯೂಶನ್ ಚಿತ್ರಗಳನ್ನು ಒಳಗೊಂಡ ಬ್ಯಾಚ್ಗಳ ಮೇಲೆ ಪರೀಕ್ಷಿಸುವುದರಿಂದ modality boundary ಸ್ಥಿರವಾಗಿದೆಯೇ ಎಂಬುದು ತಿಳಿಯುತ್ತದೆ.
- Adoption in large-scale pipelines: ರೂಟಿಂಗ್ ಸ್ಥಿರತೆಯು ಇಮೇಜ್ ಕ್ಯಾಪ್ಷನಿಂಗ್ ಅಥವಾ ವಿಶುವಲ್ ಕ್ವೆಶ್ಚನ್ ಆನ್ಸರಿಂಗ್ನಂತಹ ಡೌನ್ಸ್ಟ್ರೀಮ್ ಕಾರ್ಯಗಳಿಗೆ ಉತ್ತಮ ಫಲಿತಾಂಶ ನೀಡಿದರೆ, ಡೆವಲಪರ್ಗಳು ಸ್ಟ್ಯಾಂಡರ್ಡ್ auxiliary loss ಬದಲಿಗೆ ReBA ಅನ್ನು ಬಳಸಬಹುದು.
ನೀವು ವಿಷನ್-ಲ್ಯಾಂಗ್ವೇಜ್ MoE ಪೈಪ್ಲೈನ್ ಅನ್ನು ನಿರ್ಮಿಸುತ್ತಿದ್ದರೆ, ಇಮೇಜ್ ರೆಸಲ್ಯೂಶನ್ ಅನ್ನು ಹೆಚ್ಚಿಸುವಾಗ ಡಿಫಾಲ್ಟ್ ರೂಟರ್ ಬದಲಿಗೆ ReBA ಅನ್ನು ಬಳಸುವುದರಿಂದ ಎಕ್ಸ್ಪರ್ಟ್ ಬಳಕೆಯ ಮಾದರಿ ಹೆಚ್ಚು ಸಮಾನವಾಗಿರುತ್ತದೆ. ಬದಲಾವಣೆಯ ನಂತರ ಟೋಕನ್-ಡಿಸ್ಟ್ರಿಬ್ಯೂಷನ್ ಮೆಟ್ರಿಕ್ಸ್ಗಳ ಮೇಲೆ ಗಮನವಿಡಿ; ಹೆಚ್ಚು ಸಮತಟ್ಟಾದ (flatter) ವಿತರಣೆಯು modality boundary ಸರಿಯಾಗಿ ಕೆಲಸ ಮಾಡುತ್ತಿದೆ ಎಂಬುದನ್ನು ಸೂಚಿಸುತ್ತದೆ.
