ಚೀನಾದ Orca ವರ್ಲ್ಡ್ ಮಾಡೆಲ್, ಆಕ್ಷನ್ ಲೇಬಲ್ಗಳಿಲ್ಲದೆಯೇ ವಿಶೇಷ ರೋಬೋಟಿಕ್ಸ್ ಮಾದರಿಗಳಿಗೆ ಸಮಾನವಾಗಿದೆ
ಚೀನಾದ ಸಂಶೋಧಕರಿಂದ ಬಂದಿರುವ ಒಂದು ಮಹತ್ವದ ಸಂಶೋಧನೆಯು, ಒಂದು ಏಕೀಕೃತ ವರ್ಲ್ಡ್ ಮಾಡೆಲ್ (unified world model) ನೇರ ಮೇಲ್ವಿಚಾರಣೆಯಿಲ್ಲದೆ ರೋಬೋಟಿಕ್ಸ್ನಲ್ಲಿ ಪರಿಣತಿಯನ್ನು ಪಡೆಯಬಲ್ಲದು ಎಂದು ಸಾಬೀತುಪಡಿಸುವ ಮೂಲಕ AI ಬುದ್ಧಿವಂತಿಕೆಯ ಮೂಲಭೂತ ವ್ಯಾಖ್ಯಾನವನ್ನೇ ಸವಾಲು ಮಾಡುತ್ತಿದೆ. Orca ಮಾಡೆಲ್ ಮೂಲಕ, ಕೇವಲ ವೀಡಿಯೊಗಳ ಮೂಲಕ ಜಗತ್ತು ಹೇಗೆ ಬದಲಾಗುತ್ತದೆ ಎಂಬುದನ್ನು ಗಮನಿಸುವ ಮೂಲಕವೇ, ಒಂದು AI ಸಂಕೀರ್ಣವಾದ ದೈಹಿಕ ಕ್ರಿಯೆಗಳನ್ನು ನಡೆಸಲು ಶಕ್ತವಾಗುವಂತಹ ಆಳವಾದ ಆಂತರಿಕ ತಿಳುವಳಿಕೆಯನ್ನು ಬೆಳೆಸಿಕೊಳ್ಳಬಲ್ಲದು ಎಂದು ಸಾಬೀತಾಗಿದೆ.
ದ್ವಿ-ಕಲಿಕಾ ಇಂಜಿನ್: ಅಪ್ರಜ್ಞಾ ಮತ್ತು ಪ್ರಜ್ಞಾತ್ಮಕ ವಿಧಾನಗಳು
Orca ತನ್ನ ಆಂತರಿಕ "ವರ್ಲ್ಡ್ ಸ್ಟೇಟ್" (world state) ಅನ್ನು ನಿರ್ಮಿಸಲು ಎರಡು ಪ್ರಮುಖ ತರಬೇತಿ ವಿಧಾನಗಳನ್ನು ಬಳಸುವ ಮೂಲಕ ಸಾಂಪ್ರದಾಯಿಕ ವಿಶೇಷ ಮಾದರಿಗಳಿಂದ ಭಿನ್ನವಾಗಿದೆ. ಮೊದಲ ವಿಧಾನವಾದ "ಅಪ್ರಜ್ಞಾ ಕಲಿಕೆ" (unconscious learning), 1,25,000 ಗಂಟೆಗಳ ಲೇಬಲ್ ಮಾಡದ ವೀಡಿಯೊಗಳನ್ನು ಪ್ರಕ್ರಿಯೆಗೊಳಿಸುವುದನ್ನು ಒಳಗೊಂಡಿದೆ. ಈ ಹಂತದಲ್ಲಿ, ಮಾಡೆಲ್ ಅಬ್ಸ್ಟ್ರಾಕ್ಟ್ ಸ್ಪೇಸ್ನಲ್ಲಿ ಮುಂದಿನ ಫ್ರೇಮ್ಗಳನ್ನು ಮುನ್ಸೂಚಿಸುತ್ತದೆ, ಇದು ಯಾವುದೇ ಕ್ಯಾಪ್ಶನ್ ಇಲ್ಲದೆಯೇ ಚಲನೆಯ ಮಾದರಿಗಳು, ವಸ್ತುಗಳ ಅಡಗುವಿಕೆ (object occlusions) ಮತ್ತು ದೃಶ್ಯದ ಡೈನಾಮಿಕ್ಸ್ ಅನ್ನು ಗ್ರಹಿಸಲು ಸಹಾಯ ಮಾಡುತ್ತದೆ.
ಎರಡನೇ ವಿಧಾನವಾದ "ಪ್ರಜ್ಞಾತ್ಮಕ ಕಲಿಕೆ" (conscious learning), ಮೌಖಿಕ ಸೂಚನೆಗಳು ಮತ್ತು ವಿವರಣೆಗಳನ್ನು ಪರಿಚಯಿಸುತ್ತದೆ. ವೀಡಿಯೊಗಳನ್ನು ವಿಭಾಗಿಸುವ ಮೂಲಕ ಮತ್ತು ಪರಿಣಾಮವಾಗಿ ಉಂಟಾಗುವ ಸ್ಥಿತಿ ಬದಲಾವಣೆಗಳಿಗೆ ಲೇಬಲ್ ಮಾಡುವ ಮೂಲಕ, Orca ಒಂದು ನಿರ್ದಿಷ್ಟ ಕ್ರಿಯೆ ಮತ್ತು ಅದರ ದೈಹಿಕ ಫಲಿತಾಂಶದ ನಡುವಿನ ಕಾರ್ಯ-ಕಾರಣ ಸಂಬಂಧವನ್ನು (causal relationship) ಕಲಿಯುತ್ತದೆ. ಈ ಸಂಯೋಜನೆಯು ಕಚ್ಚಾ ದೃಶ್ಯ ಗ್ರಹಿಕೆ (raw visual perception) ಮತ್ತು ಉನ್ನತ ಮಟ್ಟದ ಭಾಷಾ ತರ್ಕದ ನಡುವಿನ ಅಂತರವನ್ನು ಕಡಿಮೆ ಮಾಡಲು ಮಾಡೆಲ್ಗೆ ಸಹಾಯ ಮಾಡುತ್ತದೆ.
ಬದಲಾಯಿಸಬಹುದಾದ ಇಂಟೆಲಿಜೆನ್ಸ್ ಮಾಡ್ಯೂಲ್ಗಳೊಂದಿಗೆ ಸ್ಥಿರವಾದ ಕೋರ್
Orca ನ ಆರ್ಕಿಟೆಕ್ಚರ್ ಅತ್ಯಂತ ಬಹುಮುಖಿ ಕಾರ್ಯಕ್ಷಮತೆಗಾಗಿ ವಿನ್ಯಾಸಗೊಳಿಸಲಾಗಿದೆ. ಇದು ಮೊದಲೇ ತರಬೇತಿ ಪಡೆದ Qwen3.5 language-image ಮಾಡೆಲ್ ಅನ್ನು "frozen core" ಆಗಿ ಬಳಸುತ್ತದೆ. ಪ್ರತಿಯೊಂದು ಕಾರ್ಯಕ್ಕಾಗಿ ಇಡೀ ವ್ಯವಸ್ಥೆಯನ್ನು ಮರು-ತರಬೇತಿಗೊಳಿಸುವ ಬದಲು, ಸಂಶೋಧಕರು ಈ ಸ್ಥಿರ ಅಡಿಪಾಯಕ್ಕೆ ವಿಶೇಷವಾದ, ಹಗುರವಾದ "heads"ಗಳನ್ನು ಜೋಡಿಸುತ್ತಾರೆ:
- ಪಠ್ಯ ಔಟ್ಪುಟ್ (Text Output): ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ Qwen3.5 language head ಅನ್ನು ಬಳಸುತ್ತದೆ.
- ಚಿತ್ರ ತಯಾರಿಕೆ (Image Generation): ಆಂತರಿಕ ವರ್ಲ್ಡ್ ಸ್ಟೇಟ್ ಅನ್ನು ದೃಶ್ಯ ಮುನ್ಸೂಚನೆಗಳಾಗಿ ಪರಿವರ್ತಿಸಲು Stable Diffusion 3.5 ಗೆ ಸಂಪರ್ಕಿತವಾದ ಸಣ್ಣ ಅಡಾಪ್ಟರ್ಗಳನ್ನು ಬಳಸುತ್ತದೆ.
- ರೋಬೋಟ್ ನಿಯಂತ್ರಣ (Robot Control): ವರ್ಲ್ಡ್ ಸ್ಟೇಟ್ಗಳನ್ನು ದೈಹಿಕ ಚಲನೆಗಳಾಗಿ ಪರಿವರ್ತಿಸಲು ವಿಶೇಷವಾಗಿ ತರಬೇತಿ ಪಡೆದ ಕಸ್ಟಮ್-ನಿರ್ಮಿತ "Action Expert" ಮಾಡ್ಯೂಲ್ ಅನ್ನು ಬಳಸುತ್ತದೆ.
ಈ ಮಾಡ್ಯುಲಾರಿಟಿ (modularity) ಮಾಡೆಲ್ ಪ್ರಶ್ನೆಗೆ ಉತ್ತರಿಸುತ್ತಿರಲಿ, ವೀಡಿಯೊವನ್ನು ತಯಾರಿಸುತ್ತಿರಲಿ ಅಥವಾ ಯಾಂತ್ರಿಕ ಕೈಯನ್ನು ನಿಯಂತ್ರಿಸುತ್ತಿರಲಿ, ಜಗತ್ತಿನ ಬಗ್ಗೆ ಅದರ ಕೇಂದ್ರ ತಿಳುವಳಿಕೆಯು ಸ್ಥಿರವಾಗಿರುವುದನ್ನು ಖಚಿತಪಡಿಸುತ್ತದೆ.
ವಿಶೇಷ ಮಾದರಿಗಳು ಮತ್ತು ದೈತ್ಯ ಮಾದರಿಗಳನ್ನು ಮೀರಿಸುವ ಸಾಧನೆ
Orca-4B ನ ಕಾರ್ಯಕ್ಷಮತೆಯ ಅಂಕಿಅಂಶಗಳು ಗಮನಾರ್ಹವಾಗಿವೆ. ಪಠ್ಯ ಆಧಾರಿತ ವೀಡಿಯೊ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳಲ್ಲಿ, Orca-4B ಸರಾಸರಿ ಶೇಕಡಾ 51.8 ರಷ್ಟು ಸಾಧನೆ ಮಾಡಿದೆ, ಇದು Emu3 (34B) ನಂತಹ ದೊಡ್ಡ ಮಾದರಿಗಳು ಮತ್ತು DeepSeek-VL2-3B ನಂತಹ ವಿಶೇಷ VLMs hơn ಸಾಧನೆ ಮಾಡಿದೆ. PRICE-V0.1 ಬೆಂಚ್ಮಾರ್ಕ್ ಮೂಲಕ ಚಿತ್ರದ ಮುನ್ಸೂಚನೆ ಕಾರ್ಯಗಳಲ್ಲಿ, Orca-4B ಶೇಕಡಾ 59.8 ರಷ್ಟು ಅಂಕಗಳನ್ನು ಗಳಿಸಿದ್ದು, FLUX.2 small ನಂತಹ ಉನ್ನತ ಮಟ್ಟದ ಜನರೇಟರ್ಗಳನ್ನು ಹಿಂದಿಕ್ಕಿದೆ.
ಅತ್ಯಂತ ಆಕರ್ಷಕ ವಿಷಯವೆಂದರೆ, ಬೌಲ್ಗಳನ್ನು ಜೋಡಿಸುವುದು ಮತ್ತು ಸಕ್ಕರೆಯನ್ನು ಅ ability ಮಾಡುವುದು ಸೇರಿದಂತೆ ಐದು ಮ್ಯಾನಿಪ್ಯುಲೇಶನ್ (manipulation) ಕಾರ್ಯಗಳಲ್ಲಿ, ಕೇವಲ ರೋಬೋಟಿಕ್ ಆಕ್ಷನ್ ಡೇಟಾ ಮೇಲೆ ನಿರ್ಮಿಸಲಾದ $\pi$0.5 ವ್ಯವಸ್ಥೆಗೆ Orca ಸಮಾನವಾದ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಪ್ರದರ್ಶಿಸಿದೆ. ಮುಖ್ಯವಾಗಿ, Orca ತನ್ನ ಬೃಹತ್ ಪ್ರಿ-ಟ್ರೈನಿಂಗ್ ಹಂತದಲ್ಲಿ ಯಾವುದೇ ಆಕ್ಷನ್ ಲೇಬಲ್ ಅನ್ನು ನೋಡದೆಯೇ ಇದನ್ನು ಸಾಧಿಸಿದೆ. ವಿಶೇಷ ಮಾದರಿಗಳು ಪದೇ ಪದೇ ಒಂದೇ ಚಕ್ರದಲ್ಲಿ ಸಿಲುಕಿಕೊಳ್ಳುವ ಸಂದರ್ಭದಲ್ಲಿ, Orca ವಿಫಲವಾದ ಹಿಡಿತಗಳನ್ನು (grasps) ಮರುಪ್ರಯತ್ನಿಸುವ ಮೂಲಕ ಅತ್ಯುತ್ತಮ ದೋಷದ ಚೇತರಿಕೆ (error recovery) ಸಾಮರ್ಥ್ಯವನ್ನು ತೋರಿಸಿದೆ.
AI ನ ಭವಿಷ್ಯಕ್ಕೆ ಇದು ಏಕೆ ಮುಖ್ಯ
ಆಧುನಿಕ ರೋಬೋಟಿಕ್ಸ್ನಲ್ಲಿನ ಅತ್ಯಂತ ದೊಡ್ಡ ಅಡಚಣೆಗಳಲ್ಲಿ ಒಂದಾದ ಲೇಬಲ್ ಮಾಡಲಾದ ಆಕ್ಷನ್ ಡೇಟಾದ ಕೊರತೆಯನ್ನು Orca ಪರಿಹರಿಸುತ್ತದೆ. ಕೇವಲ ನಿರಕ್ಷಣ ವೀಕ್ಷಣೆಯ ಮೂಲಕ AI "ಜಗತ್ತಿನ ಭೌತಶಾಸ್ತ್ರವನ್ನು" (physics of the world) ಕಲಿಯಬಲ್ಲದು ಎಂದು ಸಾಬೀತುಪಡಿಸುವ ಮೂಲಕ, ಈ ಸಂಶೋಧನೆಯು ಲಕ್ಷಾಂತರ ಗಂಟೆಗಳ ಮ್ಯಾನುಯಲ್ ಟೆಲಿಪರೇಷನ್ ಡೇಟಾ ಇಲ್ಲದೆಯೇ ಹೊಸ ಪರಿಸರಗಳಲ್ಲಿ ಬಳಸಬಹುದಾದ ಸಾಮಾನ್ಯ ಉದ್ದೇಶದ ರೋಬೋಟ್ಗಳಿಗೆ ದಾರಿ ಮಾಡಿಕೊಡುತ್ತದೆ.
ಪ್ರಮುಖ ಅಂಶಗಳು
- ಅಧೀಕ್ಷಣೆ ಇಲ್ಲದ ಅಡಿಪಾಯ (Unsupervised Foundation): Orca ಲೇಬಲ್ ಮಾಡದ ವೀಡಿಯೊಗಳ "ಅಪ್ರಜ್ಞಾ ಕಲಿಕೆ"ಯ ಮೂಲಕ ಜಗತ್ತಿನ ಡೈನಾಮಿಕ್ಸ್ ಅನ್ನು ಕಲಿಯುತ್ತದೆ, ಇದು ದುಬಾರಿ ಮಾನವ-ಅಂಕಿತ ಡೇಟಾ ಸೆಟ್ಗಳ ಮೇಲಿನ ಅವಲಂಬನೆಯನ್ನು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ.
- ಮಾಡ್ಯುಲರ್ ಆರ್ಕಿಟೆಕ್ಚರ್ (Modular Architecture): ಬದಲಾಯಿಸಬಹುದಾದ ಅಡಾಪ್ಟರ್ಗಳೊಂದಿಗೆ ಸ್ಥಿರವಾದ Qwen3.5 ಕೋರ್ ಅನ್ನು ಬಳಸುವುದರಿಂದ, ಒಂದು ಮಾಡೆಲ್ ಪಠ್ಯ, ಚಿತ್ರ ಮತ್ತು ರೋಬೋಟಿಕ್ ನಿಯಂತ್ರಣದಲ್ಲಿ ಏಕಕಾಲದಲ್ಲಿ ಪರಿಣತಿಯನ್ನು ಪಡೆಯಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ.
- ರೋಬೋಟಿಕ್ ಸಮಾನತೆ (Robotic Parity): ಪ್ರಿ-ಟ್ರೈನಿಂಗ್ ಸಮಯದಲ್ಲಿ ಆಕ್ಷನ್ ಲೇಬಲ್ಗಳ ಬಗ್ಗೆ ಯಾವುದೇ ಪೂರ್ವ ಮಾಹಿತಿ ಇಲ್ಲದಿದ್ದರೂ, Orca-4B ಮ್ಯಾನಿಪ್ಯುಲೇಶನ್ ಕಾರ್ಯಗಳಲ್ಲಿ ವಿಶೇಷ ರೋಬೋಟಿಕ್ಸ್ ವ್ಯವಸ್ಥೆಗಳ ಕಾರ್ಯಕ್ಷಮತೆಗೆ ಸಮನಾಗಿದೆ.