Anthropic ನ Fable 5 ಮಾಡೆಲ್ ಕೇವಲ ಆಟದ ದೃಶ್ಯ ಫಲಿತಾಂಶವನ್ನು (visual output) ಬಳಸಿಕೊಂಡು, ಚೀನೀ ಭಾಷೆಯ Pokémon FireRed ಆವೃತ್ತಿಯನ್ನು ಆಡುತ್ತಾ, 1,785 lượtಗಳಲ್ಲಿ ಮೊದಲ ಜಿಮ್ ಬ್ಯಾಡ್ಜ್ ಅನ್ನು ಗೆದ್ದಿದೆ ಮತ್ತು ಇದಕ್ಕೆ $65.40 ವೆಚ್ಚವಾಗಿದೆ. ಈ ಪ್ರಕ್ರಿಯೆಯು ಯಾವುದೇ ಪಠ್ಯ ಪ್ರಾಂಪ್ಟ್‌ಗಳಿಲ್ಲದೆ (textual prompts) ಆಟದ ಒಂದು ಗುರುತಿಸಬಹುದಾದ ಭಾಗವನ್ನು ಮುಗಿಸಲು ಮಾಡೆಲ್‌ಗೆ ಸಾಧ್ಯವಿದೆ ಎಂದು ಸಾಬೀತುಪಡಿಸುತ್ತದೆ, ಆದರೆ ಮಾಡೆಲ್‌ನ 'ಥಿಂಕಿಂಗ್ ಚೈನ್' ಅನ್ನು (thinking chain) ಆಳವಾಗಿ ವಿಶ್ಲೇಷಿಸಿದಾಗ, ಅದು ಪ್ರತಿಯೊಂದು ಪಿಕ್ಸೆಲ್ ಅನ್ನು ನಿಜವಾಗಿ "ನೋಡಿ" ಮತ್ತು ವಿಶ್ಲೇಷಿಸುವ ಬದಲು, ನೆನಪಿಟ್ಟುಕೊಂಡಿರುವ ಆಟದ ಮಾಹಿತಿಯನ್ನು ಉಚ್ಚರಿಸುತ್ತಿತ್ತು ಎಂಬುದು ತಿಳಿಯುತ್ತದೆ.

Anthropic ನ ವಾದಕ್ಕೆ ಪರೀಕ್ಷೆ

Anthropic ಸಂಸ್ಥೆಯು Fable 5 ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದಾಗ, ಮಾಡೆಲ್ ಕೇವಲ ಪರದೆಯನ್ನು ನೋಡುವುದರ ಮೂಲಕ Pokémon FireRed ಅನ್ನು ನಿರ್ವಹಿಸುವ "ವಿಷನ್-ಓನ್ಲಿ" (vision-only) ಪ್ರದರ್ಶನವನ್ನು (demo) ಪ್ರಮುಖವಾಗಿ ಎತ್ತಿ ತೋರಿಸಿತು. ಈ ಹೆಡ್‌ಲೈನ್ ಕೇಳಲು, ಈ ವ್ಯವಸ್ಥೆಯು ಯಾವುದೇ ದೃಶ್ಯ ಪರಿಸರವನ್ನು ಮೊದಲಿನಿಂದಲೇ ಅರ್ಥೈಸಿಕೊಳ್ಳಬಲ್ಲದು ಎಂಬಂತೆ ಭಾಸವಾಗುತ್ತಿತ್ತು. ಒಬ್ಬ ಡೆವಲಪರ್, Anthropic ನ ಲಾಂಚ್ ಪೇಜ್‌ನಲ್ಲಿ ವಿವರಿಸಲಾದ ಸೆಟಪ್ ಅನ್ನು ಪುನರಾವರ್ತಿಸುವ ಮೂಲಕ ಮತ್ತು ಆಟದ ಚೀನೀ ಅನುವಾದದ ಮೇಲೆ ಮಾಡೆಲ್ ಅನ್ನು ಚಲಾಯಿಸುವ ಮೂಲಕ ಆ ವಾದವನ್ನು ಪರಿಶೀಲಿಸಲು ಮುಂದಾದರು.

ಪ್ರಯೋಗವನ್ನು ಹೇಗೆ ನಡೆಸಲಾಯಿತು

ಒಂದು ಕಸ್ಟಮ್ ಹಾರ್ನೆಸ್ (custom harness) ಮಾಡೆಲ್‌ಗೆ ನೇರ ವೀಡಿಯೊ ಫ್ರೇಮ್‌ಗಳನ್ನು ಒದಗಿಸಿತು ಮತ್ತು ಅದರ ಕ್ರಿಯೆಯ ಆಯ್ಕೆಗಳನ್ನು ಸೆರೆಹಿಡಿಯಿತು. ಈ ಹಾರ್ನೆಸ್ Anthropic ನ ವಿವರಣೆಗೆ ಅನುಗುಣವಾಗಿತ್ತು, ಪ್ರತಿ ಹೊಸ ಫ್ರೇಮ್ ಅನ್ನು ಮಾಡೆಲ್‌ಗೆ ಕಳುಹಿಸಿಕೊಡುತ್ತಿತ್ತು ಮತ್ತು ಆಯ್ಕೆ ಮಾಡಿದ ಕಂಟ್ರೋಲರ್ ಇನ್‌ಪುಟ್ ಅನ್ನು ಓದುತ್ತಿತ್ತು. ಮಾಡೆಲ್ ತನ್ನ ಮೊದಲ ಜಿಮ್ ಬ್ಯಾಡ್ಜ್ ಅನ್ನು ಪಡೆಯುವವರೆಗೆ ಪೂರ್ಣ ಗೇಮ್ ಲೂಪ್ ಅನ್ನು ಪರೀಕ್ಷೆಯು ನಡೆಸಿತು, ನಂತರ ಅವತಾರ್ Route 3 ತಲುಪುವವರೆಗೆ, ಅಂದರೆ 2,000 ನೇ lượtದವರೆಗೆ ಮುಂದುವರಿಯಿತು.

ಪರಿಮಾಣಾತ್ಮಕ ಫಲಿತಾಂಶವು ಸ್ಪಷ್ಟವಾಗಿತ್ತು:

  • 1,785 lượtಗಳ ನಂತರ ಮೊದಲ ಜಿಮ್ ಬ್ಯಾಡ್ಜ್ ಲಭಿಸಿತು
  • ಒಟ್ಟು ಕಂಪ್ಯೂಟ್ ವೆಚ್ಚ $65.40
  • 2,000 ನೇ lượtದ ವೇಳೆಗೆ ಅವತಾರ್ Route 3 ನಲ್ಲಿತ್ತು

ಲಾಗ್‌ಗಳು ಏನನ್ನು ಬಹಿರಂಗಪಡಿಸುತ್ತವೆ

ಆದರೆ, ಕಚ್ಚಾ ಲಾಗ್‌ಗಳು (raw logs) ಮಾಡೆಲ್ ಅಲ್ಲಿಗೆ ಹೇಗೆ ತಲುಪಿತು ಎಂಬುದರ ಬಗ್ಗೆ ವಿಭಿನ್ನ ಕಥೆಯನ್ನು ಹೇಳುತ್ತವೆ. ಮಾಡೆಲ್‌ನ ಆಂತರಿಕ "ಥಿಂಕಿಂಗ್ ಚೈನ್" ಪರದೆಯ ಮೇಲೆ ಇನ್ನೂ ಕಾಣಿಸಿಕೊಳ್ಳದ ಮಾಹಿತಿಯನ್ನು ಪದೇ ಪದೇ ಬರೆಯುತ್ತಿತ್ತು.

  • 78 ನೇ lượtದಲ್ಲಿ, ಪ್ರತಿಸ್ಪರ್ಧಿ (rival) ತನ್ನ ಆಯ್ಕೆಯನ್ನು ತೋರಿಸದಿದ್ದರೂ ಸಹ, ಅವರು Charmander ಅನ್ನು ಆರಿಸಿಕೊಳ್ಳುತ್ತಾರೆ ಎಂದು ಮಾಡೆಲ್ ಗಮನಿಸಿತು.
  • 141 lượtಗಳ ನಂತರ, ಆಟವು ಅಂತಿಮವಾಗಿ ಆಟಗಾರನಿಗೆ Oak’s Parcel ಅನ್ನು ನೀಡಿದಾಗ, ಮಾಡೆಲ್ ಈಗಾಗಲೇ ಆ ವಸ್ತುವಿನ ಹೆಸರನ್ನು ತನ್ನ ಟಿಪ್ಪಣಿಗಳಲ್ಲಿ ದಾಖಲಿಸಿತ್ತು.
  • Route 3 ಮೂಲಕ ಸಂಚರಿಸುವಾಗ, ದೃಶ್ಯ ಫೀಡ್‌ನಲ್ಲಿ ಎಂದಿಗೂ ಕಾಣಿಸಿಕೊಳ್ಳದ ಪ್ರಸಿದ್ಧ ಸಂಭಾಷಣೆಯ ಸಾಲನ್ನು ಉಲ್ಲೇಖಿಸುವ ಮೂಲಕ ಮಾಡೆಲ್ ನಿರ್ದಿಷ್ಟ ತರಬೇತುದಾರನನ್ನು (trainer) ಗುರುತಿಸಿತು.

ಈ ಎಂಟ್ರಿಗಳು ಪಿಕ್ಸೆಲ್-ಬೈ-ಪಿಕ್ಸೆಲ್ ವಿಶ್ಲೇಷಣೆಯ ಫಲಿತಾಂಶಗಳಲ್ಲ. ಇವು ಆಟದ ವಿವರವಾದ ಸ್ಕ್ರಿಪ್ಟ್ ಅನ್ನು ಅಳವಡಿಸಿಕೊಂಡಿರುವ ವ್ಯವಸ್ಥೆಯ ಲಕ್ಷಣಗಳಾಗಿವೆ—ಇಂಟರ್ನೆಟ್‌ನಲ್ಲಿ ಲಭ್ಯವಿರುವ ವಾಕ್‌ಥ್ರೂಗಳು (walkthroughs), ವಿಕಿಗಳು (wikis) ಮತ್ತು ಫ್ಯಾನ್ ವೀಡಿಯೊಗಳಲ್ಲಿ ಕಂಡುಬರುವ ಅಂತಹ ಮಾಹಿತಿಯೇ ಇದು. ಅಂದರೆ, ಮಾಡೆಲ್ ಈಗಾಗಲೇ ಮನಸ್ಸಿನಲ್ಲಿಟ್ಟುಕೊಂಡಿರುವ ನಕ್ಷೆಯನ್ನು (map) ಕೇವಲ ದೃಶ್ಯದ ಮೂಲಕ ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಲು ಬಳಸುತ್ತಿರುವಂತೆ ಕಾಣುತ್ತದೆ.

ದೃಶ್ಯ-ತರ್ಕದ ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳಿಗೆ (visual-reasoning benchmarks) ಇದು ಏಕೆ ಮುಖ್ಯ

ಈ ಪ್ರಯೋಗವು ಅನೇಕ ದೃಶ್ಯ-ತರ್ಕ ಪರೀಕ್ಷೆಗಳಲ್ಲಿರುವ ಸೂಕ್ಷ್ಮ ಆದರೆ ನಿರ್ಣಾಯಕ ದೋಷವನ್ನು ಎತ್ತಿ ತೋರಿಸುತ್ತದೆ:

  • ಸ್ವಚ್ಛವಾದ ಇನ್‌ಪುಟ್ (Clean input) ಸ್ವಚ್ಛವಾದ ಜ್ಞಾನದ ಸ್ಥಿತಿಯನ್ನು ಖಾತರಿಪಡಿಸುವುದಿಲ್ಲ. ಏಕೈಕ ಚಾನಲ್ ಕೇವಲ ಚಿತ್ರದ ಸ್ಟ್ರೀಮ್ ಆಗಿದ್ದರೂ ಸಹ, ಮಾಡೆಲ್ ನೆನಪಿಟ್ಟುಕೊಂಡಿರುವ ಅಪಾರ ಮಾಹಿತಿಯನ್ನು ಬಳಸಿಕೊಳ್ಳಬಹುದು.
  • ಸಿಸ್ಟಮ್ ಪ್ರಾಂಪ್ಟ್‌ಗಳು ತರಬೇತಿ ಡೇಟಾವನ್ನು (training data) ಅಳಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ. ಸಂಪೂರ್ಣ ವಾಕ್‌ಥ್ರೂ ಅನ್ನು ನೋಡಿದ ಮಾಡೆಲ್ ಅನ್ನು ಮರು-ತರಬೇತಿ ನೀಡದೆ ಅದನ್ನು "ಮರೆಯಲು" ಒತ್ತಾಯಿಸಲು ಸಾಧ್ಯವಿಲ್ಲ.
  • ಕಾರ್ಯಕ್ಷಮತೆಯು ನೆನಪಿನ ಶಕ್ತಿಯನ್ನು ಅಳೆಯಬಹುದು, ಗ್ರಹಣವನ್ನಲ್ಲ (perception). ಪರೀಕ್ಷೆಯ ಪ್ರಪಂಚವು ತಿಳಿದಿರುವ ಡೇಟಾಸೆಟ್‌ಗೆ ಹೊಂದಿಕೆಯಾದಾಗ, ಮಾಡೆಲ್ ಹೊಸ ದೃಶ್ಯ ಮಾಹಿತಿಯನ್ನು ಅರ್ಥೈಸುವ ಬದಲು, ಪ್ಯಾಟರ್ನ್-ಟು-ಪ್ಯಾಟರ್ನ್ (pattern to pattern) ಹೊಂದಿಸುವ ಮೂಲಕ ಯಶಸ್ವಿಯಾಗಬಹುದು.

ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳು "ವಿಷನ್-ಓನ್ಲಿ" ಅನ್ನು ದೃಶ್ಯ ತರ್ಕದ ಪರ್ಯಾಯವಾಗಿ (proxy) ಪರಿಗಣಿಸುವುದನ್ನು ಮುಂದುವರಿಸಿದರೆ, ಹೊಸ ಪರಿಸರಗಳನ್ನು ಅರ್ಥಮಾಡಿಕೊಳ್ಳುವ AI ಸಾಮರ್ಥ್ಯದ ಬಗ್ಗೆ ಅತಿಯಾದ ವಾದಗಳನ್ನು ಮಾಡುವ ಅಪಾಯವಿದೆ. ಮೂಲಭೂತ ಕೌಶಲ್ಯವು ಸೀಮಿತವಾಗಿದ್ದರೂ ಕಂಪನಿಗಳು ಪ್ರಭಾವಶಾಲಿ ಅಂಕಿಅಂಶಗಳನ್ನು ಪ್ರಚಾರ ಮಾಡಬಹುದು—ಇದು ಹೂಡಿಕೆದಾರರು, ಡೆವಲಪರ್‌ಗಳು ಮತ್ತು ನಿಜವಾಗಿಯೂ ಕಾಣದ ಪರಿಸರಗಳಲ್ಲಿ ಕಾರ್ಯನಿರ್ವಹಿಸಬೇಕಾದ ಸುರಕ್ಷತಾ-ನಿರ್ಣಾಯಕ ವ್ಯವಸ್ಥೆಗಳನ್ನು (safety-critical systems) ನಿರ್ಮಿಸುವ ಪ್ರತಿಯೊಬ್ಬರಿಗೂ ಮುಖ್ಯವಾದ ವಿಷಯವಾಗಿದೆ.

ವಿರೋಧಾತ್ಮಕ ಅಂಶ: ನೆನಪಿಟ್ಟುಕೊಳ್ಳುವುದು ನಿಜವಾಗಿಯೂ ಸಮಸ್ಯೆಯೇ?

ತಿಳಿದಿರುವ ನಕ್ಷೆಯನ್ನು ಖಚಿತಪಡಿಸಿಕೊಳ್ಳಲು ಇನ್ನೂ ಒಂದು ರೀತಿಯ ತರ್ಕದ ಅಗತ್ಯವಿದೆ ಎಂದು ಕೆಲವರು ವಾದಿಸುತ್ತಾರೆ: ಮಾಡೆಲ್ ತನ್ನ ಆಂತರಿಕ ಪ್ರತಿನಿಧಿಯನ್ನು (internal representation) ಪ್ರಸ್ತುತ ದೃಶ್ಯ ಸೂಚನೆಯೊಂದಿಗೆ ಹೊಂದಿಸಬೇಕಾಗುತ್ತದೆ. ಆ ದೃಷ್ಟಿಕೋನದಿಂದ ನೋಡಿದರೆ, ಈ ಪ್ರದರ್ಶನವು ಒಂದು ಉಪಯುಕ್ತ ಸಾಮರ್ಥ್ಯವನ್ನು ತೋರಿಸುತ್ತದೆ—ಅಂದರೆ ಅಸ್ತಿತ್ವದಲ್ಲಿರುವ ಜ್ಞಾನದ ತಳಹದಿಯನ್ನು (knowledge base) ದೃಶ್ಯದ ಮೂಲಕ ಸ್ಥಿರೀಕರಿಸುವುದು. ಈ ಆಕ್ಷೇಪಣೆಯು ಸಮಂಜಸವಾಗಿದೆ; ಈ ಕಾರ್ಯವು ಗ್ರಹಣದ ಪರಿಶೀಲನೆಯನ್ನು (perceptual check) ಒಳಗೊಂಡಿದೆ.

ಆದಾಗ್ಯೂ, ಬೆಂಚ್‌ಮಾರ್ಕ್‌ನ ಮುಖ್ಯ ಗುರಿಯು ಸಾಮಾನ್ಯ ದೃಶ್ಯ ತೀರ್ಮಾನವನ್ನು (general visual inference) ಅಳೆಯುವುದೇ ಹೊರತು, ಸಂಗ್ರಹಿಸಿದ ಸ್ಕ್ರಿಪ್ಟ್ ಅನ್ನು ಮರುಪಡೆಯುವುದಲ್ಲ. ಘಟನೆಗಳು ಕಾಣಿಸಿಕೊಳ್ಳುವ ಮೊದಲೇ ಮಾಡೆಲ್ ಅವುಗಳನ್ನು ಮುನ್ಸೂಚನೆ ನೀಡಬಲ್ಲವಾಗಿದೆಯೆಂದರೆ, ಆ ಪರೀಕ್ಷೆಯು ಗ್ರಹಣವನ್ನು (perception) ಪ್ರತ್ಯೇಕವಾಗಿ ಅಳೆಯಲು ಸಾಧ್ಯವಾಗುವುದಿಲ್ಲ. ಉಪಯುಕ್ತ ಸ್ಥಿರೀಕರಣ ಮತ್ತು ನೇರ ವಂಚನೆ (cheat) ನಡುವಿನ ವ್ಯತ್ಯಾಸವು ಅಸ್ಪಷ್ಟವಾಗುತ್ತದೆ ಮತ್ತು ಫಲಿತಾಂಶಗಳು ವಿಶ್ಲೇಷಣಾತ್ಮಕ ಮೌಲ್ಯವನ್ನು ಕಳೆದುಕೊಳ್ಳುತ್ತವೆ.

ಮುಂದಿನ ಹಂತಗಳು ಮತ್ತು ಸಮುದಾಯದ ಪ್ರತಿಕ್ರಿಯೆ

ನೆನಪಿನ ಶಕ್ತಿಯ ಮಿತಿಗಳನ್ನು ಪರೀಕ್ಷಿಸಲು, ಪರೀಕ್ಷಕರು ಈಗ ಬದಲಾದ ಭೂಗೋಳದೊಂದಿಗೆ ಮಾರ್ಪಡಿಸಿದ ನಕ್ಷೆಯ ಮೇಲೆ ಅದೇ ಮಾಡೆಲ್ ಅನ್ನು ರನ್ ಮಾಡುತ್ತಿದ್ದಾರೆ. ಎಲ್ಲಾ ಕೋಡ್, ಕಸ್ಟಮ್ ಹಾರ್ನೆಸ್ ಮತ್ತು ಸಂಪೂರ್ಣ ಲಾಗ್ ಫೈಲ್‌ಗಳನ್ನು ಸಾರ್ವಜನಿಕಗೊಳಿಸಲಾಗಿದೆ, ಇದು ಇತರ ಸಂಶೋಧಕರು ಈ ಪ್ರಯೋಗವನ್ನು ಪುನರಾವರ್ತಿಸಲು ಅಥವಾ ವಿವಿಧ ಆಟಗಳಿಗೆ ಅನ್ವಯಿಸಲು ಅವಕಾಶ ನೀಡುತ್ತದೆ. ನಿರಂತರ ಸಂವಾದಕ್ಕಾಗಿ ಕಲಿಕಾ ಸಮುದಾಯದ ಪ್ಲಾಟ್‌ಫಾರ್ಮ್‌ನಲ್ಲಿ ಒಂದು ಚರ್ಚಾ ಚಾನಲ್ ಅನ್ನು ಸಹ ತೆರೆಯಲಾಗಿದೆ.

ಮುಖ್ಯ ಅಂಶಗಳು

ಮಾಡೆಲ್ ಈಗಾಗಲೇ ಉತ್ತರವನ್ನು ತಿಳಿದಿರುವುದರಿಂದ ಯಶಸ್ವಿಯಾದ ಕೇವಲ ದೃಷ್ಟಿ-ಆಧಾರಿತ (vision-only) ಪ್ರಾತ್ಯಕ್ಷಿಕೆಯು ನಿಜವಾದ ದೃಶ್ಯ ತರ್ಕಕ್ಕೆ (visual reasoning) ಪುರಾವೆಯಲ್ಲ. ಬೆಂಚ್‌ಮಾರ್ಕ್‌ಗಳು ನೆನಪಿಟ್ಟುಕೊಂಡ ಜ್ಞಾನವನ್ನು ತಕ್ಷಣದ ಗ್ರಹಣದಿಂದ (on-the-fly perception) ಪ್ರತ್ಯೇಕಿಸಬೇಕು, ಇಲ್ಲದಿದ್ದರೆ ಅವು ಸಂಪೂರ್ಣವಾಗಿ ಅಪರಿಚಿತ ದೃಶ್ಯ ಜಗತ್ತುಗಳನ್ನು ಸಂಚರಿಸುವ AI ಸಾಮರ್ಥ್ಯವನ್ನು ಅತಿರಂಜಿತವಾಗಿ ತೋರಿಸುವ ಅಪಾಯವಿರುತ್ತದೆ.