OpenAI ತನ್ನ GPT-5.6 Sol ಮಾಡೆಲ್ ARC-AGI-3 ಲಾಜಿಕ್ ಬೆಂಚ್ಮಾರ್ಕ್ನಲ್ಲಿ 38.3 ಪ್ರತಿಶತ ಅಂಕವನ್ನು ಪಡೆದಿದೆ ಎಂದು ಘೋಷಿಸಿತು, ಇದು Anthropic ನ Claude Opus 5 (30.2 ಪ್ರತಿಶತ) ಅನ್ನು ಹಿಂದಿಕ್ಕಿದೆ. ಆದರೆ, ಅದೇ ಮಾಡೆಲ್ ಬೆಂಚ್ಮಾರ್ಕ್ನ ಅಧಿಕೃತ ಟೆಸ್ಟ್ ಹಾರ್ನೆಸ್ (test harness) ಮೂಲಕ ನಡೆಸಿದಾಗ ಕೇವಲ 7.8 ಪ್ರತಿಶತ ಅಂಕವನ್ನು ಗಳಿಸಿದ್ದರಿಂದ, ಈ ಹೇಳಿಕೆಯು ತಕ್ಷಣವೇ ತಾಂತ್ರಿಕ ವಿವಾದಕ್ಕೆ ಕಾರಣವಾಯಿತು.
ARC-AGI-3 ಅಂಕವು ಏಕೆ ಮುಖ್ಯ
ARC-AGI-3 ಮಾಡೆಲ್ಗಳು ನೆನಪಿಟ್ಟುಕೊಂಡಿರುವ ಮಾದರಿಗಳ ಮೇಲೆ ಅವಲಂಬಿಸುವುದಕ್ಕಿಂತ ಹೆಚ್ಚಾಗಿ, ಹೊಸದಾದ ಮತ್ತು ತಾರ್ಕಿಕ ಚಿಂತನೆಯ ಅಗತ್ಯವಿರುವ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸುವ ಸಾಮರ್ಥ್ಯವನ್ನು ಪರೀಕ್ಷಿಸುತ್ತದೆ. ಸಂಶೋಧಕರು ಈ ಅಂಕಗಳನ್ನು "ಸಾಮಾನ್ಯ ಬುದ್ಧಿಶಕ್ತಿ" (general-intelligence) ಪ್ರಗತಿಯ ಸೂಚಕವಾಗಿ ಪರಿಗಣಿಸುತ್ತಾರೆ, ಆದ್ದರಿಂದ ಹತ್ತು ಅಂಕಗಳ ಮುನ್ನಡೆ ಎನ್ನುವುದು ಮಾನವನಂತೆಯೇ ಸಮಸ್ಯೆಗಳನ್ನು ಪರಿಹರಿಸುವತ್ತ ಒಂದು ಮಹತ್ವದ ಹೆಜ್ಜೆಯಂತೆ ಕಾಣುತ್ತದೆ. ಈ ಕಾರಣದಿಂದಲೇ ಈ ಸುದ್ದಿಯು AI ಸಮುದಾಯದಲ್ಲಿ ದೊಡ್ಡ ಮಟ್ಟದ ಚರ್ಚೆಯನ್ನು ಹುಟ್ಟುಹಾಕಿತು.
ಗುಪ್ತ ಅಂಶಗಳು: Retained Reasoning ಮತ್ತು Compaction
OpenAI ತನ್ನ GPT-5.6 Sol ಅನ್ನು ಸಾರ್ವಜನಿಕ ಟೆಸ್ಟ್ ಹಾರ್ನೆಸ್ ಬಳಸಿ ಮೌಲ್ಯಮಾಪನ ಮಾಡಲಿಲ್ಲ. ಬದಲಾಗಿ, ಅದು ತನ್ನದೇ ಆದ Responses API ಯನ್ನು ಎರಡು ಪ್ರತ್ಯೇಕ ಆಯ್ಕೆಗಳೊಂದಿಗೆ ಬಳಸಿತು:
- Retained Reasoning – ಇದು ಮಾಡೆಲ್ನ ತಾರ್ಕಿಕ ಸರಣಿಯನ್ನು (chain of thought) ಅನೇಕ ಹಂತಗಳವರೆಗೆ ಜೀವಂತವಾಗಿರಿಸುತ್ತದೆ, ಇದರಿಂದ ಪ್ರತಿಯೊಂದು ಹಂತವನ್ನು ಪ್ರತ್ಯೇಕವಾಗಿ ಪರಿಗಣಿಸಿದಾಗ ಉಂಟಾಗುವ ಮಧ್ಯಂತರ ತರ್ಕದ ನಷ್ಟವನ್ನು ತಡೆಯಬಹುದು.
- Compaction – ಇದು ಹಿಂದಿನ ಸಂದರ್ಭವನ್ನು (context) ಕಡಿತಗೊಳಿಸುವ ಬದಲು ಸಂಕುಚಿತಗೊಳಿಸುತ್ತದೆ (compress), ಇದರಿಂದ ಮಾಡೆಲ್ ದೀರ್ಘವಾದ ಮತ್ತು ಸಾರಾಂಶ ರೂಪದ ಇತಿಹಾಸವನ್ನು ಉಲ್ಲೇಖಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ.
ಈ ಸೆಟ್ಟಿಂಗ್ಗಳು ಸಕ್ರಿಯವಾಗಿದ್ದಾಗ, ಮಾಡೆಲ್ ದೀರ್ಘವಾದ ವಾದಗಳನ್ನು ಜೋಡಿಸುತ್ತದೆ ಮತ್ತು ಹಿಂದಿನ ತೀರ್ಮಾನಗಳನ್ನು ಮರುಬಳಕೆ ಮಾಡುತ್ತದೆ, ಇದು ಬಹು-ಹಂತದ ಕಾರ್ಯಗಳಲ್ಲಿ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಹೆಚ್ಚಿಸುತ್ತದೆ. ಆದರೆ ಪ್ರತಿ ಕ್ರಮದ ನಂತರ ತರ್ಕವನ್ನು ಕೈಬಿಡುವ ಅಧಿಕೃತ ಹಾರ್ನೆಸ್ನಲ್ಲಿ, ಅದೇ ಮಾಡೆಲ್ನ ಅಂಕವು 7.8 ಪ್ರತಿಶತಕ್ಕೆ ಕುಸಿಯುತ್ತದೆ, ಇದು Claude Opus 5 ಗಿಂತ ಬಹಳ ಕಡಿಮೆ ಮಟ್ಟದಲ್ಲಿದೆ.
ಬೆಂಚ್ಮಾರ್ಕ್ ಕೇವಲ ಕಚ್ಚಾ ನ್ಯೂರಲ್ ತೂಕಗಳನ್ನು (raw neural weights) ಮಾತ್ರವಲ್ಲದೆ, ಸಂಪೂರ್ಣ ಇನ್ಫರೆನ್ಸ್ ಪೈಪ್ಲೈನ್ ಅನ್ನು ಅಳೆಯಬೇಕು ಎಂದು OpenAI ವಾದಿಸುತ್ತದೆ. ಆ ದೃಷ್ಟಿಕೋನದಿಂದ ನೋಡುವುದಾದರೆ, ಸಂದರ್ಭವನ್ನು ಸಂರಕ್ಷಿಸುವ ಮತ್ತು ಸಂಕುಚಿತಗೊಳಿಸುವ API ಲಾಜಿಕ್ ಅಥವಾ "wrapper" ಎಂಬುದು ಮೌಲ್ಯಮಾಪನ ಮಾಡಲ್ಪಡುತ್ತಿರುವ ವ್ಯವಸ್ಥೆಯ ಒಂದು ಭಾಗವಾಗಿದೆ.
ನ್ಯಾಯಸಮ್ಮತತೆಯ ಚರ್ಚೆ
ಈ ಬೆಂಚ್ಮಾರ್ಕ್ ಅನ್ನು ಪ್ರಾಯೋಜಿಸುವ ARC Prize ನ ಸಹ-ಸಂಸ್ಥಾಪಕ François Chollet ಈ ಬಗ್ಗೆ ಅಭಿಪ್ರಾಯ ವ್ಯಕ್ತಪಡಿಸಿದ್ದಾರೆ. ಅವರು ಬೆಂಚ್ಮಾರ್ಕ್ ಅನ್ನು "ಪರಿಹರಿಸಲು" ನಿರ್ಮಿಸಲಾದ ಕಸ್ಟಮ್ ಹಾರ್ನೆಸ್ಗಳು ಮತ್ತು ಯಾವುದೇ ಬಳಕೆದಾರರು ಬಳಸಬಹುದಾದ ಸಾಮಾನ್ಯ ಉದ್ದೇಶದ API ಸೆಟ್ಟಿಂಗ್ಗಳ ನಡುವಿನ ವ್ಯತ್ಯಾಸವನ್ನು ಎತ್ತಿ ತೋರಿಸಿದ್ದಾರೆ. ಮೂಲ ARC Prize ಪರೀಕ್ಷಾ ಪರಿಸರವು ಹಳೆಯ OpenAI-ಶೈಲಿಯ completions API ಅನ್ನು ಬಳಸುತ್ತಿತ್ತು, ಇದು Anthropic ನ Claude API ನಲ್ಲಿ ಈಗ ಲಭ್ಯವಿರುವ ಸುಧಾರಿತ ವೈಶಿಷ್ಟ್ಯಗಳನ್ನು ಹೊಂದಿರಲಿಲ್ಲ ಎಂದು Chollet ಗಮನಿಸಿದರು. ಈ ವ್ಯತ್ಯಾಸವು ಹಿಂದಿನ ಸುತ್ತುಗಳಲ್ಲಿ OpenAI ಗೆ ಅನನುಕೂಲ ಮಾಡಿರಬಹುದು.
ಅವರು ಈ ಹೋಲಿಕೆಯನ್ನು ಅಸಿಂಧು ಎಂದು ಘೋಷಿಸಿಲ್ಲ. ನಿಖರವಾದ ಸೆಟ್ಟಿಂಗ್ಗಳು ಮತ್ತು ಅದಕ್ಕೆ ಸಂಬಂಧಿಸಿದ ವೆಚ್ಚಗಳನ್ನು ಬಹಿರಂಗಪಡಿಸಿದರೆ, ಮುಖಾಮುಖಿ ಹೋಲಿಕೆ (head-to-head claim) ಸ್ವೀಕಾರಾರ್ಹ ಎಂದು Chollet ಹೇಳಿದರು. ಪಾರದರ್ಶಕತೆಯಿಂದಾಗಿ, ಈ ಅಂತರವು ಮಾಡೆಲ್ ಆರ್ಕಿಟೆಕ್ಚರ್ನಿಂದ ಬಂದಿದೆಯೇ, ಇಂಜಿನಿಯರಿಂಗ್ ತಂತ್ರಗಳಿಂದ ಬಂದಿದೆಯೇ ಅಥವಾ ಎರಡರಿಂದಲೇ ಬಂದಿದೆಯೇ ಎಂದು ಸಮುದಾಯವು ನಿರ್ಣಯಿಸಲು ಸಾಧ್ಯವಾಗುತ್ತದೆ ಎಂದು ಅವರು ವಾದಿಸಿದರು.
ಯಾರು ಗೆಲ್ಲುತ್ತಾರೆ, ಯಾರು ಸೋಲುತ್ತಾರೆ
ಒಂದು ವೇಳೆ ಹೆಚ್ಚಿನ ಅಂಕವನ್ನು ಹಾಗೆಯೇ ಒಪ್ಪಿಕೊಂಡರೆ, OpenAI ಸಾರ್ವಜನಿಕ ಪ್ರಜ್ಞೆಯಲ್ಲಿ ಉತ್ತಮ ಸ್ಥಾನವನ್ನು ಪಡೆಯುತ್ತದೆ ಮತ್ತು ಎಂಟರ್ಪ್ರೈಸ್ ಲೈಸೆನ್ಸಿಂಗ್ ಮಾತುಕತೆಗಳಲ್ಲಿ ಬಲವಾದ ಮಾತುಗಾರಿಕೆಯನ್ನು ಹೊಂದುತ್ತದೆ. Claude ತಂಡವು, ಹೆಚ್ಚುವರಿ ಇಂಜಿನಿಯರಿಂಗ್ ಪದರಗಳನ್ನು ತೆಗೆದುಹಾಕಿದಾಗ ತಮ್ಮ ಆರ್ಕಿಟೆಕ್ಚರ್ ಹೆಚ್ಚು ದಕ್ಷವಾಗಿರುತ್ತದೆ ಎಂಬುದಕ್ಕೆ ಸಾಕ್ಷಿಯಾಗಿ, ಪ್ರಮಾಣೀಕೃತ ಹಾರ್ನೆಸ್ನಲ್ಲಿನ ಕಚ್ಚಾ ಮಾಡೆಲ್ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ತೋರಿಸಬಹುದು.
ಹೂಡಿಕೆಗಳನ್ನು ನಿರ್ಧರಿಸಲು ಬೆಂಚ್ಮಾರ್ಕ್ ಶ್ರೇಯಾಂಕಗಳನ್ನು ಅವಲಂಬಿಸುವ ಸಂಶೋಧಕರು ಮತ್ತು ಡೆವಲಪರ್ಗಳಿಗೆ ಈ ಘಟನೆಯು ಅಸ್ಥಿರತೆಯನ್ನು ಉಂಟುಮಾಡಬಹುದು. ಮಾಡೆಲ್ಗಳು ದೊಡ್ಡದಾಗುತ್ತಿದ್ದಂತೆ, ಅವುಗಳ ಇನ್ಫರೆನ್ಸ್ ಅನ್ನು ನಿರ್ವಹಿಸುವ ಸಾಫ್ಟ್ವೇರ್ ನಿರ್ಣಾಯಕವಾಗಬಹುದು ಎಂಬುದನ್ನು ಈ ಪ್ರಕರಣವು ತೋರಿಸುತ್ತದೆ. ಕಡಿಮೆ ವೆಚ್ಚದಲ್ಲಿ ಅತ್ಯಾಧುನಿಕ ಇನ್ಫರೆನ್ಸ್ ಸ್ಟ್ಯಾಕ್ಗಳನ್ನು ನೀಡುವ ಕಂಪನಿಗಳು, ಶ್ರೇಷ್ಠವಾದ ಮೂಲ ಮಾಡೆಲ್ ಇಲ್ಲದಿದ್ದರೂ ಪ್ರಮುಖ ಅಂಕಗಳನ್ನು ಪಡೆಯಬಹುದು.
ARC-AGI-3 ಮತ್ತು ಇತರ ಬೆಂಚ್ಮಾರ್ಕ್ಗಳ ಮುಂದಿನ ಹಾದಿ
ಈ ವಿವಾದವು ARC Prize ಸಂಘಟಕರು ಅನುಮತಿಸಬಹುದಾದ ಇನ್ಫರೆನ್ಸ್ ಕಾನ್ಫಿಗರೇಶನ್ಗಳ ಬಗ್ಗೆ ಕಟ್ಟುನಿಟ್ಟಾದ ನಿಯಮಗಳನ್ನು ರೂಪಿಸುವಂತೆ ಮಾಡಬಹುದು. ಸಂಭವನೀಯ ಪ್ರತಿಕ್ರಿಯೆಗಳು ಹೀಗಿರಬಹುದು:
- ಅಧಿಕೃತ ಹಾರ್ನೆಸ್ ಮೂಲಕ ಮಾತ್ರ ಸಿಗುವ ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಪ್ರತಿಬಿಂಬಿಸುವ "baseline" ಅಂಕವನ್ನು ಪ್ರಕಟಿಸುವುದು.
- ಹೆಚ್ಚಿನ ಅಂಕವನ್ನು ಹೆಚ್ಚುವರಿ ಕಂಪ್ಯೂಟ್ ಅಥವಾ ಇಂಜಿನಿಯರಿಂಗ್ ವೆಚ್ಚದೊಂದಿಗೆ ಹೋಲಿಸಲು, ಯಾವುದೇ ಹೆಚ್ಚುವರಿ ಸೆಟ್ಟಿಂಗ್ಗಳ ವೆಚ್ಚದ ವಿಶ್ಲೇಷಣೆಯನ್ನು ಸಲ್ಲಿಸುವಂತೆ ಭಾಗವಹಿಸುವವರಿಗೆ ಸೂಚಿಸುವುದು.
- ಸಂದರ್ಭ ನಿರ್ವಹಣಾ (context-management) ವೈಶಿಷ್ಟ್ಯಗಳ ಚಾಣಾಕ್ಷ ಬಳಕೆಯನ್ನು ಗೌರವಿಸುವ ಪ್ರತ್ಯೇಕ "system-level" ಟ್ರ್ಯಾಕ್ ಅನ್ನು ಸೇರಿಸುವುದು.
ಇಂತಹ ಕ್ರಮಗಳು ಕಚ್ಚಾ ಮಾಡೆಲ್ ಸಾಮರ್ಥ್ಯ ಮತ್ತು ಇಂಜಿನಿಯರಿಂಗ್ ಆಪ್ಟಿಮೈಸೇಶನ್ ನಡುವೆ ಸ್ಪಷ್ಟವಾದ ವಿಭಜನೆಯನ್ನು ಉಂಟುಮಾಡುತ್ತವೆ, ಇದರಿಂದ ಭವಿಷ್ಯದ ಹೋಲಿಕೆಗಳು ಸುಲಭವಾಗುತ್ತವೆ.
ವಿರೋಧಾತ್ಮಕ ವಾದ: ಬೆಂಚ್ಮಾರ್ಕ್ಗಳು ನೈಜ ಪ್ರಪಂಚದ ಬಳಕೆಯನ್ನು ಪ್ರತಿಬಿಂಬಿಸಬೇಕು
ಕೇವಲ "raw-model-only" ದೃಷ್ಟಿಕೋನವು ವಾಸ್ತವಿಕವಲ್ಲ ಎಂದು ಒಂದು ಕಡೆಯ ವಾದವಿದೆ. ಪ್ರೊಡಕ್ಷನ್ನಲ್ಲಿ, ಡೆವಲಪರ್ಗಳು ನಿಯಮಿತವಾಗಿ ಕ್ಯಾಷಿಂಗ್ (caching), ಸಂದರ್ಭದ ಸಾರಾಂಶ (context summarisation) ಮತ್ತು ಇತರ ತಂತ್ರಗಳನ್ನು ಭಾಷಾ ಮಾಡೆಲ್ಗಳ ಮೇಲೆ ಬಳಸುತ್ತಾರೆ. ಒಂದು ಬೆಂಚ್ಮಾರ್ಕ್ ಪ್ರಾಯೋಗಿಕ ಉಪಯುಕ್ತತೆಯನ್ನು ಅಳೆಯುವ ಗುರಿಯನ್ನು ಹೊಂದಿದ್ದರೆ, ಅದು ಅಂತಹ ಆಪ್ಟಿಮೈಸೇಶನ್ಗಳನ್ನು ಅನುಮತಿಸಬೇಕು ಅಥವಾ ಪ್ರೋತ್ಸಾಹಿಸಬೇಕು. ಆ ದೃಷ್ಟಿಕೋನದಿಂದ ನೋಡುವುದಾದರೆ, OpenAI ನ Retained Reasoning ಮತ್ತು Compaction ಎಂಬುದು ಯಾವುದೇ ಪ್ರತಿಸ್ಪರ್ಧಿಗಳು ಬಳಸಬಹುದಾದ ಕಾನೂನುಬದ್ಧ ಸಾಧನಗಳಾಗಿವೆ, ಆದರೆ ಅವುಗಳನ್ನು ಸಾರ್ವಜನಿಕವಾಗಿ ದಾಖಲಿಸಬೇಕಾಗುತ್ತದೆ.
ಸಾಮಾನ್ಯ ಮೂಲಾಧಾರವಿಲ್ಲದೆ, ಅಂಕಗಳು ಬದಲಾಗುತ್ತಾ ಹೋಗುವ ಗುರಿಯಾಗುತ್ತವೆ ಮತ್ತು ಇದು ಬೆಂಚ್ಮಾರ್ಕ್ನ ವಸ್ತುನಿಷ್ಠ ಮಾನದಂಡವಾಗಿರುವ ಪಾತ್ರವನ್ನು ಕುಗ್ಗಿಸುತ್ತದೆ ಎಂದು ವಿಮರ್ಶಕರು ಪ್ರತಿಪಾದಿಸುತ್ತಾರೆ. ಪರಿಸರ ವ್ಯವಸ್ಥೆಯ ಸಿಂಧುತ್ವ (ವಾಸ್ತವಿಕ ನಿಯೋಜನೆಗಳನ್ನು ಪ್ರತಿಬಿಂಬಿಸುವುದು) ಮತ್ತು ವಿಧಾನಾತ್ಮಕ ಶುದ್ಧತೆ (ಮಾದರಿಯನ್ನು ಪ್ರತ್ಯೇಕಿಸುವುದು) ನಡುವಿನ ಉದ್ವಿಗ್ನತೆಯು ಪ್ರಸ್ತುತ ವಿವಾದಕ್ಕೆ ಕಾರಣವಾಗುತ್ತಿದೆ.
ಮುಖ್ಯಾಂಶಗಳು
GPT-5.6 Sol ಕುರಿತಾದ ಪ್ರತಿಪಾದನೆಯು AI ಮೌಲ್ಯಮಾಪನದಲ್ಲಿ ಬೆಳೆಯುತ್ತಿರುವ ವಿಭಜನೆಯನ್ನು ಎತ್ತಿ ತೋರಿಸುತ್ತದೆ: ಮಾದರಿಯ ಮೂಲ ಪ್ರತಿಭೆ ಮತ್ತು ಅದನ್ನು ಹೊರತೆಗೆಯುವ ಎಂಜಿನಿಯರಿಂಗ್ ಪರಿಸರ ವ್ಯವಸ್ಥೆಯ ನಡುವಿನ ವ್ಯತ್ಯಾಸ. ಸಮುದಾಯವು ಇನ್ಫರೆನ್ಸ್ ಸೆಟ್ಟಿಂಗ್ಗಳು ಮತ್ತು ಅವುಗಳ ವೆಚ್ಚಗಳ ಸಂಪೂರ್ಣ ಬಹಿರಂಗೀಕರಣವನ್ನು ಬಯಸುವವರೆಗೆ, ಈ ಚರ್ಚೆಯು ಸಾಮಾನ್ಯ ಬುದ್ಧಿಮತ್ತೆಯತ್ತ ಆಗುತ್ತಿರುವ ಪ್ರಗತಿಯ ದೃಷ್ಟಿಕೋನವನ್ನು ಮಸುಕುಗೊಳಿಸುವ ಬದಲು ಮತ್ತಷ್ಟು ತೀವ್ರಗೊಳ್ಳುತ್ತದೆ.
