DeepSeek ತನ್ನ V4 Pro GA (general-availability) ಮಾಡೆಲ್ ಅನ್ನು ಬಿಡುಗಡೆ ಮಾಡಿದೆ. ಆರಂಭಿಕ ಅಳತೆಗಳು ತೋರಿಸುವಂತೆ, ಇದು ಪ್ರಿವ್ಯೂ ಬಿಲ್ಡ್ಗೆ ಹೋಲಿಸಿದರೆ reasoning-token ಬಳಕೆಯನ್ನು 18% ರಿಂದ 62% ರಷ್ಟು ಕಡಿಮೆ ಮಾಡುತ್ತದೆ. ಪ್ರತಿ ಟೋಕನ್ಗೆ ಹಣ ಪಾವತಿಸುವವರಿಗೆ ಇದು ಬಹಳ ಮುಖ್ಯ: ಅಂದರೆ, ಅಷ್ಟೇ ಗುಣಮಟ್ಟದ ಔಟ್ಪುಟ್ ನೀಡುವ ಮೂಲಕ, ಈಗ ಅದೇ ಪ್ರಾಂಪ್ಟ್ಗಳಿಗೆ ಗಮನಾರ್ಹವಾಗಿ ಕಡಿಮೆ ವೆಚ್ಚವಾಗುತ್ತದೆ.
ಈ ಹೋಲಿಕೆಗೆ ಕಾರಣವೇನು
GA ಬಿಡುಗಡೆಯು ಯಾವುದೇ ಬ್ಲಾಗ್ ಪೋಸ್ಟ್ ಅಥವಾ ಚೇಂಜ್ಲಾಗ್ ಇಲ್ಲದೆ ಬಂದಿದ್ದರಿಂದ, ಡೆವಲಪರ್ಗಳು ವ್ಯತ್ಯಾಸಗಳನ್ನು ತಾವೇ ಕಂಡುಕೊಳ್ಳಬೇಕಾಯಿತು. ಸಮುದಾಯದ ಪರೀಕ್ಷೆಯು (community test) ಎರಡೂ ವರ್ಷನ್ಗಳ ಮೇಲೆ ಒಂದೇ ರೀತಿಯ ಕಾರ್ಯಗಳನ್ನು ನಡೆಸಿತು ಮತ್ತು ಅತಿದೊಡ್ಡ ಬದಲಾವಣೆಯನ್ನು ಕಂಡುಕೊಂಡಿತು—ಅದು ಉತ್ತರ ನೀಡುವ ಮೊದಲು ಮಾಡೆಲ್ "thinking" ಮಾಡಲು ಬಳಸುವ ಟೋಕನ್ಗಳಲ್ಲಿನ ಭಾರಿ ಇಳಿಕೆ. ಸಾಮಾನ್ಯ ಹುಡುಕಾಟಗಳಲ್ಲಿ (trivial look-ups) GA ಮಾಡೆಲ್ 62% ಕಡಿಮೆ reasoning tokens ಬಳಸಿತು; ಹೆಚ್ಚು ಸಂಕೀರ್ಣವಾದ ಪ್ರಶ್ನೆಗಳಲ್ಲಿ ಈ ಇಳಿಕೆಯು 18% ರಷ್ಟಿತ್ತು.
ಟೋಕನ್ ದಕ್ಷತೆ ಮತ್ತು ಅದರ ಪ್ರಭಾವ
ಸಾಮಾನ್ಯ extraction workflow ನಲ್ಲಿ, ಪ್ರಿವ್ಯೂ ಬಿಲ್ಡ್ ಒಂದು ಪ್ರಾಂಪ್ಟ್ನಿಂದ ಕೆಲವು ಫೀಲ್ಡ್ಗಳನ್ನು ಪಡೆಯಲು 159 reasoning tokens ಬಳಸುತ್ತಿತ್ತು. "thinking" ಫೀಚರ್ ಅನ್ನು ಅಸಕ್ರಿಯಗೊಳಿಸಿದ (disabled) GA ಬಿಲ್ಡ್ಗೆ ಬದಲಾಯಿಸಿದಾಗ, ಆ ಸಂಖ್ಯೆಯು 40 tokens ಗೆ ಕುಸಿಯಿತು. ಮೀಟರ್ಡ್ ಪ್ಲಾನ್ಗಳಲ್ಲಿರುವ (metered plans) ಬಳಕೆದಾರರಿಗೆ, ಈ ಉಳಿತಾಯವು ನೇರವಾಗಿ ಕಡಿಮೆ ಬಿಲ್ಗಳಾಗಿ ಪರಿಣಮಿಸುತ್ತದೆ, ವಿಶೇಷವಾಗಿ ದೊಡ್ಡ ಪ್ರಮಾಣದ ಬಳಕೆಯ ಸಂದರ್ಭದಲ್ಲಿ.
JSON extraction: ಅಡಗಿರುವ ತೊಂದರೆ
"thinking" ಮೋಡ್ ಆನ್ ಆಗಿದ್ದಾಗ ಎರಡೂ ಬಿಲ್ಡ್ಗಳು ಎಡವುತ್ತವೆ: ಅವು JSON schema ಚೆಕ್ ಅನ್ನು ಪಾಸು ಮಾಡುತ್ತವೆ ಆದರೆ ತಪ್ಪು ಸಂಖ್ಯಾತ್ಮಕ ಮೌಲ್ಯಗಳನ್ನು (numeric values) ಸೇರಿಸುತ್ತವೆ. "thinking" ಅನ್ನು ಆಫ್ ಮಾಡಿದಾಗ ಮಾತ್ರ GA ವರ್ಷನ್ ಸರಿಯಾದ JSON ಅನ್ನು ನೀಡುತ್ತದೆ. ರಚನಾತ್ಮಕ ಔಟ್ಪುಟ್ (structured output) ಬೇಕಾದ ತಂಡಗಳು extraction ಕಾರ್ಯಗಳಿಗಾಗಿ thinking ಫ್ಲಾಗ್ ಅನ್ನು ಅಸಕ್ರಿಯಗೊಳಿಸಬೇಕು, ಇಲ್ಲದಿದ್ದರೆ ಅವರು ವ್ಯಾಕರಣಬದ್ಧವಾಗಿ ಸರಿಯಾದ ಆದರೆ ಸಂಖ್ಯಾತ್ಮಕವಾಗಿ ತಪ್ಪಾದ ಡೇಟಾವನ್ನು ಪಡೆಯುತ್ತಾರೆ.
ನಿರಾಕರಣೆ ನಿರ್ವಹಣೆಯಲ್ಲಿ ಬದಲಾವಣೆ
ಪ್ರಿವ್ಯೂ ಮಾಡೆಲ್ ತಾನು ಉತ್ತರಿಸಲಾಗದು ಎಂದು ಭಾವಿಸಿದ ಪ್ರಶ್ನೆಯನ್ನು "I do not know" ಎಂದು ಉತ್ತರಿಸುವ ಮೂಲಕ ನಿರಾಕರಿಸುತ್ತಿತ್ತು. GA ಮಾಡೆಲ್ ಇನ್ನು ಮುಂದೆ ಇದನ್ನು ಮಾಡುವುದಿಲ್ಲ. ಬದಲಾಗಿ, ಅದು ಉತ್ತರಿಸದೆ ತನ್ನ ಟೋಕನ್ ಬಜೆಟ್ ಮುಗಿಸಿಕೊಳ್ಳುತ್ತದೆ ಅಥವಾ ಸುಳ್ಳು ಪ್ರತಿಕ್ರಿಯೆಯನ್ನು (fabricates a response) ಸೃಷ್ಟಿಸುತ್ತದೆ. ಈ ಬದಲಾವಣೆಯು ಟೋಕನ್ ದಕ್ಷತೆಯನ್ನು ಸುಧಾರಿಸುತ್ತದೆ ಆದರೆ ಮಾಡೆಲ್ ಅಪರಿಚಿತ ವಿಷಯಗಳ ಬಗ್ಗೆ hallucinating ಮಾಡದಂತೆ ತಡೆಯುತ್ತಿದ್ದ ಸುರಕ್ಷತಾ ಜಾಲವನ್ನು (safety net) ತೆಗೆದುಹಾಕುತ್ತದೆ.
ವಿಶ್ವಾಸಾರ್ಹತೆಯ ಹೆಚ್ಚಳ
ಪ್ರಿವ್ಯೂ ಬಿಲ್ಡ್ನಲ್ಲಿನ ಒಂದು ಅಪಾಯಕಾರಿ ಲೂಪ್—ಸಣ್ಣ "thinking" ಬಜೆಟ್ನಿಂದ ಪ್ರಚೋದಿತಗೊಂಡಿದ್ದು—8,192-token ವಿಂಡೋ ತುಂಬುವವರೆಗೆ ಮಾಡೆಲ್ ಒಂದೇ ಪಠ್ಯವನ್ನು ಪುನರಾವರ್ತಿಸುವಂತೆ ಮಾಡುತ್ತಿತ್ತು. GA ಬಿಡುಗಡೆಯು ಈ ಬಗ್ ಅನ್ನು ಸರಿಪಡಿಸಿದೆ, ಇದರಿಂದಾಗಿ ಈ ಮೊದಲು ರಿಕ್ವೆಸ್ಟ್ ವಿಂಡೋವನ್ನು ಖಾಲಿ ಮಾಡುವ ಮತ್ತು ವೆಚ್ಚವನ್ನು ಹೆಚ್ಚಿಸುವ ಅಪಾಯಕಾರಿ ಪುನರಾವರ್ತನೆಯು ಕೊನೆಗೊಂಡಿದೆ.
ಬಳಕೆದಾರರು ಗಮನಿಸಬೇಕಾದ ಅಂಶಗಳು
- ಕಡಿಮೆ ಟೋಕನ್ ಸಂಖ್ಯೆಗಳಿಗಾಗಿ GA ಬಿಲ್ಡ್ ಅನ್ನು ಬಳಸಿ. ಕಾರ್ಯದ ಸಂಕೀರ್ಣತೆಯ ಹೊರತಾಗಿಯೂ ಅಳತೆ ಮಾಡಿದ ಇಳಿಕೆಯು ಕಂಡುಬರುತ್ತದೆ.
- ಯಾವುದೇ JSON ಅಥವಾ structured-data extraction ಗಾಗಿ “thinking” ಅನ್ನು ಆಫ್ ಮಾಡಿ. ಇದು ಸರಿಯಾದ ಮೌಲ್ಯಗಳನ್ನು ನೀಡುತ್ತದೆ ಮತ್ತು ಟೋಕನ್ ಬಳಕೆಯನ್ನು ಕನಿಷ್ಠ ಮಟ್ಟದಲ್ಲಿಡುತ್ತದೆ.
- ಬಿಲ್ಟ್-ಇನ್ ನಿರಾಕರಣೆಗಳ ಮೇಲೆ ಅವಲಂಬಿತರಾಗಬೇಡಿ. ಒಂದು ಪ್ರಾಂಪ್ಟ್ ಪರಿಶೀಲಿಸಲಾಗದ ಡೇಟಾವನ್ನು ಕೇಳಿದರೆ, GA ಮಾಡೆಲ್ ಇಂದಿಗೂ ಉತ್ತರವನ್ನು ನೀಡಬಹುದು, ಆದ್ದರಿಂದ downstream validation ಅತ್ಯಗತ್ಯವಾಗಿರುತ್ತದೆ.
- ಪೀಕ್-ಅವರ್ ಬಿಲ್ಲಿಂಗ್ ಅನ್ನು ಗಮನಿಸಿ. ಹೊಸ ಬೆಲೆ ನಿಯಮಗಳು ಹೆಚ್ಚಿನ ಟ್ರಾಫಿಕ್ ಅವಧಿಯಲ್ಲಿನ ಟೋಕನ್ ಬಳಕೆಯನ್ನು ಈ ಮೊದಲಿಗಿಂತ ಹೆಚ್ಚು ತೀವ್ರವಾಗಿ ಒಟ್ಟಾರೆ ವೆಚ್ಚದ ಮೇಲೆ ಪರಿಣಾಮ ಬೀರುವಂತೆ ಮಾಡುತ್ತವೆ.
ಸಾರಾಂಶ
DeepSeek ನ V4 Pro GA ಮಾಡೆಲ್ ಸ್ಪಷ್ಟವಾದ ದಕ್ಷತೆಯ ಗೆಲುವನ್ನು ನೀಡುತ್ತದೆ—62% ವರೆಗೆ ಕಡಿಮೆ reasoning tokens—ಮತ್ತು ಒಂದು ನಿರ್ಣಾಯಕ ಪುನರಾವರ್ತನೆಯ ಬಗ್ ಅನ್ನು ಸರಿಪಡಿಸುತ್ತದೆ. ಆದಾಗ್ಯೂ, ಸ್ಪಷ್ಟವಾದ ನಿರಾಕರಣೆ ಪ್ರತಿಕ್ರಿಯೆಗಳ ನಷ್ಟ ಮತ್ತು ನಿಖರವಾದ JSON ಔಟ್ಪುಟ್ಗಾಗಿ thinking ಅನ್ನು ಅಸಕ್ರಿಯಗೊಳಿಸುವ ಅಗತ್ಯವು ಹೊಸ ಪರಿಗಣನೆಗಳನ್ನು ಸೇರಿಸುತ್ತದೆ. ತಮ್ಮ ಪೈಪ್ಲೈನ್ಗಳನ್ನು ಹೊಂದಾಣಿಕೆ ಮಾಡಿಕೊಳ್ಳುವ ತಂಡಗಳು ಕಾರ್ಯಕ್ಷಮತೆಯನ್ನು ಬಲಿ ನೀಡದೆ ವೆಚ್ಚವನ್ನು ಕಡಿಮೆ ಮಾಡಬಹುದು.
ಮೂಲ: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l
