DeepSeek випустила модель V4 Pro у загальному доступі (GA). Попередні вимірювання показують, що вона скорочує використання токенів міркування (reasoning tokens) на 18–62% порівняно з попередньою версією (preview build). Це важливо для всіх, хто платить за кожен токен: ті самі запити тепер коштують помітно менше, водночас видаючи порівнянний результат.
Що спонукало до порівняння
Реліз GA вийшов без допису в блозі чи списку змін (changelog), тому розробникам довелося виявляти відмінності самостійно. Тестування спільноти, під час якого на обох версіях виконувалися ідентичні завдання, виявило найбільшу зміну — різке скорочення кількості токенів, які модель витрачає на «міркування» перед відповіддю. При простих пошукових запитах модель GA використовувала на 62% менше токенів міркування; у складніших запитах скорочення становило 18%.
Ефективність токенів та її вплив
У типовому робочому процесі вилучення даних (extraction workflow) попередня версія витрачала 159 токенів міркування, щоб витягнути кілька полів із запиту. Перехід на GA-версію з вимкненою функцією «thinking» скоротив це число до 40 токенів. Для користувачів із оплатою за використанням економія безпосередньо перетворюється на менші рахунки, особливо при масштабуванні.
Вилучення JSON: прихована перешкода
Обидві версії помиляються, коли увімкнено режим «thinking»: вони проходять перевірку JSON-схеми, але вставляють неправильні числові значення. Тільки версія GA повертає коректний JSON, коли функцію «thinking» вимкнено. Командам, яким потрібен структурований результат, слід вимикати прапорець «thinking» для завдань із вилучення даних, інакше вони отримуватимуть синтаксично правильні, але числово некоректні дані.
Зміна підходу до відмов
Попередня модель могла відмовитися відповідати на запитання, яке вона вважала неможливим для розв'язання, відповідаючи: «Я не знаю». Модель GA більше цього не робить. Замість цього вона або вичерпує свій бюджет токенів, не давши відповіді, або вигадує її. Ця зміна підвищує ефективність токенів, але прибирає «запобіжник», який не давав моделі галюцинувати на невідомі теми.
Підвищення надійності
Небезпечний цикл у попередній версії — спричинений скромним бюджетом на «thinking» — міг змусити модель повторювати один і той самий текст, поки не заповниться вікно у 8 192 токени. Реліз GA виправляє цей баг, припиняючи неконтрольоване повторення, яке раніше створювало ризик вичерпання вікна запиту та завищення витрат.
На що варто звернути увагу користувачам
- Використовуйте GA-версію для зменшення кількості токенів. Виміряне скорочення зберігається незалежно від складності завдання.
- Вимкніть «thinking» для будь-якого вилучення JSON або структурованих даних. Це забезпечить правильні значення та мінімізує використання токенів.
- Не розраховуйте на вбудовані відмови. Якщо запит стосується неперевірюваних даних, модель GA все одно може надати відповідь, тому подальша валідація залишається необхідною.
- Слідкуйте за рахунками в години пік. Нові правила ціноутворення призводять до того, що споживання токенів у періоди високого трафіку сильніше впливає на загальні витрати, ніж раніше.
Підсумок
Модель DeepSeek V4 Pro GA забезпечує явну перевагу в ефективності — до 62% менше токенів міркування — і виправляє критичний баг із повторенням. Однак відсутність явних відповідей-відмов та необхідність вимикати «thinking» для отримання точного JSON додають нові нюанси. Команди, які адаптують свої пайплайни, зможуть знизити витрати без втрати функціональності.
Джерело: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l
