DeepSeek выпустила общедоступную версию (GA) модели V4 Pro. Первые измерения показывают, что она сокращает использование токенов рассуждения на 18–62 % по сравнению с превью-версией. Это важно для всех, кто платит за каждый токен: те же промпты теперь стоят заметно дешевле, при этом выдавая сопоставимый результат.

Что послужило поводом для сравнения

Релиз GA состоялся без публикации блога или списка изменений, поэтому разработчикам пришлось выяснять различия самостоятельно. Сообщество провело тест, выполнив идентичные задачи на обеих версиях, и обнаружило самое значительное изменение — резкое снижение количества токенов, которые модель тратит на «размышления» перед ответом. При простых запросах GA-модель использовала на 62 % меньше токенов рассуждения; при более сложных запросах сокращение составило 18 %.

Эффективность токенов и её влияние

В типичном рабочем процессе извлечения данных превью-версия тратила 159 токенов рассуждения, чтобы вытянуть несколько полей из промпта. Переход на GA-версию с отключенной функцией «thinking» сократил это число до 40 токенов. Для пользователей с оплатой по мере использования это напрямую конвертируется в снижение счетов, особенно при масштабировании.

Извлечение JSON: скрытая проблема

Обе версии допускают ошибки, когда включен режим «thinking»: они проходят проверку схемы JSON, но вставляют неверные числовые значения. Только GA-версия возвращает корректный JSON при отключенном режиме «thinking». Командам, которым требуется структурированный вывод, следует отключать флаг «thinking» для задач извлечения, иначе они будут получать синтаксически правильные, но численно неверные данные.

Изменение логики отказов

Превью-модель могла отказаться отвечать на вопрос, который она считала невозможным для решения, отвечая: «Я не знаю». GA-модель больше так не делает. Вместо этого она либо исчерпывает свой бюджет токенов, не дав ответа, либо выдумывает ответ. Это изменение повышает эффективность токенов, но убирает «предохранитель», который не позволял модели галлюцинировать на неизвестные темы.

Повышение надежности

Опасный цикл в превью-версии — вызванный скромным бюджетом на «размышления» — мог заставить модель повторять один и тот же текст, пока не заполнится окно в 8 192 токена. Релиз GA исправляет этот баг, прекращая бесконечные повторения, которые ранее рисковали исчерпать окно запроса и раздуть расходы.

На что стоит обратить внимание пользователям

  • Используйте GA-версию для уменьшения расхода токенов. Снижение расхода подтверждается при разной сложности задач.
  • Отключайте «thinking» для любого извлечения JSON или структурированных данных. Это обеспечит корректные значения и минимизирует использование токенов.
  • Не полагайтесь на встроенные отказы. Если промпт запрашивает непроверяемые данные, GA-модель всё равно может выдать ответ, поэтому последующая валидация остается необходимой.
  • Следите за счетами в часы пик. Новые правила ценообразования делают так, что потребление токенов в периоды высокой нагрузки влияет на общие расходы сильнее, чем раньше.

Итог

Общедоступная модель DeepSeek V4 Pro обеспечивает явную победу в эффективности — до 62 % меньше токенов рассуждения — и исправляет критический баг с повторениями. Однако исчезновение явных отказов и необходимость отключать «thinking» для точного вывода JSON добавляют новые нюансы. Команды, которые адаптируют свои пайплайны, смогут снизить затраты без потери функциональности.

Source: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l