Почему новая модель кажется «более сложной»

Google разработала Gemini 3.8 Flash для автономных агентов, которым необходимо обдумывать задачи в несколько этапов. В отличие от Gemini 3.7 Flash, которая обычно отвечала за один проход, версия 3.8 разбивает проблему на подвопросы, вызывает внешние API и итерирует процесс до достижения нужного результата. Google предупреждает, что эта дополнительная «умственная работа» потребляет больше токенов, особенно при высоких настройках «усилия» (effort).

Независимый анализ показывает, что количество выходных токенов на одну задачу увеличивается примерно на 30 % по сравнению с 3.7 Flash, а количество итераций взаимодействия также растет. Поскольку стоимость одного токена остается прежней, эффективная стоимость для многих реальных рабочих нагрузок возрастает примерно на 40 %.

Бенчмарки, важные для разработчиков

Этот компромисс не является чисто теоретическим. В прямых сравнениях на бенчмарке для программной инженерии DeepSWE v1.1 модель Gemini 3.8 Flash решительно обошла Anthropic Fable 5. Модель также заняла первые места в бенчмарках Vals Finance Agent V2 и Harvey’s Legal Agent, доказав способность справляться со сложными финансовыми расчетами и тонкими юридическими нюансами.

Джон Эннис, CEO Aigora.ai, резюмировал это преимущество: модель обеспечивает «качество кодинга уровня Opus 5», работая при этом за малую долю стоимости и с заметно более высокой скоростью. Он приводит в пример такие сценарии использования, как генерация видео в Remotion, где быстрый инференс и сложное создание кода экономят часы в производственных циклах.

Меняющаяся экономика ИИ

Раньше разработчики оценивали доступность по цене за токен. Многошаговые агенты с использованием инструментов меняют эту метрику на цену за успешно выполненную задачу. С Gemini 3.8 Flash низкая цена за токен больше не гарантирует меньший счет, если модели требуется больше токенов для достижения того же результата.

Google позиционирует эту модель между сверхдорогими передовыми моделями и легковесными генераторами, работающими в один проход. Называя её «интеллектом по требованию» (intelligence-on-demand), компания дает понять, что разработчики могут использовать более мощные возможности рассуждения без задержек, которые обычно характерны для более крупных и медленных моделей. Компромисс очевиден: более сложный результат означает большее общее количество токенов.

Когда стоит остаться на старой версии

Командам, которым важна строгая предсказуемость затрат — особенно тем, кто запускает масштабные пакетные задания или работает с низкой маржой — следует придерживаться Gemini 3.7 Flash. Старая модель по-прежнему обеспечивает низкую задержку и стабильный расход токенов, что позволяет легче прогнозировать ежемесячные расходы.

За чем следить дальше

  • Стоимость вызова инструментов (tool-call pricing):

Итог

Gemini 3.8 Flash показывает, что более глубокие рассуждения могут достигаться с задержкой на уровне Flash-моделей, но при этом тратится больше токенов на каждое взаимодействие. Разработчики, создающие сложные многошаговые ИИ-агенты, сочтут прирост производительности убедительным, однако им придется скорректировать бюджет, чтобы покрыть скрытые расходы на токены. Для всех остальных старая версия 3.7 Flash остается более безопасным и предсказуемым выбором.