Чому нова модель здається «складнішою»

Google створила Gemini 3.8 Flash для автономних агентів, які мають проходити через кілька етапів роздумів. На відміну від Gemini 3.7 Flash, яка зазвичай відповідала за один прохід, версія 3.8 розбиває проблему на підпитання, викликає зовнішні API та повторює ітерації, доки не буде задоволена результатом. Google попереджає, що ця додаткова «ментальна робота» споживає більше токенів, особливо при вищих налаштуваннях «зусиль» (effort).

Незалежний аналіз показує, що кількість вихідних токенів на одне завдання зростає приблизно на 30 % порівняно з 3.7 Flash, а кількість ітерацій взаємодії також збільшується. Оскільки вартість за токен залишається незмінною, ефективна вартість для багатьох реальних робочих навантажень зростає приблизно на 40 %.

Бенчмарки, які важливі для розробників

Цей компроміс не є суто теоретичним. У прямих тестах на бенчмарку для програмної інженерії DeepSWE v1.1, Gemini 3.8 Flash рішуче перевершила Fable 5 від Anthropic. Модель також посіла перші місця в бенчмарках Vals Finance Agent V2 та Harvey’s Legal Agent, довівши, що вона здатна виконувати складні фінансові розрахунки та нюансоване юридичне мислення.

Джон Енніс, генеральний директор Aigora.ai, підсумував перевагу: модель забезпечує «якість кодування рівня Opus 5», працюючи при цьому за частку вартості та з помітно вищою швидкістю. Він наводить такі приклади використання, як створення відео в Remotion, де швидкий вивід та складне генерування коду скорочують години в конвеєрах виробництва.

Зміни в економіці ШІ

Раніше розробники оцінювали доступність за ціною за токен. Багатоходові агенти з використанням інструментів змінюють цю метрику на ціну за успішно виконане завдання. З Gemini 3.8 Flash нижча ціна за токен більше не гарантує менший рахунок, якщо модель споживає більше токенів для досягнення того самого результату.

Google позиціонує цю модель між наддорогими передовими моделями та легкими генераторами з одним проходом. Називаючи її «інтелектом за запитом» (intelligence-on-demand), компанія дає зрозуміти, що розробники можуть отримати вищу потужність міркування без затримок (latency), які зазвичай притаманні більшим і повільнішим моделям. Компроміс очевидний: складніший результат означає більшу загальну кількість токенів.

Коли варто залишитися на старій версії

Командам, яким потрібна чітка передбачуваність витрат — особливо тим, хто виконує масштабні пакетні завдання або працює з низькою маржою — варто залишитися на Gemini 3.7 Flash. Старіша модель все ще забезпечує низьку затримку та стабільне споживання токенів, що полегшує прогнозування щомісячних витрат.

На що звернути увагу далі

  • Ціноутворення за виклики інструментів:

Підсумок

Gemini 3.8 Flash демонструє, що вищий рівень міркування може досягатися з затримкою на рівні Flash-моделей, проте вона споживає більше токенів за кожну взаємодію. Розробники, які створюють складних багатоетапних ШІ-агентів, оцінять переваги в продуктивності, проте їм доведеться скоригувати бюджет, щоб покрити приховані витрати на токени. Для всіх інших старіша 3.7 Flash залишається безпечнішим і передбачуванішим вибором.