Kimi K3 выдохлась, в то время как GPT-5.6-SOL пересекла финишную черту на трех тяжеловесных промптах — задаче по теории вероятностей, сценарии с инерцией блока и запутанном Python-скрипте для задачи о рюкзаке. Этот разрыв объясняет, почему бюджет токенов и задержка (latency) имеют значение, когда вам нужна модель, способная рассуждать в многошаговых задачах по математике, физике и коду, не зависая на полпути.

Почему этот бенчмарк важен

Разработчики и исследователи часто выбирают LLM, основываясь на громких показателях в заголовках, а не на том, как она ведет себя под реальной нагрузкой. В этом сравнительном тесте каждая модель решала задачу, требующую длинной цепочки рассуждений. GPT-5.6-SOL предоставила полные и правильные ответы во всех трех областях; Kimi K3 исчерпала свой бюджет токенов или превысила время ожидания, не выдав ничего полезного.

Настройка теста

  • Математика — вопрос по теории вероятностей, требовавший вычисления вероятности перекрытия паттернов, а также математического ожидания и дисперсии (вторых моментов).
  • Физика — моделирование инерции блока и потери энергии при ослаблении кабеля под натяжением пружины.
  • Программирование — написание решения на Python для задачи о рюкзаке со сложными зависимостями и правилами разрешения спорных ситуаций (tie-break), с последующей проверкой результата по шести независимым тестовым случаям.

Что говорят цифры

GPT-5.6-SOL

  • Математика — выдала полное и верное решение с четко изложенными математическим ожиданием и дисперсией.
  • Физика — правильно построила модель инерции и учла потерю энергии, что совпало с аналитическим ответом.
  • Программирование — сгенерировала код, который скомпилировался, запустился и прошел все шесть внешних проверок. Внутренняя проверка (assertion) была ошибочной, что напоминает нам: тесты, созданные моделью, не являются непогрешимыми.

Kimi K3

  • Математика — достигла лимита токенов (сначала на 6 500, затем на 10 000) и остановилась, не показав никакого ответа.
  • Физика — закончила токены до появления какого-либо видимого результата.
  • Программирование — время ожидания истекло через 245 секунд, не выдав ничего для оценки.

Эффективность рассуждений против грубой силы

Вывод очевиден для всех, кто строит продакшн-пайплайны: модель, которая сжигает токены, не выдавая результата, может затормозить последующие процессы, увеличить расходы и разочаровать пользователей.

Надежность и скрытая цена «идеального» кода

Даже победитель допустил ошибку: сгенерированный GPT-5.6-SOL тестовый случай содержал неверное утверждение (assertion). Это показывает, что валидация, созданная моделью, не является заменой человеческой проверке. Когда модель пишет код, вам все равно нужно проводить независимые проверки.

На что обратить внимание в будущем

  • Отслеживание причины завершения (finish reason) — логируйте, заканчивается ли ответ из-за достижения лимита токенов, превышения времени ожидания или естественной остановки.
  • Количество токенов на рассуждения — сравнивайте, сколько токенов каждая модель тратит на внутренние размышления по сравнению с финальным выводом.
  • Мониторинг задержки (latency) — измеряйте реальное время выполнения каждого шага; модель, которой требуются минуты на один запрос, может не подойти для интерактивных приложений.

Разработчикам следует рассматривать эти метрики как первостепенные сигналы, а не просто как способ получения финального ответа.

Итог

GPT-5.6-SOL превосходит Kimi K3 по полноте ответов. Тест также напоминает нам, что даже модель, которая «все делает правильно», может создавать ошибочные внутренние проверки, поэтому человеческий контроль остается необходимым. Отслеживание причин завершения, использования токенов и задержки поможет вам выбрать правильный инструмент для задачи, не попав в ловушку «тихого» тайм-аута.