OpenAI заявляє, що її модель GPT-5.6 Sol досягла 38,3% успішності в тесті на логічне мислення ARC-AGI-3, випередивши Claude Opus 5 від Anthropic, яка показала 30,2%. Така перевага з'являється лише тоді, коли модель працює через спеціальний Responses API від OpenAI, що додає два прийоми під час виведення (inference), які не дозволяє офіційний тестовий стенд.
Передісторія: гонка озброєнь бенчмарків
ARC-AGI-3 перевіряє здатність моделі вирішувати нові багатоетапні завдання, не покладаючись на заздалегідь заучені факти. На початку цього року Anthropic оголосила про чотирикратне зростання показників у цьому тесті, вивівши Opus 5 на перше місце в публічному рейтингу. Цей результат став новою точкою відліку для «чистої» здатності моделі, оскільки офіційний стенд видаляє будь-які проміжні міркування після кожного кроку, змушуючи модель щоразу починати з чистого аркуша.
Заява OpenAI з'явилася в тому ж конкурентному середовищі. Публікуючи вищий бал, компанія сигналізує, що її останнє покоління може не лише зрівнятися, а й перевершити логічні можливості свого головного конкурента. Однак за заголовком прихований технічний нюанс, який змінює підхід спільноти до інтерпретації таблиць бенчмарків.
Що насправді означають ці цифри
Коли GPT-5.6 Sol оцінюють за допомогою того самого офіційного стенда ARC-AGI-3, який забезпечив Opus 5 результат 30,2%, показник успішності моделі падає до 7,8%. Такий стрибок — це не помилка, а результат роботи двох спеціально розроблених функцій, які OpenAI додає до моделі:
- Retained Reasoning — замість того, щоб видаляти ланцюжок думок після кожного підзавдання, система зберігає проміжний текст, дозволяючи моделі звертатися до попередніх висновків і будувати кумулятивну аргументацію.
- Compaction — замість того, щоб обрізати старий контекст для дотримання лімітів токенів, оболонка стискає попередні кроки в короткий підсумок, зберігаючи логічний зв'язок і водночас підтримуючи прийнятний розмір промпту.
Обидва механізми реалізовані у пропрієтарному Responses API. Надаючи моделі багатший і безперервний контекст, OpenAI фактично розширює її «пам'ять» і дозволяє повторно використовувати власні міркування. Натомість офіційний стенд застосовує суворий «stateless» (без збереження стану) режим, який позбавляє модель цих переваг.
Чому методологія має значення
Цей епізод підкреслює зростаючий розкол в оцінці ШІ: чисті показники моделі проти продуктивності на рівні системи. OpenAI стверджує, що бенчмарк має відображати весь стек, який розробники будуть розгортати на практиці: модель, конвеєр виведення (inference pipeline) та управління пам'яттю. З цієї точки зору, результат 38,3% каже команді розробників продукту, що комбіноване рішення здатне вирішити більше реальних завдань, ніж модель, оцінена ізольовано.
Критики стверджують, що це заважає науковому прогресу. Якщо кожна лабораторія додаватиме власні специфічні оболонки, рейтинг перетвориться на набір інженерних хитрощів, а не на чисте порівняння інтелекту моделей. Офіційний стенд ARC-AGI-3 існує для того, щоб забезпечити рівні умови, гарантуючи, що вищий бал свідчить про справді потужнішу базову модель, а не про розумнішу оболонку.
Ставки для розробників та інвесторів
Для стартапів, що створюють продукти на базі ШІ, ця різниця має практичне значення. Модель, яка здатна зберігати міркування та стискати контекст, може потребувати менше промпт-інжинірингу, мати меншу затримку виведення (latency) та робити менше викликів API для пошуку рішення. Це трансформується у дешевші рахунки за обчислювальні потужності та зручніший досвід для користувачів. Компанії, що постачають систему «під ключ» — модель разом з оптимізованим рівнем виведення — отримують конкурентну перевагу там, де важливі швидкість і вартість.
Інвестори стежать за зростанням показників у бенчмарках як за проксі-індикаторами майбутнього доходу. Гучний заголовок про лідерство може підвищити оцінку компанії, навіть якщо чиста здатність базової моделі відповідає рівню конкурентів. Таким чином, дискусія про те, що саме означають ці цифри, впливає на розподіл капіталу в секторі ШІ.
За чим стежити далі
- Реакція розробників стандартів — організатори бенчмарків можуть посилити правила щодо «зовнішніх» хитрощів під час виведення або додати окрему «системну» категорію, яка явно дозволяє їх використання. Їхня реакція сформує наступну хвилю публічних рейтингів.
- Open-source оболонки — якщо спільнота випустить власні реалізації механізмів retained reasoning та compaction, ця перевага може стати базовою функцією, а не пропрієтарною особливістю.
- Реальні тестові середовища — компанії дедалі частіше публікують результати на власних наборах задач (наприклад, внутрішніх пакетах для генерації коду). Ці результати, хоч їх і важче порівнювати, почнуть мати більше значення, ніж єдиний публічний бенчмарк.
Контраргумент: чи не є це «маніпуляцією» бенчмарком?
Деякі дослідники називають використання кастомних API «маніпуляцією бенчмарками» (benchmark gaming), стверджуючи, що це завищує показники, не сприяючи глибшому розумінню основ моделі. Вони зазначають, що якщо модель демонструє однозначні результати під суворими обмеженнями, вона все ще далека від досягнення мети AGI. Існує побоювання, що галузь може почати винагороджувати інженерні хитрощі замість справжніх стрибків у здатності до міркування.
Сторона OpenAI наголошує, що межа між моделлю та системою стає дедалі більш умовною. Сучасні ШІ-додатки рідко запускають модель у вакуумі; вони завжди працюють через рівень обслуговування, який забезпечує кешування, зшивання контексту та постобробку результатів. З цієї точки зору, вимірювання всього конвеєра (pipeline) є більш чесним щодо того, що насправді відчувають користувачі.
Висновок
Історія з GPT-5.6 Sol показує, що сьогоднішні перемоги в бенчмарках залежать настільки ж від інженерії виведення (inference engineering), наскільки й від розміру моделі. Те, чи прийме спільнота оцінки на системному рівні, чи обмежить використання кастомних обгорток (wrappers), визначить, як ми сприйматимемо наступні заголовки про «таблиці лідерів». Для всіх, хто створює або фінансує ШІ-продукти, урок очевидний: сирі цифри мають значення, але оточуюче програмне забезпечення може стати вирішальним фактором у продуктивності в реальних умовах.
