OpenAI оголосила, що її модель GPT-5.6 Sol досягла результату 38,3 відсотка в логічному бенчмарку ARC-AGI-3, випередивши Claude Opus 5 від Anthropic, який показав 30,2 відсотка. Ця заява викликала негайну технічну суперечку, оскільки та сама модель набрала лише 7,8 відсотка під час тестування через офіційний тестовий стенд бенчмарку.
Чому результат ARC-AGI-3 має значення
ARC-AGI-3 перевіряє здатність моделі вирішувати абсолютно нові складні логічні завдання, а не покладатися на запам'ятовані шаблони. Дослідники розглядають ці показники як проксі-метрику прогресу «загального інтелекту», тому перевага у десять пунктів виглядає як суттєвий крок до людського способу вирішення проблем. Це саме по собі пояснює, чому ця новина викликала резонанс у спільноті ШІ.
Прихований важіль: Retained Reasoning та Compaction
OpenAI не оцінювала GPT-5.6 Sol за допомогою публічного тестового стенда. Замість цього вона використала власний Responses API з двома пропрієтарними опціями:
- Retained Reasoning — підтримує ланцюжок думок моделі протягом багатьох кроків, запобігаючи втраті проміжної логіки, яка виникає, коли кожен крок розглядається ізольовано.
- Compaction — стискає попередній контекст замість того, щоб просто його відсікати, дозволяючи моделі звертатися до довшої підсумованої історії.
Коли ці налаштування активні, модель вибудовує довші аргументи та повторно використовує попередні висновки, що штучно завищує показники у багатоетапних завданнях. В офіційному стенді, який відкидає логічні роздуми після кожної дії, результат тієї ж моделі падає до 7,8 відсотка, що ставить її значно нижче Claude Opus 5.
OpenAI стверджує, що бенчмарк має вимірювати весь конвеєр виведення (inference pipeline), а не лише «сирі» ваги нейронної мережі. З цієї точки зору, «обгортка» — логіка API, яка зберігає та стискає контекст — є частиною системи, що оцінюється.
Дебати про справедливість
Франсуа Шолле (François Chollet), співзасновник ARC Prize, який спонсорує цей бенчмарк, висловив свою думку. Він провів межу між спеціально створеними стендами, розробленими для того, щоб «розв'язати» бенчмарк, та універсальними налаштуваннями API, які може ввімкнути будь-який користувач. Шолле зазначив, що оригінальне тестове середовище ARC Prize використовувало старіший completions API у стилі OpenAI, якому бракувало розширених функцій, доступних зараз в Anthropic Claude API. Ця невідповідність могла поставити OpenAI у невигідне становище в попередніх раундах.
Він не став оголошувати таке порівняння недійсним. Шолле сказав, що пряме порівняння залишається прийнятним, якщо розкриті точні налаштування та будь-які пов'язані з цим витрати. Прозорість, за його словами, дозволяє спільноті оцінити, чи зумовлена різниця архітектурою моделі, інженерними хитрощами, чи і тим, і іншим.
Хто виграє, а хто програє
Якщо вищий бал буде прийнятий як належне, OpenAI отримає приріст публічної репутації та сильнішу позицію в переговорах щодо корпоративного ліцензування. Команда Claude може вказувати на продуктивність «сирої» моделі на стандартизованому стенді як на доказ того, що їхня архітектура є ефективнішою, коли з неї прибрати додаткові інженерні шари.
Дослідники та розробники, які покладаються на рейтинги бенчмарків для прийняття інвестиційних рішень, можуть вважати цей епізод тривожним. Цей випадок показує, що в міру збільшення моделей програмне забезпечення, яке керує їхнім виведенням, може ставати вирішальним фактором. Компанії, які пропонують складні стеки виведення з низькими граничними витратами, можуть домінувати в заголовках новин, не маючи при цьому кращо
Критики заперечують, що без спільного базису показники стають мінливою ціллю, підриваючи роль бенчмарка як об'єктивного мірила. Напруженість між екологічною валідністю (відображенням реальних умов розгортання) та методологічною чистотою (ізоляцією моделі) підживлює нинішні дискусії.
Підсумок
Твердження щодо GPT-5.6 Sol підсвічує зростаючий розкол в оцінюванні ШІ: сирий талант моделі проти інженерної екосистеми, яка його витягує. Поки спільнота вимагатиме повного розкриття налаштувань інференсу та їхньої вартості, дискусія лише загострюватиметься, а не затьмарюватиме наше розуміння прогресу на шляху до загального інтелекту.
