OpenAI zegt dat hun GPT-5.6 Sol-model een succespercentage van 38,3% heeft behaald op de ARC-AGI-3 logical-reasoning benchmark, waarmee het Anthropic's Claude Opus 5 met 30,2% verslaat. De voorsprong is alleen zichtbaar wanneer het model draait via OpenAI's eigen Responses API, die twee trucs tijdens de inferentie toevoegt die de officiële testomgeving niet toestaat.
De aanloop: een wapenwedloop in benchmarks
ARC-AGI-3 test het vermogen van een model om nieuwe, meerstaps-problemen op te lossen zonder te vertrouwen op onthouden feiten. Begin dit jaar kondigde Anthropic een verviervoudige sprong op de benchmark aan, waardoor Opus 5 bovenaan het publieke leaderboard kwam te staan. Dat resultaat vormde een nieuw ijkpunt voor de "ruwe" capaciteit van een model, omdat de officiële testomgeving elke tussenliggende redenering na elke stap verwijdert, waardoor het model telkens opnieuw moet beginnen.
De claim van OpenAI komt in hetzelfde competitieve klimaat terecht. Door een hogere score te publiceren, geeft het bedrijf aan dat zijn nieuwste generatie de logische prestaties van de belangrijkste rivaal niet alleen kan evenaren, maar zelfs kan overtreffen. De kop verbergt echter een technische nuance die de manier waarop de community benchmark-tabellen leest, aan het veranderen is.
Wat de cijfers echt betekenen
Wanneer GPT-5.6 Sol wordt geëvalueerd onder dezelfde officiële ARC-AGI-3 testomgeving die Opus 5 het resultaat van 30,2% gaf, stort het succespercentage van het model in naar 7,8%. Deze schommeling is geen foutje; het is het resultaat van twee technische functies die OpenAI bij het model levert:
- Retained Reasoning – in plaats van de chain-of-thought na elke subtaak te wissen, houdt het systeem de tussenliggende tekst levend, waardoor het model kan terugverwijzen naar eerdere deducties en een cumulatief argument kan opbouwen.
- Compaction – in plaats van oudere context in te korten om binnen de tokenlimieten te blijven, comprimeert de wrapper eerdere stappen tot een korte samenvatting, waardoor de logische draad behouden blijft terwijl de grootte van de prompt beheersbaar blijft.
Beide mechanismen maken deel uit van de propriëtaire Responses API. Door het model een rijkere, continue context te voeden, vergroot OpenAI effectief het "geheugen" van het model en laat het het eigen redeneervermogen hergebruiken. De officiële testomgeving dwingt daarentegen een strikte "stateless" modus af die deze voordelen wegneemt.
Waarom de methodologie ertoe doet
Dit incident benadrukt een groeiende kloof in AI-evaluatie: ruwe modelscores versus prestaties op systeemniveau. OpenAI voert aan dat een benchmark de volledige stack moet weerspiegelen die ontwikkelaars daadwerkelijk zullen inzetten – het model, de inference pipeline en het geheugenbeheer. Vanuit dat oogpunt vertelt een score van 38,3% een productteam dat het gecombineerde aanbod meer taken in de echte wereld kan oplossen dan een model dat in isolatie wordt geëvalueerd.
Critici zeggen dat dit de wetenschappelijke vooruitgang vertroebelt. Als elk lab op maat gemaakte wrappers toevoegt, wordt het leaderboard een lappendeken van technische trucjes in plaats van een zuivere vergelijking van modelintelligentie. De officiële ARC-AGI-3 testomgeving is er om een gelijk speelveld te creëren, zodat een hoger cijfer duidt op een werkelijk sterker onderliggend model en niet op een slimmere wrapper.
Belangen voor ontwikkelaars en investeerders
Voor startups die AI-gestuurde producten bouwen, is het onderscheid praktisch. Een model dat redeneringen kan vasthouden en context kan comprimeren, heeft mogelijk minder prompt engineering, een lagere inference latency en minder API-aanroepen nodig om tot een oplossing te komen. Dat vertaalt zich in lagere rekenkosten en een soepelere gebruikerservaring. Bedrijven die een kant-en-klaar systeem leveren – model plus een geoptimaliseerde inference-laag – verwerven een concurrentievoordeel op plekken waar snelheid en kosten cruciaal zijn.
Investeerders zien stijgingen in benchmarks als een graadmeter voor toekomstige inkomsten. Een spectaculaire voorsprong kan de waardering van een bedrijf een boost geven, zelfs als de ruwe capaciteit van het onderliggende model die van concurrenten evenaart. Het debat over wat de cijfers vertegenwoordigen, beïnvloedt daarom hoe kapitaal door de AI-sector stroomt.
Waar we op moeten letten
- Reacties van de standaardzetters – organisatoren van benchmarks kunnen de regels rondom "externe" inferentie-trucs aanscherpen of een aparte "system" track toevoegen die deze expliciet toestaat. Hun reactie zal de volgende golf van publieke leaderboards vormgeven.
- Open-source wrappers – als de community eigen implementaties van retained reasoning en compaction uitbrengt, zou het voordeel een basiskenmerk kunnen worden in plaats van een propriëtair voordeel.
- Testomgevingen in de echte wereld – bedrijven publiceren steeds vaker hun prestaties op basis van eigen datasets (bijv. interne suites voor code-generatie). Hoewel deze resultaten minder vergelijkbaar zijn, zullen ze steeds belangrijker worden dan een enkele publieke benchmark.
Tegenargument: is dit het "manipuleren" van de benchmark?
Sommige onderzoekers bestempelen het gebruik van aangepaste API's als "benchmark gaming", met het argument dat het scores opblaast zonder het fundamentele begrip van modellen te verbeteren. Ze wijzen erop dat een model dat onder strikte beperkingen terugvalt naar een prestatie met slechts één cijfer, nog steeds ver verwijderd is van het AGI-doel. De zorg is dat het vakgebied engineering-shortcuts kan gaan belonen boven echte sprongen in redeneervermogen.
De zijde van OpenAI benadrukt dat de grens tussen model en systeem steeds kunstmatiger wordt. Moderne AI-toepassingen draaien zelden een model in een vacuüm; ze bevinden zich altijd achter een serving layer die caching, context stitching en output post-processing afhandelt. Vanuit dat oogpunt is het meten van de volledige pipeline eerlijker over wat gebruikers daadwerkelijk ervaren.
Kernpunt
Het verhaal van GPT-5.6 Sol laat zien dat de benchmark-overwinningen van vandaag evenzeer afhangen van inference engineering als van modelgrootte. Of de community systeembrede scores omarmt of maatwerk-wrappers aan banden legt, zal bepalen hoe we de volgende "leaderboard"-kop lezen. Voor iedereen die AI-producten bouwt of financiert, is de les duidelijk: ruwe cijfers doen ertoe, maar de omliggende software kan de doorslaggevende factor zijn in prestaties in de echte wereld.
