A OpenAI anunciou que seu modelo GPT-5.6 Sol atingiu uma pontuação de 38,3% no benchmark de lógica ARC-AGI-3, superando o Claude Opus 5 da Anthropic, que obteve 30,2%. A afirmação gerou uma disputa técnica imediata porque o mesmo modelo obteve apenas 7,8% quando executado através do harness de teste oficial do benchmark.
Por que a pontuação do ARC-AGI-3 é importante
O ARC-AGI-3 testa a capacidade de um modelo de resolver problemas inéditos e com forte carga de raciocínio, em vez de depender de padrões memorizados. Pesquisadores citam as pontuações como um indicador do progresso da "inteligência geral", de modo que uma liderança de dez pontos parece um avanço material em direção à resolução de problemas de forma semelhante à humana. Isso, por si só, explica por que a manchete repercutiu em toda a comunidade de IA.
A alavanca oculta: Retained Reasoning e Compaction
A OpenAI não avaliou o GPT-5.6 Sol com o harness de teste público. Em vez disso, utilizou sua própria Responses API com duas opções proprietárias:
- Retained Reasoning – mantém a cadeia de pensamento do modelo viva ao longo de múltiplas etapas, evitando a perda da lógica intermediária que ocorre quando cada etapa é tratada isoladamente.
- Compaction – comprime o contexto anterior em vez de cortá-lo, permitindo que o modelo faça referência a um histórico mais longo e resumido.
Quando essas configurações estão ativas, o modelo costura argumentos mais longos e reutiliza deduções anteriores, inflando o desempenho em tarefas de múltiplas etapas. No harness oficial, que descarta o raciocínio após cada ação, a pontuação do mesmo modelo cai para 7,8%, colocando-o bem abaixo do Claude Opus 5.
A OpenAI argumenta que um benchmark deve medir todo o pipeline de inferência, não apenas os pesos neurais brutos. Sob essa perspectiva, o "wrapper" – a lógica da API que preserva e compacta o contexto – faz parte do sistema que está sendo avaliado.
O debate sobre a justiça
François Chollet, cofundador do ARC Prize, que patrocina o benchmark, opinou sobre o assunto. Ele distinguiu entre harnesses personalizados construídos para "resolver" um benchmark e as configurações de API de uso geral que qualquer usuário pode habilitar. Chollet observou que o ambiente de teste original do ARC Prize utilizava uma API de completions no estilo antigo da OpenAI, que carecia dos recursos avançados agora disponíveis na Claude API da Anthropic. Essa incompatibilidade pode ter desfavorecido a OpenAI em rodadas anteriores.
Ele não chegou a declarar a comparação como inválida. Chollet disse que uma afirmação de confronto direto continua sendo aceitável se as configurações exatas e quaisquer custos associados forem divulgados. A transparência, argumentou ele, permite que a comunidade avalie se a diferença decorre da arquitetura do modelo, de truques de engenharia ou de ambos.
Quem ganha, quem perde
Se a pontuação mais alta for aceita como verdadeira, a OpenAI ganha um impulso na percepção pública e uma posição de negociação mais forte em conversas de licenciamento empresarial. A equipe do Claude pode apontar para o desempenho do modelo bruto no harness padronizado como evidência de que sua arquitetura é mais eficiente quando despojada de camadas extras de engenharia.
Pesquisadores e desenvolvedores que dependem de rankings de benchmarks para orientar investimentos podem achar o episódio inquietante. O caso mostra que, à medida que os modelos crescem, o software que orquestra sua inferência pode se tornar decisivo. Empresas que entregam stacks de inferência sofisticados com baixo custo marginal podem dominar as manchetes de pontuação sem possuir um modelo subjacente superior.
O que vem a seguir para o ARC-AGI-3 e outros benchmarks
A disputa provavelmente levará os organizadores do ARC Prize a adotarem regras mais rígidas sobre as configurações de inferência permitidas. As respostas possíveis incluem:
- Publicar uma pontuação de "baseline" que reflita o desempenho apenas com o harness oficial.
- Exigir que os participantes enviem uma análise de custo de quaisquer configurações adicionais, para que uma pontuação alta possa ser ponderada em relação ao custo extra de computação ou de engenharia.
- Adicionar uma trilha separada de "nível de sistema" que recompense o uso inteligente de recursos de gerenciamento de contexto.
Tais medidas forçariam uma separação mais clara entre a capacidade bruta do modelo e a otimização de engenharia, tornando as futuras afirmações mais fáceis de comparar.
Contra-argumento: Benchmarks devem refletir o uso no mundo real
Um lado argumenta que a visão estrita de "apenas modelo bruto" é irrealista. Em produção, os desenvolvedores rotineiramente aplicam camadas de cache, sumarização de contexto e outros truques aos modelos de linguagem. Se um benchmark visa prever a utilidade prática, ele deve permitir — ou até mesmo incentivar — essas otimizações. Sob esse ângulo, o Retained Reasoning e o Compaction da OpenAI são ferramentas legítimas que qualquer concorrente poderia adotar, desde que sejam documentadas publicamente.
Os críticos argumentam que, sem uma linha de base comum, as pontuações tornam-se um alvo móvel, erodindo o papel do benchmark como uma medida objetiva. A tensão entre validade ecológica (refletindo implementações reais) e pureza metodológica (isolando o modelo) alimenta a controvérsia atual.
Conclusão
A alegação do GPT-5.6 Sol destaca uma divisão crescente na avaliação de IA: o talento bruto do modelo versus o ecossistema de engenharia que o extrai. Enquanto a comunidade exigir a divulgação total das configurações de inferência e seus custos, o debate se intensificará, em vez de obscurecer nossa visão do progresso em direção à inteligência geral.
