OpenAI anunció que su modelo GPT-5.6 Sol alcanzó una puntuación del 38,3 por ciento en el benchmark de lógica ARC-AGI-3, superando al Claude Opus 5 de Anthropic, que obtuvo un 30,2 por ciento. La afirmación desató una disputa técnica inmediata porque el mismo modelo obtuvo solo un 7,8 por ciento al ejecutarse a través del entorno de pruebas oficial del benchmark.
Por qué es importante la puntuación de ARC-AGI-3
ARC-AGI-3 pone a prueba la capacidad de un modelo para resolver problemas completamente nuevos y con una gran carga de razonamiento, en lugar de depender de patrones memorizados. Los investigadores citan estas puntuaciones como un indicador del progreso de la "inteligencia general", por lo que una ventaja de diez puntos parece un avance material hacia la resolución de problemas similar a la humana. Eso por sí solo explica por qué el titular causó revuelo en la comunidad de la IA.
La palanca oculta: Retained Reasoning y Compaction
OpenAI no evaluó GPT-5.6 Sol con el entorno de pruebas público. En su lugar, utilizó su propia Responses API con dos opciones patentadas:
- Retained Reasoning – mantiene viva la cadena de pensamiento del modelo a través de múltiples pasos, evitando la pérdida de la lógica intermedia que ocurre cuando cada paso se trata de forma aislada.
- Compaction – comprime el contexto anterior en lugar de cortarlo, permitiendo que el modelo haga referencia a un historial más largo y resumido.
Cuando estos ajustes están activos, el modelo entrelaza argumentos más largos y reutiliza deducciones previas, inflando el rendimiento en tareas de múltiples pasos. En el entorno oficial, que descarta el razonamiento después de cada acción, la puntuación del mismo modelo cae al 7,8 por ciento, situándolo muy por debajo de Claude Opus 5.
OpenAI sostiene que un benchmark debería medir todo el proceso de inferencia, no solo los pesos neuronales brutos. Desde esa perspectiva, el "wrapper" —la lógica de la API que preserva y compacta el contexto— pertenece al sistema que se está evaluando.
El debate sobre la equidad
François Chollet, cofundador del ARC Prize que patrocina el benchmark, intervino en el debate. Distinguió entre los entornos personalizados creados para "resolver" un benchmark y los ajustes de la API de propósito general que cualquier usuario puede habilitar. Chollet señaló que el entorno de pruebas original del ARC Prize utilizaba una API de completado (completions API) de estilo OpenAI más antigua, que carecía de las funciones avanzadas que ahora están disponibles en la API de Claude de Anthropic. Ese desajuste podría haber perjudicado a OpenAI en rondas anteriores.
No llegó a declarar que la comparación fuera inválida. Chollet afirmó que una comparativa directa sigue siendo aceptable si se revelan los ajustes exactos y cualquier coste asociado. La transparencia, argumentó, permite a la comunidad evaluar si la brecha se debe a la arquitectura del modelo, a trucos de ingeniería o a ambos.
Quién gana y quién pierde
Si la puntuación más alta se acepta tal cual, OpenAI obtiene un impulso en la percepción pública y una posición de negociación más fuerte en las conversaciones sobre licencias empresariales. El equipo de Claude puede señalar el rendimiento del modelo bruto en el entorno estandarizado como prueba de que su arquitectura es más eficiente cuando se despoja de capas de ingeniería adicionales.
Los investigadores y desarrolladores que confían en las clasificaciones de los benchmarks para guiar sus inversiones pueden encontrar este episodio inquietante. El caso demuestra que, a medida que los modelos crecen, el software que orquestra su inferencia puede volverse decisivo. Las empresas que ofrecen pilas de inferencia sofisticadas a un bajo coste marginal podrían dominar las puntuaciones de los titulares sin tener un modelo subyacente superior.
Qué sigue para ARC-AGI-3 y otros benchmarks
Es probable que la disputa empuje a los organizadores del ARC Prize hacia reglas más estrictas sobre las configuraciones de inferencia permitidas. Las posibles respuestas incluyen:
- Publicar una puntuación de "línea base" (baseline) que refleje el rendimiento únicamente con el entorno oficial.
- Exigir a los participantes que presenten un análisis de costes de cualquier ajuste adicional, para que una puntuación alta pueda sopesarse frente al coste computacional o de ingeniería adicional.
- Añadir una categoría separada de "nivel de sistema" que recompense el uso inteligente de las funciones de gestión de contexto.
Tales medidas forzarían una separación más clara entre la capacidad bruta del modelo y la optimización de ingeniería, facilitando la comparación de futuras afirmaciones.
Contraargumento: Los benchmarks deberían reflejar el uso en el mundo real
Una parte sostiene que la visión estricta de "solo modelo bruto" es poco realista. En producción, los desarrolladores suelen añadir capas de caché, resumen de contexto y otros trucos a los modelos de lenguaje. Si un benchmark pretende predecir la utilidad práctica, debería permitir —o incluso fomentar— esas optimizaciones. Desde ese ángulo, Retained Reasoning y Compaction de OpenAI son herramientas legítimas que cualquier competidor podría adoptar, siempre que estén documentadas públicamente.
Los críticos argumentan que, sin una base común, las puntuaciones se convierten en un objetivo móvil, erosionando el papel del benchmark como una medida objetiva. La tensión entre la validez ecológica (que refleja despliegues reales) y la pureza metodológica (que aísla el modelo) alimenta la controversia actual.
Conclusión
La afirmación sobre GPT-5.6 Sol pone de relieve una división creciente en la evaluación de la IA: el talento bruto del modelo frente al ecosistema de ingeniería que lo extrae. Mientras la comunidad exija la divulgación completa de los ajustes de inferencia y sus costes, el debate se intensificará en lugar de oscurecer nuestra visión del progreso hacia la inteligencia general.
