OpenAI는 자사의 GPT-5.6 Sol 모델이 ARC-AGI-3 논리 추론 벤치마크에서 38.3%의 성공률을 기록하며, 30.2%를 기록한 Anthropic의 Claude Opus 5를 앞질렀다고 밝혔습니다. 이러한 격차는 공식 테스트 하네스(harness)에서는 허용되지 않는 두 가지 추론 시 트릭(inference-time tricks)을 추가하는 OpenAI의 커스텀 Responses API를 통해 모델을 실행할 때만 나타납니다.

서막: 벤치마크 군비 경쟁

ARC-AGI-3는 암기된 사실에 의존하지 않고 새롭고 다단계적인 문제를 해결하는 모델의 능력을 조사합니다. 올해 초 Anthropic은 이 벤치마크에서 4배의 도약을 발표하며 Opus 5를 공개 리더보드 최상단에 올려놓았습니다. 공식 하네스는 각 단계 이후의 모든 중간 추론 과정을 폐기하여 모델이 매번 처음부터 다시 시작하도록 강제하기 때문에, 해당 결과는 "순수(raw)" 모델 능력의 새로운 기준점이 되었습니다.

OpenAI의 주장은 이러한 경쟁적인 분위기 속에서 나왔습니다. 더 높은 점수를 발표함으로써, 이 회사는 자사의 최신 세대가 주요 경쟁사의 논리적 성능에 필적할 뿐만 아니라 이를 능가할 수 있음을 시사합니다. 하지만 헤드라인 이면에는 커뮤니티가 벤치마크 표를 해석하는 방식을 재편하고 있는 기술적 뉘앙스가 숨겨져 있습니다.

수치가 실제로 의미하는 것

GPT-5.6 Sol을 Opus 5가 30.2%의 결과를 얻었던 것과 동일한 공식 ARC-AGI-3 하네스에서 평가하면, 모델의 성공률은 7.8%로 급락합니다. 이러한 차이는 오류가 아니라 OpenAI가 모델과 함께 제공하는 두 가지 설계된 기능의 결과입니다:

  • Retained Reasoning – 각 하위 작업이 끝날 때마다 사고의 사슬(chain-of-thought)을 삭제하는 대신, 시스템이 중간 텍스트를 유지하여 모델이 이전의 추론 내용을 참조하고 누적된 논거를 구축할 수 있도록 합니다.
  • Compaction – 토큰 제한을 준수하기 위해 오래된 컨텍스트를 잘라내는 대신, 래퍼(wrapper)가 이전 단계들을 짧은 요약본으로 압축하여 프롬프트 크기를 관리 가능한 수준으로 유지하면서도 논리적 흐름을 보존합니다.

두 메커니즘 모두 독점적인 Responses API에 포함되어 있습니다. 모델에 더 풍부하고 연속적인 컨텍스트를 제공함으로써, OpenAI는 모델의 "메모리"를 효과적으로 증강하고 모델이 자신의 추론을 재사용할 수 있게 합니다. 반면, 공식 하네스는 이러한 이점들을 제거하는 엄격한 "상태 비저장(stateless)" 모드를 강제합니다.

방법론이 중요한 이유

이번 사례는 AI 평가에서 커지는 격차, 즉 순수 모델 점수와 시스템 수준 성능 간의 분리를 극명하게 보여줍니다. OpenAI는 벤치마크가 개발자가 실제로 배포하게 될 전체 스택(모델, 추론 파이프라인, 메모리 관리)을 반영해야 한다고 주장합니다. 이러한 관점에서 보면, 38.3%라는 점수는 결합된 솔루션이 단독으로 평가된 모델보다 더 많은 실세계 작업을 해결할 수 있음을 제품 팀에 알려줍니다.

비판론자들은 이것이 과학적 진보를 흐린다고 말합니다. 만약 모든 연구소가 맞춤형 래퍼를 추가한다면, 리더보드는 모델 지능의 깨끗한 비교가 아닌 엔지니어링 트릭의 짜깁기가 될 것입니다. 공식 ARC-AGI-3 하네스는 공정한 경쟁 환경을 조성하여, 높은 점수가 더 똑똑한 래퍼가 아닌 진정으로 더 강력한 기반 모델을 의미하도록 보장하기 위해 존재합니다.

개발자와 투자자를 위한 이해관계

AI 기반 제품을 구축하는 스타트업에게 이 차이는 실질적입니다. 추론을 유지하고 컨텍스트를 압축할 수 있는 모델은 해결책에 도달하기 위해 더 적은 프롬프트 엔지니어링, 더 낮은 추론 지연 시간(latency), 더 적은 API 호출을 필요로 할 수 있습니다. 이는 더 저렴한 컴퓨팅 비용과 더 매끄러운 사용자 경험으로 이어집니다. 모델과 최적화된 추론 레이어를 결합한 턴키(turnkey) 시스템을 출시하는 기업은 속도와 비용이 중요한 분야에서 경쟁 우위를 점하게 됩니다.

투자자들은 벤치마크 점수의 상승을 미래 수익의 대리 지표로 관찰합니다. 기반 모델의 순수 능력이 경쟁사와 비슷하더라도, 헤드라인을 장식하는 격차는 기업의 가치를 높일 수 있습니다. 따라서 수치가 무엇을 나타내는가에 대한 논쟁은 AI 섹터 전반의 자본 흐름에 영향을 미칩니다.

향후 주목해야 할 점

  • 표준 설정자의 대응 – 벤치마크 주최 측은 "외부" 추론 트릭에 대한 규칙을 강화하거나, 이를 명시적으로 허용하는 별도의 "시스템" 트랙을 추가할 수 있습니다. 이들의 대응이 차세대 공개 리더보드의 흐름을 결정할 것입니다.
  • 오픈 소스 래퍼 – 커뮤니티에서 추론 유지 및 압축 기능에 대한 자체 구현체를 출시한다면, 이러한 이점은 독점적인 우위가 아닌 기본 기능이 될 수 있습니다.
  • 실세계 테스트베드 – 기업들은 점점 더 자체적인 문제 세트(예: 내부 코드 생성 스위트)에 대한 성능을 게시하고 있습니다. 이러한 결과는 비교 가능성은 낮지만, 단일 공개 벤치마크보다 더 중요해지기 시작할 것입니다.

반론: 이것은 벤치마크를 "악용(gaming)"하는 것인가?

일부 연구자들은 커스텀 API의 사용을 "벤치마크 게이밍(benchmark gaming)"이라고 부르며, 이것이 모델의 핵심 이해도를 높이지 않으면서 점수만 부풀린다고 주장합니다. 그들은 엄격한 제약 조건 하에서 성능이 한 자릿수로 급락하는 모델은 여전히 AGI 목표와는 거리가 멀다고 지적합니다. 우려는 이 분야가 추론 능력의 진정한 도약보다는 엔지니어링 측면의 지름길에 보상을 주기 시작할 수 있다는 점입니다.

OpenAI 측은 모델과 시스템 사이의 경계가 점점 더 인위적으로 변하고 있다고 강조합니다. 현대의 AI 애플리케이션은 모델을 단독으로 실행하는 경우가 거의 없습니다. 항상 캐싱, 컨텍스트 스티칭(context stitching), 출력 후처리(post-processing)를 담당하는 서빙 레이어 뒤에서 작동합니다. 이러한 관점에서 보면, 전체 파이프라인을 측정하는 것이 사용자가 실제로 경험하는 바를 더 정직하게 반영합니다.

시사점

GPT-5.6 Sol 사례는 오늘날의 벤치마크 승리가 모델 크기만큼이나 추론 엔지니어링(inference engineering)에 달려 있음을 보여줍니다. 커뮤니티가 시스템 수준의 점수를 수용할지, 아니면 커스텀 래퍼(custom wrappers)를 규제할지에 따라 다음 "리더보드" 헤드라인을 어떻게 해석할지가 결정될 것입니다. AI 제품을 구축하거나 자금을 지원하는 모든 이들에게 교훈은 명확합니다. 수치 자체도 중요하지만, 이를 둘러싼 소프트웨어가 실제 성능을 결정짓는 결정적인 요소가 될 수 있다는 점입니다.