Kimi K3는 세 가지 고난도 프롬프트—확률 문제, 도르래 관성 시나리오, 복잡한 Python 배낭 채우기 스크립트—에서 한계에 부딪힌 반면, GPT-5.6-SOL은 결승선을 통과했습니다. 이 격차는 다단계 수학, 물리, 코드를 멈춤 없이 추론해야 할 때 토큰 예산 관리와 지연 시간(latency)이 왜 중요한지를 보여줍니다.
이 벤치마크가 중요한 이유
개발자와 연구자들은 종종 실제 상황에서의 동작 방식이 아니라 헤드라인 점수만을 보고 LLM을 선택합니다. 이번 비교 테스트에서 각 모델은 긴 추론 과정을 요구하는 문제에 도전했습니다. GPT-5.6-SOL은 세 영역 모두에서 완전하고 정확한 답변을 내놓은 반면, Kimi K3는 유용한 결과물을 내놓기 전에 토큰 예산을 모두 소진하거나 시간 초과(timeout)가 발생했습니다.
테스트 설정
- 수학 – 패턴 중첩 확률과 기댓값 및 분산(2차 모멘트)을 모두 계산해야 하는 확률 문제.
- 물리 – 도르래의 관성과 스프링 장력이 걸린 케이블이 느슨해질 때의 에너지 손실 모델링.
- 프로그래밍 – 복잡한 의존성과 동점 처리 규칙이 있는 배낭 채우기 문제에 대한 Python 솔루션을 작성하고, 6개의 독립적인 테스트 케이스로 출력을 검증.
수치가 말해주는 것
GPT-5.6-SOL
- 수학 – 기댓값과 분산이 명확하게 정리된 완전하고 정확한 솔루션을 생성했습니다.
- 물리 – 관성 모델을 정확하게 구축하고 에너지 손실을 계산하여 분석적 정답과 일치하는 결과를 냈습니다.
- 프로그래밍 – 컴파일 및 실행이 가능하며 6개의 외부 체크를 모두 통과하는 코드를 생성했습니다. 다만, 내부 테스트 단언(assertion) 하나가 틀렸는데, 이는 모델이 생성한 테스트가 완벽하지 않을 수 있음을 상기시켜 줍니다.
Kimi K3
- 수학 – 토큰 한계치(처음에는 6,500 토큰, 이후 10,000 토큰)에 도달하여 아무런 답변도 보여주지 못한 채 중단되었습니다.
- 물리 – 가시적인 출력이 나타나기 전에 토큰이 소진되었습니다.
- 프로그래밍 – 245초 후 시간 초과가 발생하여 평가할 결과물을 전혀 내놓지 못했습니다.
추론 효율성 vs. 원시 성능
프로덕션 파이프라인을 구축하는 사람들에게 시사하는 바는 명확합니다. 결과물을 내놓지 못한 채 토큰만 소모하는 모델은 다운스트림 프로세스를 중단시키고, 비용을 증가시키며, 사용자를 좌절시킬 수 있습니다.
신뢰성과 "완벽한" 코드의 숨겨진 비용
승리한 모델조차 실수를 했습니다. GPT-5.6-SOL이 스스로 생성한 테스트 케이스에 잘못된 단언(assertion)이 포함되어 있었습니다. 이는 모델이 생성한 검증이 인간의 검토를 대체할 수 없음을 보여줍니다. 모델이 코드를 작성할 때도 여전히 독립적인 확인 절차가 필요합니다.
향후 주목해야 할 사항
- 종료 사유 추적(Finish reason tracking) – 응답이 토큰 제한, 시간 초과 또는 자연스러운 종료 중 무엇 때문에 끝났는지 기록하십시오.
- 추론 토큰 수(Reasoning token count) – 각 모델이 최종 출력 대 내부 추론에 얼마나 많은 토큰을 사용하는지 비교하십시오.
- 지연 시간 모니터링(Latency monitoring) – 각 단계의 실제 경과 시간(wall-clock time)을 측정하십시오. 쿼리당 몇 분씩 걸리는 모델은 대화형 앱에 부적합할 수 있습니다.
개발자는 이러한 지표를 단순한 최종 답변이 아닌, 최우선적으로 고려해야 할 신호로 취급해야 합니다.
요약
GPT-5.6-SOL은 완성도 면에서 Kimi K3를 압도합니다. 또한 이번 테스트는 "정답을 맞히는" 모델이라 할지라도 결함이 있는 내부 검증을 생성할 수 있음을 상기시켜 주므로, 인간의 감독은 여전히 필수적입니다. 종료 사유, 토큰 사용량 및 지연 시간을 추적하면 예기치 않은 시간 초과에 빠지지 않고 작업에 적합한 도구를 선택하는 데 도움이 될 것입니다.
