VIDRAFT의 3,980억 매개변수 모델인 Darwin-398B-JGOS가 단 24개의 GPU만을 사용하여 GPQA Diamond 리더보드에서 3위를 차지했습니다. 이 결과는 암기된 답변이 아닌 진정한 과학적 추론을 요구하는 테스트에서, 한국의 작은 스타트업이 세계 최대 규모의 AI 연구소들과 경쟁할 수 있음을 증명합니다.
GPQA Diamond가 중요한 이유
GPQA Diamond는 공개된 웹사이트에 등장하지 않는 대학원 수준의 과학 질문을 던집니다. 정답을 크롤링(scraping)할 수 없기 때문에, 모델은 저장된 사실을 검색하는 대신 문제를 통해 추론해야 합니다. 이 벤치마크는 암기가 아닌 논리력을 요구합니다.
현재 리더보드
- Kimi-K3 (중국): 93.5
- GLM-5.2 (중국): 91.2
- Darwin-398B-JGOS (한국): 90.9
- DeepSeek-V4-Pro (중국): 90.1
- Inkling-Small (미국): 89.5
- Qwen3.5-397B-A17B (중국): 88.4
- Nemotron-3-Ultra-550B (미국): 87.9
Darwin은 일반적인 프로젝트에 사용되는 하드웨어의 극히 일부만을 사용하고 있음에도 불구하고, Nvidia, DeepSeek 및 여러 미국과 중국의 모델들을 앞질렀습니다.
승리의 비결
VIDRAFT는 거대한 GPU 팜을 구축하지 않았습니다. 대신, 팀은 여러 오픈 소스 모델을 반복적으로 결합하고 가장 성능이 좋은 구성 요소를 유지하는 “진화적 병합(evolutionary merging)” 방식을 사용했습니다. 이를 적당한 규모의 24-GPU 클러스터에서 실행함으로써, 처음부터 학습시키는 데 통상적으로 필요한 막대한 자본 투입 없이도 고품질의 3,980억 매개변수 네트워크를 만들어냈습니다.
이것이 AI 분야에 의미하는 바
- 진입 장벽 완화: 엘리트급 AI를 구축하는 데 더 이상 수천 개의 GPU가 필요하지 않습니다.
주의 사항 및 반론
Darwin은 여전히 상위 두 모델에 근소한 차이로 뒤처져 있으며, 3,980억 매개변수라는 크기는 여전히 거대합니다. 즉, 모델을 학습시키거나 서빙하는 데는 여전히 상당한 인프라가 필요합니다. 이 접근 방식은 소규모 클러스터에서 오픈 모델의 진화적 병합에 의존하며, GPQA Diamond가 벤치마크 역할을 했습니다.
향후 주목할 점
시사점은 명확합니다. 영리한 모델 융합 전략이 원시 컴퓨팅 파워의 열세를 상쇄할 수 있으며, 이는 AI 연구의 최고 수준에서 누가 경쟁할 수 있는지를 재편할 것입니다.
