Mira Murati의 Thinking Machines Lab이 중앙 집중식의 "천편일률적인(one-size-fits-all)" AI 거대 기업들의 독점에 도전하기 위해 구축된 오픈 웨이트(open-weight) 모델인 Inkling과 함께 공식적으로 시장에 뛰어들었습니다. 이 스타트업은 단순한 범용 성능 대신 커스터마이징(customizability)에 승부수를 던지며, 기업용 AI의 미래는 특화되고 로컬에 최적화된 지능에 있다고 말합니다.

Inkling의 아키텍처: MoE를 통한 효율성

Inkling은 총 9,750억 개의 방대한 파라미터를 가진 Mixture-of-Experts(MoE) 시스템입니다. 하지만 단일 작업에는 약 410억 개의 파라미터만 활성화하여, 높은 수준의 추론 능력을 유지하면서도 지연 시간(latency)과 비용을 줄입니다. 이 모델은 45조 개의 텍스트, 이미지, 오디오, 비디오 토큰을 학습하여 네이티브 멀티모달(multimodal) 능력을 갖추었습니다. 회사는 Inkling이 Nvidia의 Nemotron 3 Ultra와 대등한 코딩 벤치마크 성능을 보이면서도 토큰 사용량은 3분의 1에 불과하다고 주장하며, 이는 학습 효율성이 매우 높음을 보여주는 명확한 신호입니다.

기업용 커스터마이징을 향한 전략적 전환

주로 범용 챗봇으로 기능하는 OpenAI, Anthropic 또는 Google의 플래그십 제품들과 달리, Inkling은 조직을 위한 기반(foundation)으로 마케팅됩니다. Thinking Machines는 이 모델을 시작점으로 제시하며, 기업들이 "Tinker" 플랫폼을 통해 자체 데이터를 사용하여 모델을 미세 조정(fine-tune)할 것을 권장합니다.

이러한 행보는 업계의 "이중 결제(double payment)" 함정을 해결합니다. Microsoft의 CEO Satya Nadella는 기업들이 구독료로 한 번, 그리고 결국 제공자의 학습 데이터를 풍부하게 만드는 모델에 고유한 비즈니스 로직을 주입함으로써 또 한 번 비용을 지불하게 된다고 경고한 바 있습니다. Thinking Machines는 오픈 웨이트 모델을 제공함으로써 기업들이 해당 지능을 사내(in-house)에 유지할 수 있도록 합니다.

막대한 인프라와 신속한 개발

Thinking Machines는 시장 진입을 위해 전력 질주했습니다. OpenAI는 약 5년, Anthropic은 약 3년이 걸린 반면, Thinking Machines는 단 9개월 만에 그에 필적하는 이정표에 도달했다고 밝힙니다.

이러한 속도를 뒷받침하기 위해 회사는 하드웨어에 의존했습니다. 지난 3월 Nvidia와의 파트너십 이후, Inkling은 전적으로 Nvidia의 GB300 NVL72 시스템에서 학습되었습니다. 회사는 초기 사후 학습(post-training) 단계에서 Moonshot AI의 Kimi K2.5와 같은 오픈 웨이트 모델을 활용하는 증류(distillation) 기법을 사용했지만, 향후 사후 학습은 완전히 자체적으로 수행할 것이라고 약속했습니다.

핵심 요약

  • 오픈 웨이트의 이점: 개발자는 9,750억 파라미터 규모의 MoE 모델을 다운로드하고 수정할 수 있어, 폐쇄적인 생태계로부터 통제권을 유지할 수 있습니다.
  • 효율성 우선 설계: 작업당 410억 개의 파라미터만 활성화하고 토큰 사용량을 줄임으로써, 모델은 운영 비용의 극히 일부만으로 최상위 수준의 추론을 제공합니다.
  • 커스터마이징에 대한 승부수: Thinking Machines는 일반적인 챗봇에서 벗어나, 파운데이션 모델을 각 조직을 위한 특화된 자산으로 변환하는 플랫폼인 "Tinker"로 전환합니다.