Il Thinking Machines Lab di Mira Murati è entrato ufficialmente in gioco con Inkling, un modello open-weight progettato per sfidare il dominio dei giganti dell'IA centralizzati e "one-size-fits-all" (un modello unico per tutti). Puntando sulla personalizzazione invece che sulla pura potenza generalista, la startup afferma che il futuro dell'IA aziendale risiede in un'intelligenza specializzata e ottimizzata localmente.

L'architettura di Inkling: efficienza attraverso MoE

Inkling è un sistema Mixture-of-Experts con un totale massiccio di 975 miliardi di parametri. Tuttavia, ne attiva solo circa 41 miliardi per ogni singola attività, riducendo latenza e costi e preservando al contempo un ragionamento di alto livello. Il modello ha appreso da 45 trilioni di token di testo, immagini, audio e video, acquisendo così capacità multimodali native. L'azienda afferma che Inkling eguaglia il Nemotron 3 Ultra di Nvidia nei benchmark di coding, utilizzando solo un terzo dei token, un chiaro segno di efficienza nell'addestramento.

Una svolta strategica verso la personalizzazione aziendale

A differenza dei prodotti di punta di OpenAI, Anthropic o Google, che funzionano principalmente come chatbot generalisti, Inkling è commercializzato come una base per le organizzazioni. Thinking Machines propone il modello come punto di partenza, esortando le aziende a perfezionarlo con dati proprietari tramite la sua piattaforma "Tinker".

Questa mossa affronta la trappola del "doppio pagamento" del settore. L'amministratore delegato di Microsoft, Satya Nadella, ha avvertito che le aziende pagano due volte: una volta per l'abbonamento e una seconda volta fornendo la propria logica aziendale unica a un modello che, in ultima analisi, arricchisce il set di addestramento del fornitore. Offrendo un modello open-weight, Thinking Machines consente alle imprese di mantenere tale intelligenza internamente.

Infrastruttura ad alto impatto e sviluppo rapido

Thinking Machines è corsa sul mercato. OpenAI ha impiegato circa cinque anni e Anthropic circa tre; Thinking Machines afferma di aver raggiunto un traguardo paragonabile in soli nove mesi.

Per sostenere questa velocità, l'azienda si è affidata all'hardware. Dopo una partnership con Nvidia a marzo, Inkling è stato addestrato interamente sui sistemi GB300 NVL72 di Nvidia. L'azienda ha utilizzato tecniche di distillazione — sfruttando modelli open-weight come Kimi K2.5 di Moonshot AI per le prime fasi di post-addestramento — ma promette di gestire i futuri post-addestramenti interamente in casa.

Punti chiave

  • Vantaggio dell'open-weight: Gli sviluppatori possono scaricare e modificare il modello MoE da 975 miliardi di parametri, mantenendo il controllo lontano dagli ecosistemi chiusi.
  • Design orientato all'efficienza: L'attivazione di soli 41 miliardi di parametri per attività e la riduzione dell'uso dei token consentono al modello di offrire un ragionamento di alto livello a una frazione del costo operativo.
  • La scommessa sulla personalizzazione: Thinking Machines passa dai chatbot generici a "Tinker", una piattaforma che trasforma i modelli di base in asset specializzati per ogni organizzazione.