Mira Murati’s Thinking Machines Lab est officiellement entré dans la course avec Inkling, un modèle à poids ouverts conçu pour défier la domination des géants de l'IA centralisés et « universels ». En misant sur la personnalisation plutôt que sur la puissance brute à usage général, la startup affirme que l'avenir de l'IA d'entreprise réside dans une intelligence spécialisée et optimisée localement.
L'architecture d'Inkling : l'efficacité grâce au MoE
Inkling est un système Mixture-of-Experts doté d'un total massif de 975 milliards de paramètres. Pourtant, il n'active qu'environ 41 milliards de paramètres pour une tâche donnée, réduisant ainsi la latence et les coûts tout en préservant un raisonnement de haut niveau. Le modèle a été entraîné sur 45 billions de tokens de texte, d'images, d'audio et de vidéo, ce qui lui confère des capacités multimodales natives. L'entreprise affirme qu'Inkling égale le Nemotron 3 Ultra de Nvidia sur les benchmarks de codage tout en utilisant seulement un tiers des tokens, un signe clair d'efficacité d'entraînement.
Un pivot stratégique vers la personnalisation pour les entreprises
Contrairement aux produits phares d'OpenAI, Anthropic ou Google, qui fonctionnent principalement comme des chatbots à usage général, Inkling est commercialisé comme une fondation pour les organisations. Thinking Machines présente le modèle comme un point de départ, incitant les entreprises à l'affiner avec leurs propres données via sa plateforme « Tinker ».
Cette initiative s'attaque au piège du « double paiement » de l'industrie. Le PDG de Microsoft, Satya Nadella, a averti que les entreprises paient deux fois : une fois pour un abonnement et une seconde fois en injectant leur logique métier unique dans un modèle qui, en fin de compte, enrichit le jeu de données d'entraînement du fournisseur. En proposant un modèle à poids ouverts, Thinking Machines permet aux entreprises de conserver cette intelligence en interne.
Une infrastructure à enjeux élevés et un développement rapide
Thinking Machines a lancé son produit à une vitesse fulgurante. Il a fallu environ cinq ans à OpenAI et environ trois ans à Anthropic ; Thinking Machines affirme avoir atteint un jalon comparable en seulement neuf mois.
Pour soutenir cette rapidité, l'entreprise s'est appuyée sur le matériel. Après un partenariat avec Nvidia en mars, Inkling a été entièrement entraîné sur les systèmes GB300 NVL72 de Nvidia. L'entreprise a utilisé des techniques de distillation — en exploitant des modèles à poids ouverts comme le Kimi K2.5 de Moonshot AI pour la phase initiale de post-entraînement — mais s'engage à réaliser ses futurs post-entraînements entièrement en interne.
Points clés à retenir
- Avantage des poids ouverts : Les développeurs peuvent télécharger et modifier le modèle MoE de 975 milliards de paramètres, évitant ainsi de laisser le contrôle aux écosystèmes fermés.
- Conception axée sur l'efficacité : L'activation de seulement 41 milliards de paramètres par tâche et la réduction de l'utilisation des tokens permettent au modèle d'offrir un raisonnement de premier ordre pour une fraction du coût opérationnel.
- Le pari de la personnalisation : Thinking Machines passe des chatbots génériques à « Tinker », une plateforme qui transforme les modèles de fondation en actifs spécialisés pour chaque organisation.
