Kimi K3, l'ultimo modello open-weights del team Kimi, è dotato di un'architettura mixture-of-experts (MoE) da 2,8 trilioni di parametri e di una finestra di contesto da 1 milione di token, ampliando istantaneamente ciò che gli sviluppatori possono eseguire localmente senza il vincolo di un'API chiusa.

Il design MoE limita il numero di parametri attivi a 104 miliardi, offrendo la capacità di ragionamento di un modello da svariati trilioni di parametri pur mantenendo una velocità costante. Questa efficienza garantisce un incremento di 2,5× rispetto alla precedente versione Kimi K2: un salto in avanti per chiunque abbia raggiunto i limiti di calcolo o di latenza con gli attuali modelli open.

Perché l'aggiornamento è importante ora

I modelli open-weights sono tradizionalmente rimasti indietro rispetto ai sistemi proprietari in termini di scala e lunghezza del contesto. Kimi K3 ribalta la situazione accoppiando una dimensione massiccia a una finestra di contesto che ospita un milione intero di token, sufficienti per elaborare un intero repository di codice o un lungo articolo di ricerca in un unico passaggio. Per gli sviluppatori che costruiscono pipeline di retrieval-augmented generation (RAG), assistenti per testi lunghi o strumenti di debugging autonomi, l'estensione del contesto riduce la necessità di strategie di chunking.

L'impalcatura tecnica

  • Stable LatentMoE routing: i token vengono smistati tra 896 esperti, con 16 esperti attivati per ogni token. Questa attivazione sparsa riduce l'impronta di memoria pur attingendo a un enorme pool di conoscenze.
  • Kimi Delta Attention (KDA): una nuova variante dell'attention che stabilizza il flusso di informazioni nelle reti profonde, riducendo il rischio di instabilità del gradiente che può affliggere i modelli molto grandi.
  • Expert-parallel training: il team ha organizzato il calcolo in modo che ogni esperto giri sulla propria porzione di hardware, prevenendo i colli di bottiglia che si verificano quando molti esperti competono per le stesse risorse.
  • Gestione avanzata della memoria: strategie di allocazione personalizzate consentono al modello di supportare l'addestramento di agenti basati sul reinforcement learning senza esaurire la memoria della GPU.

Cosa consentono i pesi aperti

Poiché i pesi sono pubblici, gli utenti possono sottoporre ad audit le rappresentazioni interne del modello, individuare bias o adattarlo a domini di nicchia. Il fine-tuning su dati proprietari non richiede più un contratto cloud; l'intera pipeline può essere eseguita su hardware on-prem che soddisfi i requisiti di expert-parallel del team.

Casi d'uso immediati per gli sviluppatori

  • Sistemi di retrieval-augmented generation che attingono da enormi archivi di documenti in un singolo prompt.
  • Assistenti alla programmazione per testi lunghi che mantengono l'intero contesto del progetto in memoria.
  • Strumenti di analisi del codice su scala repository che scansionano milioni di righe senza superare i limiti del prompt.
  • Agenti di debugging autonomi che mantengono una traccia completa dell'esecuzione mentre ragionano sulle correzioni.