L'LLM da 180 milioni di parametri su un chip da 10 dollari
Un nuovo progetto chiamato p-for-llm sta facendo qualcosa di impressionante. Esegue un modello da 180,9 milioni di parametri su un microcontrollore ESP32-P4. Questo chip costa tra i sei e i dieci dollari.
La maggior parte dei progetti AI virali su chip piccoli si concentra su compiti semplici. Mostrano un modello che scrive brevi storie. Spesso questi modelli hanno pochissimi parametri e nessuna utilità reale.
p-for-llm è diverso. Mira all'utilità.
Ecco come funziona:
- Utilizza un'architettura Mixture-of-Experts (MoE).
- Per ogni token, il router sceglie un esperto su 29.
- Gli altri 28 esperti rimangono inattivi.
- Questo risparmia potenza di calcolo mantenendo un'elevata conoscenza.
- Utilizza pesi ternari per far rientrare il modello in una memoria ridotta.
- Il modello genera circa 9 token al secondo.
Anche il processo di addestramento è degno di nota. Lo sviluppatore ha utilizzato una singola scheda grafica consumer RTX 5060 Ti. Non c'è un laboratorio massiccio o un budget enorme. Solo una persona con una GPU di fascia media e molta pazienza.
C'è un dettaglio da tenere a mente. Il modello non è ancora completamente autonomo. È necessario caricare i pesi sulla scheda tramite USB all'avvio. Non è ancora un dispositivo standalone che carica i dati da una scheda SD.
Non si tratta ancora di una demo in cloud. I calcoli avvengono localmente sul chip. Questo è un passo avanti enorme rispetto ai progetti che si limitano a trasmettere dati a un server.
Perché tutto questo è importante?
I modelli piccoli di solito si scontrano con un limite invalicabile. Possono essere affascinanti, ma non sanno seguire le istruzioni. p-for-llm tenta di superare questo ostacolo. Supporta i prompt ChatML e mostra i primi segni di tool calling.
Questo progetto dimostra che il vero progresso spesso avviene in silenzio. Mentre i progetti virali cercano i titoli dei giornali, i costruttori seri pubblicano i propri limiti e le proprie note a piè di pagina.
Testerò personalmente questo hardware per verificare questi numeri.
Community di apprendimento opzionale: https://t.me/GyaanSetuAi
