Ollama 0.32.14 rimuove il supporto GPU per le schede RTX serie 30 omettendo i kernel CUDA sm_86, pertanto l'esecuzione passa silenziosamente alla CPU e la generazione del modello rallenta drasticamente.
Cosa è cambiato in 0.32.14
Il nuovo binario è compilato solo per le architetture di calcolo 7.5, 8.9, 10.0 e 12.0. L'architettura 8.6 – il nome in codice per la serie NVIDIA RTX 30, la A40 e la A6000 – è assente. Quando il launcher cerca un kernel corrispondente non ne trova nessuno, segnala uno "split" della GPU in ollama ps e procede senza accelerazione.
Perché il vecchio fallback non funziona più
Le versioni precedenti includevano un percorso secondario che, in caso di fallimento dei kernel primari, caricava la libreria CUDA 12. Quella libreria conteneva ancora il codice per sm_86, consentendo allo stesso hardware di eseguire il modello. In 0.32.14 il codice di fallback è stato rimosso involontariamente, quindi il launcher salta completamente la GPU ed esegue il processo sul processore host.
Chi ne risente
Chiunque utilizzi una RTX 3080, 3080 Ti, 3090, 3090 Ti, la A40, la A6000 o qualsiasi altra scheda basata sulla compute capability 8.6 noterà il rallentamento. Il cambiamento è invisibile – nessun messaggio di errore, nessun crash – solo un calo evidente del throughput.
Come verificare se stai usando la CPU
- Avvia una generazione e, in un altro terminale, esegui
nvidia-smi. Se la colonna "Memory-Used" rimane a 0 MiB, il lavoro è svolto dalla CPU. - Controlla i log di Ollama alla ricerca di una riga contenente
library=CUDA compute=8.6. La sua assenza conferma che il fallback non è mai stato attivato. - Confronta i valori di token al secondo con un benchmark GPU noto; un modello di grandi dimensioni che impiegava minuti nelle versioni precedenti ora impiegherà decine di minuti.
Impostare variabili d'ambiente come CUDA_VISIBLE_DEVICES non risolve il problema perché la mancanza dei kernel è un'omissione in fase di compilazione, non un flag di runtime.
Soluzione rapida: blocca la versione a 0.32.13
Windows
- Disinstalla l'attuale installazione di Ollama.
- Scarica l'installer 0.32.13 dalla pagina dei rilasci GitHub del progetto.
- Esegui l'installer e riavvia il servizio Ollama.
Linux
sudo systemctl stop ollama
# replace <package> with the 0.32.13 .deb or .rpm you downloaded
sudo dpkg -i <package> # for Debian-based
# or sudo rpm -Uvh <package> # for RPM-based
sudo systemctl start ollama
Dopo il downgrade, ripeti il controllo con nvidia-smi; dovresti vedere un utilizzo della VRAM diverso da zero e un incremento della velocità di generazione.
Cosa monitorare nei prossimi rilasci
L'omissione di sm_86 sembra essere una svista nello script di build piuttosto che una deprecazione deliberata. Finché i manutentori non ripristineranno i kernel mancanti o non riabiliteranno il fallback CUDA 12, qualsiasi aggiornamento oltre la versione 0.32.13 comporterà lo stesso rischio. Tieni d'occhio l'issue tracker del progetto per una patch che riaggiunga i kernel 8.6 e testa l'utilizzo della GPU immediatamente dopo ogni aggiornamento.
In sintesi: il rilascio 0.32.14 disabilita involontariamente l'accelerazione della serie RTX 30. Verifica l'attività della GPU con nvidia-smi e, se utilizzi queste schede, torna alla versione 0.32.13 finché i kernel mancanti non saranno ripristinati.
