Ollama 0.32.14 supprime le support GPU pour les cartes de la série RTX 30 en omettant les noyaux CUDA sm_86, de sorte que l'exécution bascule silencieusement sur le CPU et la génération de modèles ralentit considérablement.
Ce qui a changé dans la version 0.32.14
Le nouveau binaire est conçu uniquement pour les architectures de calcul 7.5, 8.9, 10.0 et 12.0. L'architecture 8.6 – le nom de code des séries RTX 30 de NVIDIA, de l'A40 et de l'A6000 – est absente. Lorsque le lanceur recherche un noyau correspondant, il n'en trouve aucun, signale un « split » GPU dans ollama ps, puis procède sans accélération.
Pourquoi l'ancien mode de repli ne fonctionne plus
Les versions précédentes incluaient un chemin secondaire qui, en cas d'échec des noyaux primaires, chargeait la bibliothèque CUDA 12. Cette bibliothèque contenait encore du code pour sm_86, permettant à ce matériel de faire tourner le modèle. Dans la version 0.32.14, le code de repli a été supprimé par inadvertance, de sorte que le lanceur ignore complètement le GPU et s'exécute sur le processeur hôte.
Qui est impacté
Toute personne utilisant une RTX 3080, 3080 Ti, 3090, 3090 Ti, l'A40, l'A6000 ou toute autre carte basée sur la capacité de calcul 8.6 constatera le ralentissement. Le changement est invisible – aucun message d'erreur, aucun plantage – juste une baisse notable du débit.
Comment vérifier que vous utilisez le CPU
- Lancez une génération et, dans un autre terminal, exécutez
nvidia-smi. Si la colonne « Memory-Used » reste à 0 MiB, le travail est effectué par le CPU. - Vérifiez les journaux (logs) d'Ollama pour trouver une ligne contenant
library=CUDA compute=8.6. Son absence confirme que le mode de repli ne s'est jamais activé. - Comparez le nombre de jetons par seconde (tokens per second) par rapport à une référence GPU connue ; un modèle volumineux qui prenait quelques minutes dans les versions précédentes prendra désormais des dizaines de minutes.
Définir des variables d'environnement telles que CUDA_VISIBLE_DEVICES ne résout pas le problème car l'absence des noyaux est une omission lors de la compilation et non un paramètre d'exécution.
Solution rapide : rester sur la version 0.32.13
Windows
- Désinstallez l'installation actuelle d'Ollama.
- Téléchargez l'installateur 0.32.13 depuis la page des versions GitHub du projet.
- Lancez l'installateur et redémarrez le service Ollama.
Linux
sudo systemctl stop ollama
# replace <package> with the 0.32.13 .deb or .rpm you downloaded
sudo dpkg -i <package> # for Debian-based
# or sudo rpm -Uvh <package> # for RPM-based
sudo systemctl start ollama
Après la rétrogradation, répétez la vérification avec nvidia-smi ; vous devriez voir une utilisation de la VRAM non nulle et un bond dans la vitesse de génération.
À surveiller dans les futures versions
L'omission de sm_86 semble être un oubli dans le script de build plutôt qu'une dépréciation délibérée. Tant que les mainteneurs n'auront pas rétabli les noyaux manquants ou réactivé le mode de repli CUDA 12, toute mise à jour au-delà de la version 0.32.13 comporte le même risque. Surveillez le suivi des problèmes (issue tracker) du projet pour un correctif qui réintègre les noyaux 8.6, et testez l'utilisation du GPU immédiatement après chaque mise à jour.
En résumé : la version 0.32.14 désactive involontairement l'accélération de la série RTX 30. Vérifiez l'activité du GPU avec nvidia-smi et, si vous dépendez de ces cartes, revenez à la version 0.32.13 jusqu'à ce que les noyaux manquants soient rétablis.
