Ollama 0.32.14 lässt die GPU-Unterstützung für RTX 30-Serie-Karten weg, indem die sm_86 CUDA-Kernel ausgelassen werden. Dadurch fällt die Laufzeit lautlos auf die CPU zurück, und die Modellgenerierung verlangsamt sich massiv.

Was sich in 0.32.14 geändert hat

Die neue Binärdatei wurde nur für die Compute-Architekturen 7.5, 8.9, 10.0 und 12.0 erstellt. Die Architektur 8.6 – der Codename für NVIDIAs RTX 30-Serie, die A40 und die A6000 – fehlt. Wenn der Launcher nach einem passenden Kernel sucht, findet er keinen, meldet einen GPU-„Split“ in ollama ps und fährt dann ohne Beschleunigung fort.

Warum der alte Fallback nicht mehr funktioniert

Frühere Versionen enthielten einen sekundären Pfad, der im Falle eines Fehlers der primären Kernel die CUDA 12-Bibliothek lud. Diese Bibliothek enthielt noch Code für sm_86, wodurch dieselbe Hardware das Modell ausführen konnte. In 0.32.14 wurde der Fallback-Code unbeabsichtigt entfernt, sodass der Launcher die GPU komplett überspringt und auf dem Host-Prozessor läuft.

Wer davon betroffen ist

Jeder, der eine RTX 3080, 3080 Ti, 3090, 3090 Ti, die A40, die A6000 oder eine andere Karte mit der Compute Capability 8.6 verwendet, wird die Verlangsamung bemerken. Die Änderung ist unsichtbar – keine Fehlermeldung, kein Absturz – nur ein spürbarer Rückgang des Durchsatzes.

So überprüfen Sie, ob Sie die CPU nutzen

  1. Starten Sie eine Generierung und führen Sie in einem anderen Terminal nvidia-smi aus. Wenn die Spalte „Memory-Used“ bei 0 MiB bleibt, erfolgt die Arbeit auf der CPU.
  2. Suchen Sie in den Ollama-Logs nach einer Zeile, die library=CUDA compute=8.6 enthält. Das Fehlen dieser Zeile bestätigt, dass der Fallback nie ausgelöst wurde.
  3. Vergleichen Sie die Token-pro-Sekunde-Werte mit einem bekannten GPU-Referenzwert; ein großes Modell, das in früheren Versionen Minuten dauerte, wird nun zehn Minuten oder länger benötigen.

Das Setzen von Umgebungsvariablen wie CUDA_VISIBLE_DEVICES behebt das Problem nicht, da das Fehlen der Kernel ein Versäumnis zur Kompilierzeit ist und kein Laufzeit-Flag.

Schnelle Lösung: Version 0.32.13 verwenden

Windows

  • Deinstallieren Sie die aktuelle Ollama-Installation.
  • Laden Sie den 0.32.13-Installer von der GitHub-Releases-Seite des Projekts herunter.
  • Führen Sie den Installer aus und starten Sie den Ollama-Dienst neu.

Linux

sudo systemctl stop ollama
# replace <package> with the 0.32.13 .deb or .rpm you downloaded
sudo dpkg -i <package>   # for Debian-based
# or sudo rpm -Uvh <package>   # for RPM-based
sudo systemctl start ollama

Wiederholen Sie nach dem Downgrade die nvidia-smi-Überprüfung; Sie sollten eine VRAM-Auslastung von mehr als 0 MiB und einen Sprung in der Generierungsgeschwindigkeit sehen.

Worauf Sie in zukünftigen Versionen achten sollten

Das Auslassen von sm_86 scheint eher ein Versehen im Build-Skript als eine bewusste Abkehr zu sein. Bis die Maintainer die fehlenden Kernel wiederherstellen oder den CUDA 12-Fallback reaktivieren, birgt jedes Upgrade über 0.32.13 dasselbe Risiko. Behalten Sie den Issue-Tracker des Projekts im Auge, um einen Patch zu finden, der die 8.6-Kernel wieder hinzufügt, und testen Sie die GPU-Nutzung unmittelbar nach jedem Update.

Fazit: Das Release 0.32.14 deaktiviert unbeabsichtigt die Beschleunigung der RTX 30-Serie. Überprüfen Sie die GPU-Aktivität mit nvidia-smi. Wenn Sie auf diese Karten angewiesen sind, führen Sie ein Rollback auf 0.32.13 durch, bis die fehlenden Kernel wiederhergestellt sind.