Ollama 0.32.14 laat de GPU-ondersteuning voor RTX 30-serie kaarten vallen door de sm_86 CUDA-kernels weg te laten, waardoor de runtime stilletjes terugvalt op de CPU en de generatie van modellen tot een kruipend tempo vertraagt.
Wat er is veranderd in 0.32.14
De nieuwe binary is alleen gebouwd voor compute-architecturen 7.5, 8.9, 10.0 en 12.0. Architectuur 8.6 – de codenaam voor NVIDIA's RTX 30-serie, de A40 en de A6000 – ontbreekt. Wanneer de launcher op zoek gaat naar een bijpassende kernel vindt hij er geen, rapporteert een GPU "split" in ollama ps, en gaat vervolgens verder zonder versnelling.
Waarom de oude fallback niet meer werkt
Eerdere releases bevatten een secundair pad dat, indien de primaire kernels faalden, de CUDA 12-bibliotheek laadde. Die bibliotheek bevatte nog steeds code voor sm_86, waardoor dezelfde hardware het model kon draaien. In 0.32.14 is de fallback-code onbedoeld verwijderd, waardoor de launcher de GPU volledig overslaat en op de host-processor draait.
Wie de impact voelt
Iedereen die een RTX 3080, 3080 Ti, 3090, 3090 Ti, de A40, de A6000 of een andere kaart gebruikt op basis van compute capability 8.6, zal de vertraging merken. De verandering is onzichtbaar – geen foutmelding, geen crash – alleen een merkbare daling in de doorvoersnelheid.
Hoe je kunt controleren of je op de CPU draait
- Start een generatie en voer in een andere terminal
nvidia-smiuit. Als de kolom "Memory-Used" op 0 MiB blijft staan, vindt het werk plaats op de CPU. - Controleer de Ollama-logs op een regel met
library=CUDA compute=8.6. De afwezigheid ervan bevestigt dat de fallback nooit is geactiveerd. - Vergelijk de tokens-per-seconde met een bekende GPU-baseline; een groot model dat in eerdere releases enkele minuten in beslag nam, zal nu tientallen minuten duren.
Het instellen van omgevingsvariabelen zoals CUDA_VISIBLE_DEVICES lost het probleem niet op, omdat de ontbrekende kernels een weglating tijdens het compileren zijn en geen runtime-vlag.
Snelle oplossing: pin naar 0.32.13
Windows
- Verwijder de huidige Ollama-installatie.
- Download de 0.32.13 installer van de GitHub-releasespagina van het project.
- Voer de installer uit en start de Ollama-service opnieuw op.
Linux
sudo systemctl stop ollama
# replace <package> with the 0.32.13 .deb or .rpm you downloaded
sudo dpkg -i <package> # for Debian-based
# or sudo rpm -Uvh <package> # for RPM-based
sudo systemctl start ollama
Herhaal na de downgrade de nvidia-smi-controle; je zou een VRAM-gebruik groter dan nul moeten zien en een sprong in de generatiesnelheid.
Waar je op moet letten bij toekomstige releases
Het weglaten van sm_86 lijkt een vergissing in het build-script te zijn in plaats van een bewuste stopzetting. Totdat de onderhouders de ontbrekende kernels herstellen of de CUDA 12-fallback opnieuw inschakelen, brengt elke upgrade boven 0.32.13 hetzelfde risico met zich mee. Houd de issue tracker van het project in de gaten voor een patch die de 8.6-kernels opnieuw toevoegt, en test het GPU-gebruik direct na elke update.
Conclusie: de 0.32.14 release schakelt onbedoeld de versnelling voor de RTX 30-serie uit. Controleer de GPU-activiteit met nvidia-smi, en als je afhankelijk bent van die kaarten, ga dan terug naar 0.32.13 totdat de ontbrekende kernels zijn hersteld.
