Ollama 0.32.14 rezygnuje ze wsparcia GPU dla kart serii RTX 30 poprzez pominięcie jąder (kernels) CUDA sm_86, przez co środowisko uruchomieniowe po cichu przełącza się na procesor (CPU), a generowanie modeli drastycznie zwalnia.
Co zmieniło się w wersji 0.32.14
Nowy plik binarny jest budowany wyłącznie dla architektur obliczeniowych 7.5, 8.9, 10.0 i 12.0. Brakuje architektury 8.6 – nazwy kodowej dla serii NVIDIA RTX 30, kart A40 oraz A6000. Gdy launcher szuka pasującego jądra, nie znajduje go, raportuje „split” GPU w ollama ps, a następnie kontynuuje pracę bez akceleracji.
Dlaczego stary mechanizm fallback nie działa już poprawnie
Poprzednie wersje zawierały ścieżkę zapasową, która w przypadku awarii głównych jąder ładowała bibliotekę CUDA 12. Biblioteka ta wciąż zawierała kod dla sm_86, co pozwalało na uruchamianie modelu na tym samym sprzęcie. W wersji 0.32.14 kod fallback został nieumyślnie usunięty, przez co launcher całkowicie pomija GPU i uruchamia się na procesorze hosta.
Kto odczuje skutki
Każdy użytkownik kart RTX 3080, 3080 Ti, 3090, 3090 Ti, A40, A6000 lub jakiejkolwiek innej karty opartej na wydajności obliczeniowej (compute capability) 8.6 odczuje spowolnienie. Zmiana jest niewidoczna – brak komunikatów o błędach, brak awarii – jedynie zauważalny spadek przepustowości.
Jak sprawdzić, czy używasz procesora (CPU)
- Rozpocznij generowanie i w innym terminalu uruchom
nvidia-smi. Jeśli kolumna „Memory-Used” pozostaje na poziomie 0 MiB, praca odbywa się na CPU. - Sprawdź logi Ollama pod kątem linii zawierającej
library=CUDA compute=8.6. Jej brak potwierdza, że mechanizm fallback nie został uruchomiony. - Porównaj liczbę tokenów na sekundę z bazową wydajnością GPU; duży model, który w poprzednich wersjach wymagał minut, teraz będzie potrzebował dziesiątek minut.
Ustawianie zmiennych środowiskowych, takich jak CUDA_VISIBLE_DEVICES, nie rozwiązuje problemu, ponieważ brakujące jądra to pominięcie na etapie kompilacji, a nie flaga czasu uruchomienia (runtime flag).
Szybka naprawa: powrót do wersji 0.32.13
Windows
- Odinstaluj obecną instalację Ollama.
- Pobierz instalator wersji 0.32.13 ze strony wydawniczej (releases) projektu na GitHubie.
- Uruchom instalator i zrestartuj usługę Ollama.
Linux
sudo systemctl stop ollama
# replace <package> with the 0.32.13 .deb or .rpm you downloaded
sudo dpkg -i <package> # for Debian-based
# or sudo rpm -Uvh <package> # for RPM-based
sudo systemctl start ollama
Po obniżeniu wersji powtórz sprawdzenie za pomocą nvidia-smi; powinieneś zobaczyć niezerowe zużycie pamięci VRAM oraz skok prędkości generowania.
Na co zwrócić uwagę w przyszłych wydaniach
Pominięcie sm_86 wydaje się być przeoczeniem w skrypcie budowania (build script), a nie celowym wycofaniem wsparcia (deprecation). Dopóki utrzymujący nie przywrócą brakujących jąder lub nie ponownie włączą mechanizmu fallback CUDA 12, każda aktualizacja powyżej wersji 0.32.13 niesie ze sobą to samo ryzyko. Śledź zgłoszenia (issue tracker) projektu w poszukiwaniu poprawki przywracającej jądra 8.6 i sprawdzaj użycie GPU natychmiast po każdej aktualizacji.
Podsumowując: wersja 0.32.14 nieumyślnie wyłącza akcelerację dla serii RTX 30. Zweryfikuj aktywność GPU za pomocą nvidia-smi, a jeśli polegasz na tych kartach, wróć do wersji 0.32.13, dopóki brakujące jądra nie zostaną przywrócone.
