Ollama 0.32.14 припиняє підтримку GPU для відеокарт серії RTX 30, оскільки з бінарного файлу вилучено ядра CUDA sm_86. Через це під час виконання програма непомітно перемикається на CPU, і генерація моделей сповільнюється до мінімуму.
Що змінилося в 0.32.14
Новий бінарний файл зібрано лише для архітектур обчислень 7.5, 8.9, 10.0 та 12.0. Архітектура 8.6 — кодова назва для NVIDIA RTX 30-серії, A40 та A6000 — відсутня. Коли запускний файл шукає відповідне ядро, він не знаходить жодного, повідомляє про «розрив» (split) GPU в ollama ps, а потім продовжує роботу без прискорення.
Чому старий механізм відкату більше не працює
У попередніх релізах був передбачений резервний шлях: якщо основні ядра не працювали, завантажувалася бібліотека CUDA 12. Ця бібліотека все ще містила код для sm_86, що дозволяло тому самому обладнанню запускати модель. У версії 0.32.14 код відкату було ненавмисно видалено, тому запускний файл повністю ігнорує GPU і працює на центральному процесорі хоста.
Хто відчує на собі наслідки
Усі, хто використовує RTX 3080, 3080 Ti, 3090, 3090 Ti, A40, A6000 або будь-яку іншу карту на базі обчислювальної потужності 8.6, помітять уповільнення. Зміна непомітна — жодних повідомлень про помилки чи збоїв — лише відчутне падіння пропускної здатності.
Як перевірити, чи працюєте ви на CPU
- Запустіть генерацію і в іншому терміналі виконайте
nvidia-smi. Якщо в колонці «Memory-Used» залишається 0 MiB, робота виконується на CPU. - Перевірте логи Ollama на наявність рядка, що містить
library=CUDA compute=8.6. Його відсутність підтверджує, що механізм відкату не спрацював. - Порівняйте кількість токенів на секунду з відомим базовим показником GPU; велика модель, яка потребувала хвилин у попередніх релізах, тепер працюватиме десятки хвилин.
Встановлення змінних середовища, таких як CUDA_VISIBLE_DEVICES, не вирішує проблему, оскільки відсутність ядер є наслідком пропуску під час компіляції, а не прапорцем під час виконання.
Швидке рішення: зафіксуйте версію 0.32.13
Windows
- Видаліть поточну інсталяцію Ollama.
- Завантажте інсталятор 0.32.13 зі сторінки релізів проєкту на GitHub.
- Запустіть інсталятор і перезапустіть службу Ollama.
Linux
sudo systemctl stop ollama
# replace <package> with the 0.32.13 .deb or .rpm you downloaded
sudo dpkg -i <package> # for Debian-based
# or sudo rpm -Uvh <package> # for RPM-based
sudo systemctl start ollama
Після відкату версії повторно виконайте перевірку nvidia-smi; ви маєте побачити ненульове використання VRAM і різке зростання швидкості генерації.
На що звернути увагу у майбутніх релізах
Вилучення sm_86, схоже, є помилкою у скрипті збірки, а не навмисною відмовою від підтримки. Поки розробники не відновлять відсутні ядра або не знову увімкнуть відкат до CUDA 12, будь-яке оновлення вище 0.32.13 несе такий самий ризик. Стежте за трекером проблем проєкту на предмет патча, який знову додасть ядра 8.6, і перевіряйте використання GPU одразу після кожного оновлення.
Підсумок: реліз 0.32.14 ненавмисно вимикає прискорення для серії RTX 30. Перевіряйте активність GPU за допомогою nvidia-smi, і якщо ви використовуєте ці карти, відкотіться до версії 0.32.13, поки відсутні ядра не будуть відновлені.
