Ollama 0.32.14 menghilangkan dukungan GPU untuk kartu seri RTX 30 dengan menghapus kernel CUDA sm_86, sehingga runtime secara diam-diam beralih ke CPU dan pembuatan model melambat drastis.
Apa yang berubah di 0.32.14
Biner baru ini hanya dibangun untuk arsitektur komputasi 7.5, 8.9, 10.0, dan 12.0. Arsitektur 8.6 – nama kode untuk NVIDIA seri RTX 30, A40, dan A6000 – tidak ada. Saat launcher mencari kernel yang cocok, ia tidak menemukannya, melaporkan "split" GPU di ollama ps, lalu berlanjut tanpa akselerasi.
Mengapa fallback lama tidak lagi berfungsi
Rilis sebelumnya menyertakan jalur sekunder yang, jika kernel utama gagal, akan memuat pustaka CUDA 12. Pustaka tersebut masih berisi kode untuk sm_86, sehingga perangkat keras yang sama dapat menjalankan model tersebut. Pada 0.32.14, kode fallback tersebut tidak sengaja dihapus, sehingga launcher melewati GPU sepenuhnya dan berjalan pada prosesor host.
Siapa yang merasakan dampaknya
Siapa pun yang menggunakan RTX 3080, 3080 Ti, 3090, 3090 Ti, A40, A6000, atau kartu lain apa pun yang berbasis compute capability 8.6 akan mengalami perlambatan. Perubahan ini tidak terlihat – tidak ada pesan kesalahan, tidak ada crash – hanya penurunan throughput yang nyata.
Cara memverifikasi bahwa Anda menggunakan CPU
- Mulai proses pembuatan (generation) dan, di terminal lain, jalankan
nvidia-smi. Jika kolom “Memory-Used” tetap di 0 MiB, maka pekerjaan dilakukan di CPU. - Periksa log Ollama untuk baris yang berisi
library=CUDA compute=8.6. Jika tidak ada, itu mengonfirmasi bahwa fallback tidak pernah dijalankan. - Bandingkan angka token-per-detik dengan baseline GPU yang sudah diketahui; model besar yang membutuhkan waktu beberapa menit pada rilis sebelumnya kini akan memakan waktu puluhan menit.
Mengatur variabel lingkungan seperti CUDA_VISIBLE_DEVICES tidak memperbaiki masalah ini karena hilangnya kernel tersebut adalah penghilangan pada saat kompilasi (compile-time omission), bukan flag saat runtime.
Solusi cepat: kunci ke versi 0.32.13
Windows
- Hapus instalasi Ollama yang ada saat ini.
- Unduh installer 0.32.13 dari halaman rilis GitHub proyek tersebut.
- Jalankan installer dan mulai ulang layanan Ollama.
Linux
sudo systemctl stop ollama
# replace <package> with the 0.32.13 .deb or .rpm you downloaded
sudo dpkg -i <package> # for Debian-based
# or sudo rpm -Uvh <package> # for RPM-based
sudo systemctl start ollama
Setelah downgrade, ulangi pemeriksaan nvidia-smi; Anda seharusnya melihat penggunaan VRAM yang tidak nol dan lonjakan kecepatan pembuatan.
Yang perlu diperhatikan pada rilis mendatang
Penghilangan sm_86 tampaknya merupakan kelalaian dalam skrip build, bukan depresiasi yang disengaja. Sampai pengembang memulihkan kernel yang hilang atau mengaktifkan kembali fallback CUDA 12, pembaruan apa pun di atas 0.32.13 membawa risiko yang sama. Pantau issue tracker proyek untuk patch yang menambahkan kembali kernel 8.6, dan uji penggunaan GPU segera setelah setiap pembaruan.
Intinya: rilis 0.32.14 secara tidak sengaja menonaktifkan akselerasi seri RTX 30. Verifikasi aktivitas GPU dengan nvidia-smi, dan jika Anda mengandalkan kartu tersebut, kembalikan (roll back) ke versi 0.32.13 hingga kernel yang hilang dipulihkan.
