O Ollama 0.32.14 remove o suporte de GPU para placas da série RTX 30 ao omitir os kernels CUDA sm_86, fazendo com que o tempo de execução mude silenciosamente para a CPU e a geração do modelo fique extremamente lenta.
O que mudou no 0.32.14
O novo binário é compilado apenas para as arquiteturas de computação 7.5, 8.9, 10.0 e 12.0. A arquitetura 8.6 – o codinome para a série RTX 30 da NVIDIA, a A40 e a A6000 – está ausente. Quando o inicializador procura por um kernel correspondente, não encontra nenhum, reporta um “split” de GPU no ollama ps e prossegue sem aceleração.
Por que o antigo fallback não funciona mais
Versões anteriores incluíam um caminho secundário que, caso os kernels primários falhassem, carregava a biblioteca CUDA 12. Essa biblioteca ainda continha código para sm_86, permitindo que o mesmo hardware executasse o modelo. No 0.32.14, o código de fallback foi removido involuntariamente, então o inicializador ignora a GPU completamente e executa no processador host.
Quem sente o impacto
Qualquer pessoa que use uma RTX 3080, 3080 Ti, 3090, 3090 Ti, a A40, a A6000 ou qualquer outra placa baseada na capacidade de computação 8.6 notará a lentidão. A mudança é invisível – sem mensagens de erro, sem travamentos – apenas uma queda perceptível na taxa de processamento.
Como verificar se você está usando a CPU
- Inicie uma geração e, em outro terminal, execute
nvidia-smi. Se a coluna “Memory-Used” permanecer em 0 MiB, o trabalho está sendo feito na CPU. - Verifique os logs do Ollama em busca de uma linha contendo
library=CUDA compute=8.6. A ausência dela confirma que o fallback nunca foi acionado. - Compare os números de tokens por segundo com uma linha de base de GPU conhecida; um modelo grande que levava minutos em versões anteriores agora levará dezenas de minutos.
Configurar variáveis de ambiente como CUDA_VISIBLE_DEVICES não resolve o problema, pois a ausência dos kernels é uma omissão em tempo de compilação, não uma flag de tempo de execução.
Solução rápida: fixar na versão 0.32.13
Windows
- Desinstale a instalação atual do Ollama.
- Baixe o instalador 0.32.13 na página de releases do GitHub do projeto.
- Execute o instalador e reinicie o serviço do Ollama.
Linux
sudo systemctl stop ollama
# replace <package> with the 0.32.13 .deb or .rpm you downloaded
sudo dpkg -i <package> # for Debian-based
# or sudo rpm -Uvh <package> # for RPM-based
sudo systemctl start ollama
Após o downgrade, repita a verificação com nvidia-smi; você deve ver um uso de VRAM diferente de zero e um salto na velocidade de geração.
O que observar em lançamentos futuros
A omissão do sm_86 parece ser um descuido no script de build, em vez de uma depreciação deliberada. Até que os mantenedores restaurem os kernels ausentes ou reativem o fallback do CUDA 12, qualquer atualização além da 0.32.13 traz o mesmo risco. Fique de olho no rastreador de problemas (issue tracker) do projeto para um patch que readicione os kernels 8.6 e teste o uso da GPU imediatamente após cada atualização.
Resumo: o lançamento 0.32.14 desativa involuntariamente a aceleração da série RTX 30. Verifique a atividade da GPU com nvidia-smi e, se você depende dessas placas, faça o rollback para a 0.32.13 até que os kernels ausentes sejam restaurados.
