O Ollama 0.32.14 remove o suporte de GPU para placas da série RTX 30 ao omitir os kernels CUDA sm_86, fazendo com que o tempo de execução mude silenciosamente para a CPU e a geração do modelo fique extremamente lenta.

O que mudou no 0.32.14

O novo binário é compilado apenas para as arquiteturas de computação 7.5, 8.9, 10.0 e 12.0. A arquitetura 8.6 – o codinome para a série RTX 30 da NVIDIA, a A40 e a A6000 – está ausente. Quando o inicializador procura por um kernel correspondente, não encontra nenhum, reporta um “split” de GPU no ollama ps e prossegue sem aceleração.

Por que o antigo fallback não funciona mais

Versões anteriores incluíam um caminho secundário que, caso os kernels primários falhassem, carregava a biblioteca CUDA 12. Essa biblioteca ainda continha código para sm_86, permitindo que o mesmo hardware executasse o modelo. No 0.32.14, o código de fallback foi removido involuntariamente, então o inicializador ignora a GPU completamente e executa no processador host.

Quem sente o impacto

Qualquer pessoa que use uma RTX 3080, 3080 Ti, 3090, 3090 Ti, a A40, a A6000 ou qualquer outra placa baseada na capacidade de computação 8.6 notará a lentidão. A mudança é invisível – sem mensagens de erro, sem travamentos – apenas uma queda perceptível na taxa de processamento.

Como verificar se você está usando a CPU

  1. Inicie uma geração e, em outro terminal, execute nvidia-smi. Se a coluna “Memory-Used” permanecer em 0 MiB, o trabalho está sendo feito na CPU.
  2. Verifique os logs do Ollama em busca de uma linha contendo library=CUDA compute=8.6. A ausência dela confirma que o fallback nunca foi acionado.
  3. Compare os números de tokens por segundo com uma linha de base de GPU conhecida; um modelo grande que levava minutos em versões anteriores agora levará dezenas de minutos.

Configurar variáveis de ambiente como CUDA_VISIBLE_DEVICES não resolve o problema, pois a ausência dos kernels é uma omissão em tempo de compilação, não uma flag de tempo de execução.

Solução rápida: fixar na versão 0.32.13

Windows

  • Desinstale a instalação atual do Ollama.
  • Baixe o instalador 0.32.13 na página de releases do GitHub do projeto.
  • Execute o instalador e reinicie o serviço do Ollama.

Linux

sudo systemctl stop ollama
# replace <package> with the 0.32.13 .deb or .rpm you downloaded
sudo dpkg -i <package>   # for Debian-based
# or sudo rpm -Uvh <package>   # for RPM-based
sudo systemctl start ollama

Após o downgrade, repita a verificação com nvidia-smi; você deve ver um uso de VRAM diferente de zero e um salto na velocidade de geração.

O que observar em lançamentos futuros

A omissão do sm_86 parece ser um descuido no script de build, em vez de uma depreciação deliberada. Até que os mantenedores restaurem os kernels ausentes ou reativem o fallback do CUDA 12, qualquer atualização além da 0.32.13 traz o mesmo risco. Fique de olho no rastreador de problemas (issue tracker) do projeto para um patch que readicione os kernels 8.6 e teste o uso da GPU imediatamente após cada atualização.

Resumo: o lançamento 0.32.14 desativa involuntariamente a aceleração da série RTX 30. Verifique a atividade da GPU com nvidia-smi e, se você depende dessas placas, faça o rollback para a 0.32.13 até que os kernels ausentes sejam restaurados.