Consegui rodar um modelo de linguagem de 284 bilhões de parâmetros em um laptop com apenas 3,2 GB de RAM, usando apenas C99 puro e um drive NVMe. O truque foi fazer o streaming dos pesos dos especialistas (expert weights) do modelo em vez de carregar todo o checkpoint de 160 GB na memória, provando que até os maiores modelos de mistura de especialistas (MoE) podem ser espremidos em hardware de consumo.

Por que isso é importante

Grandes modelos de linguagem (LLMs) impulsionam a geração de código, assistência em pesquisas e muito mais, mas seu tamanho geralmente força os usuários a utilizarem servidores multi-GPU caros ou a recorrerem a uma quantização pesada que prejudica a qualidade. Mostrar que um modelo MoE de 284 B de parâmetros pode rodar com apenas alguns gigabytes de RAM abre as portas para entusiastas, pequenas startups e pesquisadores com orçamento limitado experimentarem modelos de última geração sem sacrificar a fidelidade.

O modelo e o gargalo de hardware

O DeepSeek-V4-Flash armazena 284 B de parâmetros distribuídos em 256 especialistas por camada do transformer. O checkpoint bruto ocupa aproximadamente 160 GB no disco — um tamanho que faz os 3,2 GB de RAM de um laptop típico parecerem insignificantes. Pipelines de inferência tradicionais tentam mapear todo o checkpoint na memória, esgotando rapidamente o orçamento de RAM e causando o travamento do sistema.

Streaming de pesos de especialistas: a ideia central

Arquiteturas MoE ativam apenas um subconjunto minúsculo de especialistas para cada token. No DeepSeek-V4-Flash, o roteador seleciona seis especialistas de um total de 256 por camada. Como o processamento nunca toca nos especialistas inativos, o mecanismo de inferência pode pular o carregamento deles.

A implementação trata o checkpoint como uma fonte de streaming. Quando o roteador decide quais especialistas são necessários para o token atual, o mecanismo busca esses blocos de pesos no drive NVMe para um cache LRU (least-recently-used) que reside na RAM. Se o cache for grande o suficiente, os mesmos especialistas são reutilizados em tokens consecutivos, gerando cache hits; se o cache for muito pequeno, o mecanismo lê do disco com mais frequência. O resultado é um uso de memória de pico de 3,23 GB, bem dentro dos limites do laptop, preservando os pesos de precisão total e sem exigir aceleração por GPU.

Lições difíceis aprendidas na implementação

1. Saída fluente não é prova de correção Um kernel com bugs ainda pode emitir frases que parecem plausíveis, especialmente quando os padrões de linguagem do modelo mascaram erros numéricos. Validei cada uma das 14 operações críticas contra uma referência PyTorch atualizada, verificando se a diferença numérica permanecia dentro de uma tolerância mínima. Pular essa etapa teria permitido que um desvio sutil passasse despercebido.

**2.

Fazer o streaming apenas dos especialistas que um modelo MoE realmente utiliza permite que um LLM de 284 bilhões de parâmetros seja executado em um laptop modesto, sem quantização ou aceleração por GPU. O experimento mostra que uma movimentação de dados inteligente, validação rigorosa e medição disciplinada podem contornar restrições de hardware que muitos consideram imutáveis.