A OpenAI anunciou em 30 de julho de 2026 que a API do GPT-5.6 custará drasticamente menos que sua predecessora, lançando três modelos em níveis — Sol, Terra e Luna — além de descontos expressivos para leituras em cache.
Por que o novo preço é importante
Desde o lançamento do GPT-5, os custos de API têm sido uma linha de despesa significativa para qualquer pessoa que esteja construindo agentes conversacionais, pipelines de geração aumentada de recuperação (RAG) ou ferramentas de extração de dados em larga escala. Ao reduzir as taxas de entrada para US$ 5, US$ 2 e US$ 0,20 por milhão de tokens para Sol, Terra e Luna, respectivamente, a OpenAI oferece aos desenvolvedores uma maneira mais barata de escolher o nível de raciocínio necessário sem redesenhar toda a sua infraestrutura. A economia é mais impactante para o Terra, que agora opera a 40% do antigo preço principal, e para o Luna, que fica em apenas 4% desse patamar de referência.
Os três modelos, detalhados
| Modelo | Preço de entrada (por 1 mi de tokens) | Preço de saída (por 1 mi de tokens) | Uso típico |
|---|---|---|---|
| Sol | US$ 5 | US$ 30 | Raciocínio profundo, tarefas de cadeia de pensamento (chain-of-thought) |
| Terra | US$ 2 | US$ 12 | Cargas de trabalho de produção, desempenho equilibrado |
| Luna | US$ 0,20 | US$ 1,20 | Alto volume, extração ou classificação simples |
O Sol continua sendo o mais caro, mas oferece a maior profundidade de raciocínio. O Terra está posicionado como o padrão para a maioria das aplicações, enquanto o Luna é uma opção de "alta escala", onde a profundidade pode ser sacrificada em prol do custo.
O cache reduz a conta ainda mais
A OpenAI introduziu uma camada de cache que oferece descontos de 90% em operações de leitura. As taxas para entrada em cache são:
- Sol: US$ 0,50 / milhão de tokens
- Terra: US$ 0,20 / milhão de tokens
- Luna: US$ 0,02 / milhão de tokens
Gravações no cache custam 1,25 × a taxa de entrada correspondente, e uma entrada de cache deve permanecer por pelo menos 30 minutos antes de poder ser removida.
Sobretaxas de comprimento de contexto para manter o controle
A API agora impõe uma sobretaxa quando uma solicitação excede 272 mil tokens de entrada. O preço base dobra para a entrada e aumenta 1,5 × para a saída. As taxas de excesso do Sol são listadas em US$ 10 de entrada e US$ 45 de saída por milhão de tokens, facilitando o cálculo da penalidade para contextos excepcionalmente longos.
O que os desenvolvedores perdem
Os cortes de preço vêm com duas omissões notáveis. Primeiro, não há um nível gratuito permanente, o que significa que cada solicitação gera uma cobrança, não importa o quão pequena seja. Segundo, a OpenAI ainda não introduziu descontos para endpoints de lote (batch-endpoint) para o GPT-5.6, um recurso que ajudou usuários de larga escala a reduzir os custos por chamada em versões anteriores.
Como manter os custos baixos
- Escolha o modelo certo: Use o Sol apenas para tarefas que realmente exijam raciocínio profundo; use o Terra como padrão para a maioria dos trabalhos de produção; reserve o Luna para tarefas de alto rendimento e baixa complexidade.
- Use cache: Armazene prompts e resultados intermediários que são reutilizados em várias chamadas; o desconto de 90% na leitura pode superar a redução do preço base.
- Fique atento ao comprimento do contexto: Divida entradas muito longas em partes menores ou trunque partes não essenciais para evitar a sobretaxa de 2× na entrada.
- Monitore o tempo de vida do cache: A duração mínima do cache é de 30 minutos.
O que vem a seguir
Os desenvolvedores devem ficar de olho na página oficial de preços para quaisquer ajustes, especialmente em relação às taxas de gravação no cache ou aos limites de comprimento de contexto.
Resumo: O modelo de preços em níveis do GPT-5.6 e os descontos agressivos de cache o tornam um modelo da OpenAI acessível, mas a falta de um nível gratuito e de descontos para lotes significa que uma gestão de custos inteligente ainda será essencial para qualquer implantação de grande porte.
