Destaques de Benchmark

A conferência Hot Chips revelou números que uma empresa independente verificou com o conjunto InferenceX. A OpenAI chama o Jalapeño de um acelerador de inferência de propósito geral — ele executa modelos, mas não os treina. Nos testes, o chip:

  • Entregou de 1,5 × a 1,9 × mais trabalho por watt em throughput de pico do que os líderes atuais.
  • Reduziu a latência de 1,7 × a 3,6 ×, com ganhos interativos de 2,1 × a 4,1 ×.

Resultados específicos por modelo:

  • GPT-OSS 120B: ~1.400 tokens/segundo/usuário.
  • Deepseek R1 670B: ~700 tokens/segundo em uma única requisição simultânea.
  • Kimi K2.5 1T: testado no conjunto de alto desempenho (números exatos omitidos).

A OpenAI enfatizou que esses números foram obtidos sem decoding especulativo ou predição de múltiplos tokens — truques que muitos rivais usam para inflar os números de destaque.

Como o Jalapeño Foi Construído

A OpenAI concluiu o design do chip em nove meses, em parceria com a Broadcom. A empresa alimentou seus próprios modelos no ciclo de design, acelerando o blueprinting, a programação e a otimização — um método apelidado de “design de silício assistido por IA”. O sprint destaca uma mudança em relação aos ciclos de vários anos que antes definiam o silício de alto desempenho.

Implicações para a Liderança da Nvidia

A Nvidia baseia-se em desempenho bruto e no ecossistema CUDA. Os novos dados tornam a vantagem de desempenho questionável. Analistas alertam que, se mais empresas de IA lançarem silício de inferência personalizado com eficiência semelhante, os desenvolvedores podem se afastar do CUDA, abrindo espaço para stacks alternativas e um mercado fragmentado.

A Estratégia de Sinais Mistos da OpenAI

A diretora financeira Kelly Huang descreveu o Jalapeño como uma peça de um plano de computação mais amplo, não como uma substituição total dos parceiros existentes. A OpenAI ainda trabalha com Nvidia, AMD, AWS e Cerebras em diversas cargas de trabalho. O Jalapeño continua sendo uma amostra de engenharia; ele ainda não enfrentou os maiores modelos que virão, como o Deepseek V4 Pro. Os comentários de Huang sugerem que a OpenAI misturará seu próprio silício com aceleradores de terceiros, buscando a melhor combinação de custo-benefício para cada tarefa.

Contrapontos

Amostras em estágio inicial não garantem produção em massa, rendimento (yield) ou confiabilidade a longo prazo, portanto, o entusiasmo deve ser moderado.

O Que Observar a Seguir

  • Lançamento de produção: A OpenAI conseguirá transformar o Jalapeño em uma peça produzida em massa e a que preço?
  • Stack de software: Quão maduros serão o modelo de programação e a cadeia de ferramentas (toolchain) para os desenvolvedores?
  • Resposta dos concorrentes: Como a Nvidia e outros fornecedores ajustarão seus roadmaps ou preços para proteger sua participação de mercado?
  • Escalabilidade de modelos: O Jalapeño manterá sua vantagem na próxima onda de modelos de trilhões de parâmetros?

Conclusão: O silício de inferência personalizado está deixando de ser um experimento de nicho para se tornar um desafio credível à dominância de hardware da Nvidia.