Fugu Ultra v1.1 da Sakana AI supera o Fable 5 em sua última atualização

A Sakana AI lançou uma atualização significativa para o seu roteador de modelos inteligente, o Fugu Ultra v1.1, alegando saltos massivos de desempenho em benchmarks técnicos críticos. A atualização marca uma tentativa estratégica de refinar como as consultas são distribuídas entre modelos de alto nível para alcançar capacidades superiores de raciocínio e codificação.

Quebrando Benchmarks: A Vantagem do Fugu Ultra v1.1

A inovação central do Fugu Ultra v1.1 reside em sua inteligência de roteamento, que seleciona o modelo mais adequado de um conjunto de LLMs publicamente disponíveis para qualquer prompt fornecido. A Sakana AI relata que esta versão entrega ganhos de desempenho de até 7,9 pontos em relação ao lançamento inicial da v1.0.

Mais notavelmente, o roteador demonstrou saltos significativos em avaliações técnicas especializadas, especificamente nos benchmarks ProgramBench e TerminalBench 2.1. Em uma afirmação surpreendente, a Sakana afirma que o Fugu Ultra v1.1 agora supera o Fable 5 da Anthropic na maioria dos benchmarks — embora o Fable 5 não esteja incluído no conjunto de seleção do roteador. Embora esses resultados careçam atualmente de verificação independente de terceiros, eles sugerem que a lógica de roteamento está se tornando altamente eficiente em extrair o desempenho máximo das arquiteturas de modelos existentes.

Arquitetura Técnica e Integração para Desenvolvedores

A abordagem da Sakana para manter um conjunto de ponta é rigorosa; a empresa afirma que são necessárias aproximadamente duas semanas de treinamento e avaliação dedicados antes que qualquer novo modelo de alto nível seja oficialmente integrado ao ecossistema Fugu. Isso garante que o processo de tomada de decisão do roteador permaneça otimizado para os pesos e capacidades mais recentes do mercado.

Para desenvolvedores, a atualização introduz um novo endpoint compatível com o Claude Code, permitindo que os usuários chamem o Fugu diretamente de seu terminal. Essa integração agiliza os fluxos de trabalho para engenheiros que exigem raciocínio de alto nível e automação baseada em terminal. Apesar desses avanços técnicos, o preço permanece consistente com a versão anterior: US$ 5 por milhão de tokens de entrada e US$ 30 por milhão de tokens de saída. O Fugu está atualmente acessível por meio de grandes plataformas, incluindo OpenRouter e Vercel.

Enfrentando Desafios de Mercado e Regulamentação

O lançamento ocorre após um período de escrutínio do lançamento inicial do Fugu. Críticos iniciais destacaram problemas relacionados ao alto consumo de tokens, latência e resultados inconsistentes. Com a v1.1, a Sakana parece estar apostando tudo na eficiência e no desempenho de tarefas especializadas para reconquistar a confiança dos desenvolvedores.

No entanto, as limitações geográficas continuam sendo um obstáculo para a adoção global. A Sakana AI atualmente não atende usuários na União Europeia (UE) ou no Espaço Econômico Europeu (EEE), citando complexidades em torno do GDPR e outros marcos regulatórios específicos da UE. À medida que a categoria de "roteador de modelos" cresce, a capacidade da Sakana de provar essas alegações de desempenho por meio de dados transparentes e verificáveis será o teste definitivo de sua viabilidade no competitivo cenário da IA.

Principais Conclusões

  • Benchmarking Superior: O Fugu Ultra v1.1 mostra uma melhoria de 7,9 pontos em relação à v1.0, superando notavelmente o Fable 5 da Anthropic em várias métricas, apesar de o Fable 5 não estar no conjunto do roteador.
  • Atualizações Centradas no Desenvolvedor: A nova versão adiciona um endpoint de terminal compatível com o Claude Code, facilitando a integração em fluxos de trabalho de codificação.
  • Curadoria Rigorosa: A Sakana utiliza um ciclo de avaliação de duas semanas para cada novo modelo adicionado ao roteador para manter alta precisão e desempenho.