Fugu Ultra v1.1 de Sakana AI supera a Fable 5 en su última actualización

Sakana AI ha lanzado una actualización significativa para su enrutador de modelos inteligente, Fugu Ultra v1.1, alegando saltos masivos de rendimiento en diversos benchmarks técnicos críticos. La actualización marca un intento estratégico de perfeccionar la forma en que se distribuyen las consultas entre los modelos de primer nivel para lograr capacidades superiores de razonamiento y programación.

Superando benchmarks: La ventaja de Fugu Ultra v1.1

La innovación principal de Fugu Ultra v1.1 reside en su inteligencia de enrutamiento, la cual selecciona el modelo más adecuado de un conjunto de LLMs disponibles públicamente para cualquier prompt dado. Sakana AI informa que esta versión ofrece mejoras de rendimiento de hasta 7,9 puntos respecto al lanzamiento inicial de la v1.0.

Cabe destacar que el enrutador demostró saltos significativos en evaluaciones técnicas especializadas, específicamente en los benchmarks ProgramBench y TerminalBench 2.1. En una afirmación sorprendente, Sakana asegura que Fugu Ultra v1.1 ahora supera a Fable 5 de Anthropic en la mayoría de los benchmarks, a pesar de que Fable 5 no está incluido en el conjunto de selección del enrutador. Si bien estos resultados carecen actualmente de verificación independiente por parte de terceros, sugieren que la lógica de enrutamiento se está volviendo altamente eficiente para extraer el máximo rendimiento de las arquitecturas de modelos existentes.

Arquitectura técnica e integración para desarrolladores

El enfoque de Sakana para mantener un conjunto de vanguardia es riguroso; la empresa afirma que requiere aproximadamente dos semanas de entrenamiento y evaluación dedicados antes de que cualquier nuevo modelo de primer nivel se integre oficialmente en el ecosistema Fugu. Esto garantiza que el proceso de toma de decisiones del enrutador permanezca optimizado para los últimos pesos y capacidades del mercado.

Para los desarrolladores, la actualización introduce un nuevo endpoint compatible con Claude Code, lo que permite a los usuarios llamar a Fugu directamente desde su terminal. Esta integración agiliza los flujos de trabajo para los ingenieros que requieren razonamiento de alto nivel y automatización basada en terminal. A pesar de estos avances técnicos, los precios se mantienen consistentes con la versión anterior: $5 por millón de tokens de entrada y $30 por millón de tokens de salida. Fugu es accesible actualmente a través de las principales plataformas, incluyendo OpenRouter y Vercel.

Abordando los desafíos del mercado y la regulación

El lanzamiento se produce tras un periodo de escrutinio tras el lanzamiento inicial de Fugu. Los primeros críticos señalaron problemas relacionados con el alto consumo de tokens, la latencia y los resultados inconsistentes. Con la v1.1, Sakana parece estar redoblando sus esfuerzos en eficiencia y rendimiento en tareas especializadas para recuperar la confianza de los desarrolladores.

Sin embargo, las limitaciones geográficas siguen siendo un obstáculo para la adopción global. Sakana AI actualmente no presta servicio a usuarios dentro de la Unión Europea (UE) o el Espacio Económico Europeo (EEE), citando las complejidades que rodean al RGPD y otros marcos regulatorios específicos de la UE. A medida que la categoría de "enrutador de modelos" crezca, la capacidad de Sakana para demostrar estas afirmaciones de rendimiento mediante datos transparentes y verificables será la prueba definitiva de su viabilidad en el competitivo panorama de la IA.

Conclusiones clave

  • Benchmarks superiores: Fugu Ultra v1.1 muestra una mejora de 7,9 puntos respecto a la v1.0, superando notablemente a Fable 5 de Anthropic en varias métricas, a pesar de que Fable 5 no se encuentra en el conjunto del enrutador.
  • Actualizaciones centradas en el desarrollador: La nueva versión añade un endpoint de terminal compatible con Claude Code, lo que facilita la integración en los flujos de trabajo de programación.
  • Curación rigurosa: Sakana emplea un ciclo de evaluación de dos semanas para cada nuevo modelo añadido al enrutador con el fin de mantener una alta precisión y rendimiento.