Fugu Ultra v1.1 của Sakana AI vượt mặt Fable 5 trong bản cập nhật mới nhất

Sakana AI vừa phát hành một bản cập nhật quan trọng cho bộ định tuyến mô hình thông minh (intelligent model router) của mình, Fugu Ultra v1.1, với tuyên bố đạt được những bước nhảy vọt về hiệu suất trên các điểm chuẩn kỹ thuật quan trọng. Bản cập nhật này đánh dấu một nỗ lực chiến lược nhằm tinh chỉnh cách phân phối các truy vấn giữa các mô hình hàng đầu để đạt được khả năng lập luận và lập trình vượt trội.

Phá vỡ các điểm chuẩn: Lợi thế của Fugu Ultra v1.1

Cốt lõi của sự đổi mới trong Fugu Ultra v1.1 nằm ở trí tuệ định tuyến, giúp lựa chọn mô hình phù hợp nhất từ một nhóm các LLM công khai cho bất kỳ prompt nào. Sakana AI báo cáo rằng phiên bản này mang lại mức tăng hiệu suất lên tới 7,9 điểm so với bản phát hành v1.0 ban đầu.

Đáng chú ý nhất, bộ định tuyến đã cho thấy những bước nhảy vọt đáng kể trong các đánh giá kỹ thuật chuyên biệt, cụ thể là trên các điểm chuẩn ProgramBenchTerminalBench 2.1. Trong một tuyên bố gây chú ý, Sakana khẳng định rằng Fugu Ultra v1.1 hiện đã vượt qua Fable 5 của Anthropic trên hầu hết các điểm chuẩn—mặc dù Fable 5 thực tế không nằm trong danh sách lựa chọn của bộ định tuyến. Mặc dù các kết quả này hiện vẫn thiếu sự xác minh độc lập từ bên thứ ba, chúng cho thấy logic định tuyến đang trở nên cực kỳ hiệu quả trong việc khai thác hiệu suất tối đa từ các kiến trúc mô hình hiện có.

Kiến trúc kỹ thuật và tích hợp cho nhà phát triển

Cách tiếp cận của Sakana trong việc duy trì một nhóm mô hình tiên tiến là rất nghiêm ngặt; công ty cho biết cần khoảng hai tuần đào tạo và đánh giá chuyên sâu trước khi bất kỳ mô hình hàng đầu mới nào được tích hợp chính thức vào hệ sinh thái Fugu. Điều này đảm bảo quá trình ra quyết định của bộ định tuyến luôn được tối ưu hóa cho các trọng số (weights) và khả năng mới nhất trên thị trường.

Đối với các nhà phát triển, bản cập nhật giới thiệu một endpoint tương thích với Claude Code mới, cho phép người dùng gọi Fugu trực tiếp từ terminal của họ. Sự tích hợp này giúp tinh giản quy trình làm việc cho các kỹ sư yêu cầu khả năng lập luận cấp cao và tự động hóa dựa trên terminal. Bất chấp những bước tiến kỹ thuật này, mức giá vẫn giữ nguyên so với phiên bản trước: 5 USD cho mỗi triệu token đầu vào30 USD cho mỗi triệu token đầu ra. Fugu hiện có thể truy cập thông qua các nền tảng lớn bao gồm OpenRouterVercel.

Giải quyết các thách thức thị trường và quy định pháp lý

Bản phát hành này diễn ra sau một giai đoạn bị giám sát chặt chẽ kể từ khi ra mắt Fugu lần đầu. Những nhà phê bình ban đầu đã chỉ ra các vấn đề liên quan đến mức tiêu thụ token cao, độ trễ và kết quả không nhất quán. Với phiên bản v1.1, Sakana dường như đang tập trung mạnh mẽ hơn vào hiệu suất và khả năng thực hiện các tác vụ chuyên biệt để giành lại niềm tin của các nhà phát triển.

Tuy nhiên, các hạn chế về mặt địa lý vẫn là một rào cản đối với việc áp dụng toàn cầu. Sakana AI hiện không phục vụ người dùng trong Liên minh Châu Âu (EU) hoặc Khu vực Kinh tế Châu Âu (EEA), với lý do là những phức tạp xoay quanh GDPR và các khung pháp lý đặc thù khác của EU. Khi danh mục "bộ định tuyến mô hình" (model router) ngày càng phát triển, khả năng chứng minh các tuyên bố về hiệu suất này thông qua dữ liệu minh bạch và có thể kiểm chứng sẽ là bài kiểm tra cuối cùng cho khả năng tồn tại của Sakana trong bối cảnh AI đầy cạnh tranh.

Các điểm chính cần lưu ý

  • Điểm chuẩn vượt trội: Fugu Ultra v1.1 cho thấy sự cải thiện 7,9 điểm so với v1.0, đặc biệt vượt qua Fable 5 của Anthropic trên nhiều chỉ số mặc dù Fable 5 không nằm trong danh sách của bộ định tuyến.
  • Cập nhật tập trung vào nhà phát triển: Phiên bản mới bổ sung một endpoint terminal tương thích với Claude Code, giúp việc tích hợp vào quy trình lập trình trở nên dễ dàng hơn.
  • Sự tuyển chọn nghiêm ngặt: Sakana áp dụng chu kỳ đánh giá kéo dài hai tuần cho mỗi mô hình mới được thêm vào bộ định tuyến để duy trì độ chính xác và hiệu suất cao.