Fugu Ultra v1.1 של Sakana AI עוקף את Fable 5 בעדכון האחרון
Sakana AI שחררה עדכון משמעותי לנתב המודלים החכם שלה, Fugu Ultra v1.1, בטענה לזינוקים אדירים בביצועים לאורך מדדי ביצוע (benchmarks) טכניים קריטיים. העדכון מסמן ניסיון אסטרטגי לשכלל את האופן שבו שאילתות מופצות בין מודלים מהשורה הראשונה כדי להשיג יכולות הסקה (reasoning) ותכנות עדיפות.
שובר מדדי ביצוע: היתרון של Fugu Ultra v1.1
החדשנות המרכזית של Fugu Ultra v1.1 טמונה בבינה של הניתוב שלה, אשר בוחרת את המודל המתאים ביותר מתוך מאגר של מודלי שפה גדולים (LLMs) הזמינים לציבור עבור כל הנחיה (prompt) נתונה. Sakana AI מדווחת כי גרסה זו מספקת שיפורי ביצועים של עד 7.9 נקודות לעומת גרסת ה-v1.0 הראשונית.
בולטת במיוחד היכולת של הנתב להציג קפיצות משמעותיות בהערכות טכניות מתמחות, במיוחד במדדי ה-ProgramBench וה-TerminalBench 2.1. בטענה מרשימה, Sakana טוענת כי Fugu Ultra v1.1 עוקף כעת את ה-Fable 5 של Anthropic ברוב מדדי הביצוע – למרות ש-Fable 5 אינו כלול בפועל במאגר הבחירה של הנתב. בעוד שתוצאות אלו חסרות כרגע אימות עצמאי מצד צד שלישי, הן מצביעות על כך שלוגיקת הניתוב הופכת ליעילה ביותר בהפקת ביצועי שיא מתוך ארכיטקטורות מודלים קיימות.
ארכיטקטורה טכנית ואינטגרציה למפתחים
הגישה של Sakana לשמירה על מאגר חלוצי היא קפדנית; החברה מציינת כי נדרשים כשבועיים של אימון והערכה ייעודיים לפני שכל מודל חדש מהשורה הראשונה מוטמע רשמית במערכת ה-Fugu. הדבר מבטיח שתהליך קבלת ההחלטות של הנתב יישאר מותאם למשקולות (weights) והיכולות העדכניות ביותר בשוק.
עבור מפתחים, העדכון מציג endpoint תואם Claude Code חדש, המאפשר למשתמשים לקרוא ל-Fugu ישירות מהטרמינל שלהם. אינטגרציה זו מייעלת את זרימת העבודה עבור מהנדסים הזקוקים להסקה ברמה גבוהה ולאוטומציה מבוססת טרמינל. למרות ההתקדמות הטכנית הזו, התמחור נותר עקבי עם הגרסה הקודמת: $5 למיליון טוקנים של קלט (input) ו-$30 למיליון טוקנים של פלט (output). Fugu נגיש כעת דרך פלטפורמות מרכזיות הכוללות את OpenRouter ו-Vercel.
התמודדות עם אתגרי שוק ורגולציה
הגרסה יוצאת לאחר תקופה של בחינה קפדנית בעקבות השקת ה-Fugu הראשונית. מבקרים מוקדמים הצביעו על בעיות הקשורות לצריכת טוקנים גבוהה, שיהוי (latency) ותוצאות לא עקביות. עם גרסה v1.1, נראה ש-Sakana מתמקדת עוד יותר ביעילות ובביצועים במשימות מתמחות כדי להשיב את אמון המפתחים.
עם זאת, מגבלות גיאוגרפיות נותרו מכשול לאימוץ גלובלי. Sakana AI אינה משרתת כרגע משתמשים בתוך האיחוד האירופי (EU) או האזור הכלכלי האירופי (EEA), תוך ציון מורכבויות סביב ה-GDPR ומסגרות רגולטוריות אחרות ספציפיות לאיחוד האירופי. ככל שקטגוריית ה-"model router" צומחת, היכולת של Sakana להוכיח את טענות הביצועים הללו באמצעות נתונים שקופים וניתנים לאימות תהיה המבחן האולטימטיבי לכדאיותה בנוף ה-AI התחרותי.
נקודות מפתח
- מדדי ביצוע עדיפים: Fugu Ultra v1.1 מציג שיפור של 7.9 נקודות לעומת v1.0, ועוקף באופן בולט את ה-Fable 5 של Anthropic במספר מדדים, למרות ש-Fable 5 אינו נמצא במאגר של הנתב.
- עדכונים ממוקדי מפתחים: הגרסה החדשה מוסיפה endpoint לטרמינל תואם Claude Code, מה שמקל על האינטגרציה בתהליכי עבודה של תכנות.
- קיוּר קפדני: Sakana משתמשת במחזור הערכה של שבועיים עבור כל מודל חדש המתווסף לנתב כדי לשמור על דיוק וביצועים גבוהים.
