נוף התשתית של ה-AI עובר שינוי יסודי כאשר ההון עובר מאימון מודלים להרצת מודלים (execution). הלוואה עצומה של 400 מיליון דולר מחברת ההשקעות הטכנולוגית Upper90 לסטארט-אפ ה-AI inference, General Compute, מסמנת אבן דרך היסטורית באופן שבו חומרה ממומנת ופורסת.

עידן חדש של בטוחות: מימון שבבי inference

בצעד המשקף את הימים הראשונים של מימון GPU, Upper90 נכנסת למחלקת נכסים חדשה: סיליקון ייעודי ל-inference. בעוד שגל המימון הקודם — שהוביל על ידי חברות כמו CoreWeave — התמקד ב-Nvidia GPUs המשמשים לעומסי עבודה מאסיביים של אימון, העסקה הזו בשווי 400 מיליון דולר משתמשת בשבבים שנבנו במיוחד להרצת מודלים שכבר אומנו כבטוחה (collateral).

General Compute, בהובלת המנכ"ל Finn Puklowski, בונה "neocloud" — ספק תשתית מתמחה שנועד במיוחד לעומסי עבודה של AI ולא למחשוב לכל מטרה (general-purpose computing). הבחנה זו היא קריטית; בעוד שספקי hyperscalers מסורתיים כמו AWS ו-Azure מציעים שירותים רחבים, neoclouds מבצעים אופטימיזציה לדרישות ה-latency וה-throughput הייחודיות של מודלי שפה גדולים (LLMs).

היתרון הטכני של ה-SN50 של SambaNova

בלב האסטרטגיה של General Compute עומדת השותפות שלה עם SambaNova, יצרנית שבבים הנתמכת על ידי Intel. החברה פורסת את שבבי ה-SN50 של SambaNova, אשר תוכננו לספק קפיצת מדרגה משמעותית בביצועים לעומת חומרה מסורתית.

לפי General Compute, שבבים אלו יכולים לספק מהירויות inference של עד פי 16 מהעננים המבוססים על GPU כיום. מעבר למהירות גולמית, ה-SN50 מציע שני יתרונות תפעוליים מרכזיים:

  • יעילות אנרגטית: הם צורכים פחות אנרגיה לכל token, מה שמפחית את עלויות התקורה (overhead) המסיביות של פריסת AI.
  • קירור מפושט: בניגוד ל-GPUs מתקדמים שלעיתים קרובות דורשים מערכות קירור מים מורכבות ויקרות, שבבים אלו מאפשרים פריסה מהירה יותר במגוון רחב יותר של סביבות מרכז נתונים סטנדרטיות.

שבירת המונופול של Nvidia

העסקה הזו היא יותר מסתם הזרקת הון; זהו אות אסטרטגי לכך שהשוק מחפש חלופות לדומיננטיות של Nvidia. ככל שעלות ה-tokens והגישה למודלי קצה (frontier models) נותרת מכשול עבור מפתחים, גוברת הדרישה לגישה זולה ויעילה למודלים בקוד פתוח (open-source).

עלייתם של מודלים בקוד פתוח בעלי ביצועים גבוהים — כמו ה-K3 של Kimi, המתחרה ב-Anthropic וב-OpenAI במבחני ביצועי קידוד (coding benchmarks) — פירושה שצוואר הבקבוק של התעשייה עובר מ-"איך בונים מודלים?" ל-"איך מריצים אותם בצורה משתלמת?". באמצעות מינוף סיליקון שאינו של Nvidia, General Compute ומתחרות כמו TensorWave (המשתפת פעולה עם AMD) ממצבות את עצמן להציע עלות בעלות כוללת (TCO) עדיפה.

כפי שציין Puklowski, עסקה זו מייצגת "הון שמתארגן בעצמו" כדי לפרק את השליטה המונופוליסטית של Nvidia על המערכת האקולוגית של ה-AI. על ידי הימור על חומרת inference ייעודית, המשקיעים מכירים בכך שהשלב הבא בפריחת ה-AI יונע על ידי קנה מידה (scale), יעילות והנפוצות (ubiquity) של AI ביישומים יומיומיים.

נקודות מרכזיות

  • מימון מבוסס inference: העסקה בשווי 400 מיליון דולר מסמנת מעבר לשימוש בשבבי inference ייעודיים, ולא רק ב-GPUs לאימון, כבטוחה להלוואות ענק.
  • שיפור בביצועים: General Compute שואפת להשיג ביצועים של עד פי 16 לעומת עננים מבוססי GPU באמצעות שבבי ה-SN50 של SambaNova, המציעים יעילות אנרגטית טובה יותר ופריסה קלה יותר.
  • גיוון ה-Stack: המהלך מאותת על דרישה גוברת בשוק לסיליקון שאינו של Nvidia כדי לתמוך בהרחבה (scaling) חסכונית של מודלי שפה גדולים (LLMs) בקוד פתוח.