בעוד שחברת Cerebras בונה שבבי AI מותאמים אישית, הסטארט-אפ הצרפתי Kog מפיקה מקסימום ביצועים מתוך ה-GPUs שארגונים כבר מחזיקים. על ידי כתיבה מחדש של תוכנה ברמה נמוכה (low-level) עבור חומרת מרכזי נתונים קיימת, Kog מסירה את צווארי הבקבוק של השיהוי (latency) המאטים תהליכי עבודה של AI.
קריאת תיגר על הצורך בשבבי AI ייעודיים
תעשיית ה-AI עברה להתמקדות בשבבים שנבנו למטרה ספציפית עבור inference. מנכ"ל Kog, Gaël Delalleau, אומר שהאמונה ש-GPUs סטנדרטיים אינם יכולים להתמודד עם פעולת decoding היא שגויה. GPUs מודרניים—Nvidia H200, AMD MI300X—מציעים רוחב פס של זיכרון שתוכנה נוכחית משאירה ללא שימוש.
ה-Kog Inference Engine (KIE) של Kog מכוון ל-"extremely fast single-request decoding", דרישת חובה עבור אפליקציות בזמן אמת. בהדגמה שנערכה לאחרונה, החברה הגיעה ל-3,000 טוקנים בשנייה (TPS) עם Laneformer 2B, מודל בקוד פתוח בעל 2 מיליארד פרמטרים שעבר כוונון (tuned) עבור ה-stack שלהם. ההדגמה משתמשת במודל קטן, אך Kog מתכננת להרחיב את השיפורים הללו למודלי LLM גדולים בהרבה.
גישת "האקרים" להנדסת GPU
בניגוד לספקים שאינם תלויים בחומרה (hardware-agnostic) כמו ZML, Kog צוללת לעומק. הצוות מבצע הנדסה לאחור (reverse-engineers) ל-GPUs ברמת ה-assembly וה-binary, ומתייחס לשבב כאל אוסף של חוקי פיזיקה שיש לשלוט בהם.
המיקוד ברמה הנמוכה הזו מפיק כל טיפה של יעילות, אך הוא עולה בזמן. עם צוות רזה של 11 מהנדסים, Kog מקדישה שבועות או חודשים לניתוח כל ארכיטקטורת GPU חדשה לפני הוספת תמיכה. השיטה מספקת ביצועים מהשורה הראשונה, אך מגבילה את המהירות שבה Kog יכולה לכסות חומרה חדשה.
התמקדות במקרי בוחן של AI בעלי ערך גבוה
Kog מתמקדת במגזרים שבהם שיהוי (latency) שווה לאובדן הכנסות:
- הנדסת תוכנה: כלים כמו Claude Code נתקעים לדקות. Kog שואפת להפוך "שעות של המתנה" לתוצאות כמעט מיידיות.
- עיצוב אפליקציות/משחקים גנרטיביים: תהליכי prompt-to-app זקוקים לאיטרציות מהירות כדי לשמור על מעורבות משתמשים וזרימת הכנסות.
אבן הדרך הבאה של החברה היא האצה של פי 10 במודל הגדול הראשון שלה בקנה מידה רחב. בתמיכת Scaleway, Bpifrance ותוכנית French Tech 2030, Kog ממצבת את עצמה כשחקנית מפתח במאמץ האירופי לריבונות ב-AI.
נקודות מפתח
- אופטימיזציה על פני חומרה: Kog דוחפת את רוחב פס הזיכרון של ה-GPUs מסוג Nvidia H200 ו-AMD MI300X לקצה באמצעות הנדסת תוכנה קיצונית ברמה נמוכה.
- שבירת מחסום השיהוי: הסטארט-אפ שואף לשיפור של פי 30 במהירות ה-inference של LLM עבור תהליכי עבודה מקצועיים בזמן אמת, כגון כתיבת קוד אוטומטית ועיצוב גנרטיבי.
- הנדסה ברמה עמוקה: על ידי אימוץ גישת "האקרים", Kog מבצעת הנדסה לאחור לקוד ה-assembly וה-binary של ה-GPU כדי להשיג ביצועים שערמות (stacks) סטנדרטיות אינן יכולות להגיע אליהם.
Kog, סטארט-אפ צרפתי, טוענת כי ה-Kog Inference Engine שלה שואף להריץ decoding של מודלי שפה גדולים (LLM) במהירות של עד פי 30 על אותם ה-GPUs מסוג Nvidia H200 או AMD MI300X שמפעילי מרכזי נתונים כבר מחזיקים.
מדוע הדחיפה למהירות חשובה כעת
ה-inference של LLM חונק כעת מוצרים כמו עוזרי השלמת קוד, מחוללי תוכן בזמן אמת וכלים אינטראקטיביים לעיצוב משחקים. בהקשרים אלו, הפער בין ה-prompt של המשתמש לבין תגובת המודל משפיע ישירות על הפרודוקטיביות וההכנסות. ממשקי API ברמה גבוהה כמו CUDA משאירים חלק גדול מרוחב פס הזיכרון של ה-GPU ללא שימוש, במיוחד במהלך decoding טוקן-אחר-טוקן, שדומיננטי במקרי שימוש בזמן אמת.
הפתרון של Kog ברמה הנמוכה
Kog מדלגת על שכבות תוכנה קונבנציונליות ומתקשרת ישירות עם השבב. המהנדסים שלה מבצעים הנדסה לאחור ל-GPU ברמת ה-assembly, ומתייחסים לחומרה כאל אוסף של אילוצים שיש לציית להם ולא כאל "קופסה שחורה" שיש להוסיף לה שכבת הפשטה. התוצאה היא נתיב ביצוע (execution path) מותאם אישית ששומר על זרימת נתונים דרך צינורות הזיכרון של ה-GPU בכמעט מלוא הקיבולת.
בהדגמה שנערכה לאחרונה, החברה הריצה את Laneformer 2B—מודל בקוד פתוח בעל 2 מיליארד פרמטרים שעבר כוונון עבור ה-stack שלה—ודיווחה על קצב העברת טוקנים (throughput) גבוה. המודל צנוע בהשוואה למערכות מסחריות גדולות יותר, אך רווח המהירות מראה מה תוכנת stack שנבנתה למטרה ספציפית יכולה להפיק מאותה חומרה.
הפשרה ההנדסית
היתרון מגיע עם עקומת עלות תלולה. צוות 11 המהנדסים של Kog מקדיש שבועות או חודשים לניתוח כל ארכיטקטורת GPU חדשה לפני שניתן יהיה לתמוך בה. העומק הזה מניב ביצועים גבוהים בכרטיסים המיועדים, אך המשמעות היא ש-Kog אינה יכולה להוסיף תמיכה באופן מיידי לכל GPU חדש שיוצא לשוק. לקוחות יפיקו תועלת רק אם הציוד שלהם כולל את ה-GPUs מסוג Nvidia H200 או AMD MI300X ש-Kog כבר אופטימיזציה עבורם.
מי עומד להרוויח
- כלי הנדסת תוכנה – מוצרים שמייצרים קוד, כמו Claude Code, נתקעים לעיתים קרובות במשך דקות בזמן שהמודל מעבד בקשה. צמצום זמן ההמתנה הזה לכמה שניות יהפוך את הפיתוח האינטראקטיבי לזורם הרבה יותר.
- תהליכי עיצוב גנרטיביים – סטודיו שהופכים הנחיות טקסטואליות (prompts) לאבות-טיפוס של אפליקציות או לנכסי משחק זקוקים לאיטרציות מהירות כדי לשמור על מעורבות היוצרים. פענוח (decoding) מהיר יותר מקצר את לולאות העיצוב ומגדיל את שיעורי ההמרה.
שני המגזרים מתרגמים שיהוי (latency) ישירות לאובדן שעות חיוב או לנטישה (churn), כך שהאצה פי 30 עשויה להוות יתרון תחרותי מכריע.
התמונה הרחבה יותר
האסטרטגיה של Kog מנוגדת למגמת התעשייה של בניית שבבי AI מותאמים אישית. חברות כמו Cerebras משקיעות מיליארדים בשבבים שמבטיחים תפוקה (throughput) גבוהה יותר לכל וואט. Kog טוענת של-GPUs של היום כבר יש מספיק רוחב פס של זיכרון עבור פענוח (decoding); החלק החסר הוא תוכנה שיכולה באמת להשתמש בו. אם הטענה תתקיים בקנה מידה רחב, מפתחים יוכלו לדחות שדרוגי חומרה יקרים ולהסתמך על שדרוג תוכנה כדי להשיג הסקה (inference) כמעט בזמן אמת.
מכשולים פוטנציאליים
- נטל התחזוקה – כל דור חדש של GPU ידרוש הנדסה לאחור (reverse-engineering) מחדש. ככל שהשוק יתגוון, הצוות הקטן עלול להימתח מעבר ליכולתו.
- יכולת התרחבות למודלים גדולים יותר – הדמו השתמש במודל של 2 מיליארד פרמטרים. הרחבת אותן טכניקות למערכות גדולות בהרבה עלולה להיתקל במגבלות קיבולת זיכרון או לדרוש טריקים הנדסיים נוספים שטרם נחשפו.
- מסלולים חלופיים – ספקי ענן כבר מציעים מופעים (instances) מותאמים להסקה (inference) המשלבים שבבים ותוכנה ייעודיים. עבור עומסי עבודה מסוימים, הרווח השולי ממחסנית (stack) של Kog עשוי שלא להצדיק את הנוחות של שירות מנוהל.
מה כדאי לעקוב אחריו
- ההשקה הראשונה של מודל גדול – Kog אומרת שאבן הדרך הבאה שלה היא האצה פי 10 ב"מודל גדול בקנה מידה משמעותי". הפער בין הדמו של ה-2B לבין מודל ברמת ארגון (enterprise-grade) יהיה המבחן הברור ביותר לגישה זו.
- הרחבת תמיכה בחומרה – הוספת תמיכה ב-GPUs חדשים יותר או במאיצים אחרים תאותת האם המודל ברמה הנמוכה (low-level) יכול לעמוד בקצב ההתקדמות המהיר של החומרה.
שורה תחתונה
Kog מראה שניתן להפיק יותר עבודה מ-GPUs קיימים כאשר כותבים מחדש את מחסנית התוכנה (software stack) מהיסוד. ההבטחה לפענוח LLM מהיר פי 30 עשויה לעצב מחדש את האופן שבו מפתחים מתמחרים ומבנים שירותי AI — בתנאי שהחברה תוכל לשמר את המאמץ ההנדסי האינטנסיבי הנדרש עבור כל שבב חדש.
