IBM השיקה את משפחת מודלי השפה הגדולים Granite 4.2, המציעה גרסאות של 3 מיליארד, 8 מיליארד ו-30 מיליארד פרמטרים, עם חלון הקשר (context window) של עד 512k טוקנים ושימוש מובנה בכלים בסגנון סוכן (agentic tool use), וכל זאת תחת רישיון Apache 2.0. המהלך מעניק למפתחים AI ברמה ארגונית (enterprise-grade) עם משקולות פתוחות (open-weight) המאפשרת הסקה על מסמכים עצומים ופעולה אוטונומית ללא תלות ב-APIs קנייניים.
למה הדחיפה של IBM למשקולות פתוחות חשובה עכשיו
הרישיון המקדם מאפשר לחברות להריץ את המודלים באתר הלקוח (on-premises), בעננים פרטיים, או להטמיע אותם במכשירי קצה (edge devices) ללא דמי רישיון — יתרון ברור עבור תעשיות מפוקחות שאינן יכולות לחשוף נתונים לשירותים חיצוניים.
הקפיצה הטכנולוגית
- קנה מידה ונתוני אימון – IBM אימנה את המודלים מאפס על כ-15 טריליון טוקנים, גודל מערך נתונים שניתן להשוות לגדולים ביותר שבמודלי הבסיס המסחריים.
- חלון הקשר (Context window) – חלון של 512k טוקנים מאפשר מעבר בודד לכסות מאגרי קוד שלמים, מסמכי מדיניות ארוכים או ספרים בעלי מספר פרקים, ובכך מבטל את הצורך בחלוקה למקטעים (chunking) ואיסוף מחדש.
- חישוב במצב כפול – מצב "חשיבה" (thinking) מפעיל שכבות הסקה עמוקות יותר, בעוד שמצב "לא חושב" (non-thinking) מטפל בשליפות פשוטות עם דרישת GPU נמוכה יותר. מתג זה מאפשר למשתמשים לאזן בין שיהוי (latency) לעלות לכל בקשה.
- למידת חיזוק סוכנית (Agentic reinforcement learning) – מודלי ה-8B וה-30B עברו שלב RL ייעודי המלמד אותם להפעיל כלים חיצוניים, להריץ קוד בסביבה מבודדת (sandboxed code) ולבצע חיפושים באינטרנט. המודלים חושפים נקודות קצה (endpoints) לקריאת כלים בסגנון OpenAI, כך שניתן להשתמש מחדש בתהליכי תזמור (orchestration pipelines) קיימים ללא צורך בכתיבה מחדש.
- נוחות להסקה (Inference friendliness) – תאימות ל-vLLM ו-SGLang מאפשרת למודלים לרוץ עם תפוקה (throughput) גבוהה על חומרה סטנדרטית (commodity hardware), יתרון מעשי עבור ארגונים המרחיבים עשרות סוכנים הפועלים במקביל.
הערה צדדית על דיבור: Granite Speech 5.0 Turbo CTC
לצד קו ה-LLM, IBM שחררה מודל speech-to-text של 470 מיליון פרמטרים המכונה Granite Speech 5.0 Turbo CTC. IBM טוענת שהוא מתמלל שלוש שעות של אודיו בשנייה אחת, פי שניים מהמהירות של המובילים הקודמים בלוח המודעות של Open ASR. טביעת הרגל הקטנה והתפוקה הקיצונית הופכות אותו למועמד לכתוביות בזמן אמת, אנליטיקה של מוקדי שירות וצינורות עיבוד אודיו בקנה מידה גדול.
המשמעויות עבור אקוסיסטם ה-AI
מי מרוויח:
- ארגונים מקבלים חלופה חסכונית ומאויחת עצמית לשימוש ב-API יקר.
- מפתחים מקבלים מחסנית (stack) סוכנית מוכנה שניתן להתאים אישית ללא צורך בניהול משא ומתן על רישיונות מסחריים.
- IBM מחזירה לעצמה את הרלוונטיות במרוץ ה-AI על ידי אספקת מוצר קוד פתוח דגל המציג את יכולות המחקר שלה.
מי מאוים:
- ספקי קוד סגור המסתמכים על נעילת לקוחות (lock-in) באמצעות מודלים קנייניים עשויים לראות ירידה בהוצאות הארגוניות אם לקוחות יעברו לסוכני Granite המאויחים מקומית.
- פרויקטי קוד פתוח קטנים יותר עלולים להידחק הצידה; קנה המידה והתמיכה בכלים של Granite מציבים רף גבוה למאמצים מבוססי קהילה.
עלויות ופשרות: הפעלת מודל 30B עם חלון הקשר של חצי מיליון טוקנים עדיין דורשת GPU מתקדמים או אשכולות (clusters); ארגונים חייבים לשקול את ההשקעה בחומרה מול החיסכון בעמלות API.
שורה תחתונה
Granite 4.2 דוחף AI ברמה ארגונית אמיתית ובעל משקולות פתוחות אל מרחב הציבור, תוך שילוב של חלונות הקשר עצומים עם שימוש בכלים "מהקופסה". רישיון ה-Apache 2.0 שלו מסיר חיכוך משפטי, אך אתגרי החומרה והבטיחות פירושם שהמודל ימצא תחילה בית בארגונים בעלי משאבים רבים שיכולים להרשות לעצמם את כוח המחשוב ולהשקיע בסביבות מבודדות (sandboxing) חזקות. אם הקהילה תתגייס סביבו, Granite עשוי להפוך לעמוד השדרה של הדור הבא של סוכנים אוטונומיים, ויאלץ את שוק ה-AI הרחב להתמודד עם חלופות קוד פתוח שכבר אינן מתפשרות על קנה מידה או יכולת.
