Kimi K3, המודל החדש ביותר במשקלים פתוחים (open-weights) מצוות Kimi, מגיע עם ארכיטקטורת Mixture-of-Experts (MoE) של 2.8 טריליון פרמטרים וחלון הקשר (context window) של מיליון טוקנים, מה שמרחיב באופן מיידי את היכולת של מפתחים להריץ מודלים באופן מקומי ללא תלות ב-API סגור.
תכנון ה-MoE מגביל את מספר הפרמטרים הפעילים ל-104 מיליארד, מה שמספק כוח הסקה של מודל בעל מספר טריליונים של פרמטרים תוך שמירה על מהירות יציבה. היעילות הזו מעניקה שיפור של פי 2.5 לעומת גרסת Kimi K2 הקודמת — קפיצת מדרגה עבור כל מי שנתקל במגבלות מחשוב או שיהוי (latency) במודלים פתוחים קיימים.
למה השדרוג חשוב עכשיו
מודלים במשקלים פתוחים פיגרו באופן מסורתי אחרי מערכות קנייניות מבחינת קנה מידה ואורך הקשר. Kimi K3 משנה את כללי המשחק על ידי שילוב של גודל עצום עם חלון הקשר שמכיל מיליון טוקנים מלאים — מספיק כדי לעבד מאגר קוד שלם או מאמר מחקרי ארוך במעבר אחד. עבור מפתחים שבונים תהליכי Retrieval-Augmented Generation (RAG), עוזרים לטקסטים ארוכים או כלי ניקוי באגים אוטונומיים, ההקשר הנוסף מפחית את הצורך באסטרטגיות חלוקה (chunking).
התשתית הטכנית
- Stable LatentMoE routing: טוקנים מופנים ל-896 מומחים, כאשר 16 מומחים מופעלים לכל טוקן. הפעלה דלילה (sparse activation) זו מצמצמת את טביעת הרגל בזיכרון תוך שהיא נשענת על מאגר ידע עצום.
- Kimi Delta Attention (KDA): וריאנט חדש של מנגנון תשומת לב (attention) המייצב את זרימת המידע ברשתות עמוקות, ובכך מפחית את הסיכון לחוסר יציבות של הגרדיאנט (gradient instability) שעלול להעיב על מודלים גדולים מאוד.
- Expert-parallel training: הצוות ארגן את המחשוב כך שכל מומחה ירוץ על חלק משלו בחומרה, מה שמונע צווארי בקבוק הנוצרים כאשר מומחים רבים מתחרים על אותם משאבים.
- Advanced memory management: אסטרטגיות הקצאה מותאמות אישית מאפשרות למודל לתמוך באימון סוכנים מבוסס למידת חיזוק (reinforcement learning) מבלי לרוקן את זיכרון ה-GPU.
מה המשקלים הפתוחים מאפשרים
מכיוון שהמשקלים פתוחים לציבור, משתמשים יכולים לבקר את הייצוגים הפנימיים של המודל, לזהות הטיות או להתאים אותו לתחומים ייחודיים. כוונון עדין (fine-tuning) על נתונים קנייניים אינו דורש עוד חוזה ענן; ניתן להריץ את כל התהליך על חומרה מקומית (on-prem) העומדת בדרישות ה-expert-parallel של הצוות.
מקרי בוחן מיידיים למפתחים
- מערכות Retrieval-augmented generation השואבות מידע ממאגרי מסמכים עצומים בשאילתה (prompt) אחת.
- עוזרי כתיבת קוד לטקסטים ארוכים השומרים את הקשר הפרויקט כולו בזיכרון.
- כלי ניתוח קוד לכלל המאגר (repository) שסורקים מיליוני שורות מבלי לחרוג ממגבלת ה-prompt.
- סוכני ניקוי באגים (debugging) אוטונומיים השומרים מעקב הרצה מלא תוך הסקת מסקנות לגבי תיקונים.
