מודל ה-LLM בעל 180 מיליון הפרמטרים על שבב של 10 דולר
פרויקט חדש בשם p-for-llm עושה משהו מרשים. הוא מריץ מודל של 180.9 מיליון פרמטרים על מיקרו-בקר ESP32-P4. השבב הזה עולה בין שישה לעשרה דולרים.
רוב פרויקטי ה-AI הוויראליים על שבבים קטנים מתמקדים במשימות פשוטות. הם מציגים מודל שכותב סיפורים קצרים. למודלים האלה יש לרוב מעט מאוד פרמטרים ואין להם תועלת ממשית.
p-for-llm שונה. הוא שואף לשימושיות.
כך זה עובד:
- הוא משתמש בארכיטקטורת Mixture-of-Experts (MoE).
- עבור כל טוקן (token), הנתב (router) בוחר מומחה אחד מתוך 29.
- 28 המומחים האחרים נשארים כבויים.
- זה חוסך בכוח מחשוב תוך שמירה על רמת ידע גבוהה.
- הוא משתמש במשקלים טרינריים (ternary weights) כדי להכניס את המודל לזיכרון קטן.
- המודל מייצר כ-9 טוקנים בשנייה.
גם תהליך האימון ראוי לציון. המפתח השתמש בכרטיס מסך צרכני בודד מסוג RTX 5060 Ti. אין כאן מעבדה ענקית או תקציב עצום. רק אדם אחד עם GPU בטווח הביניים וסבלנות.
ישנה בעיה אחת שכדאי להכיר. המודל עדיין לא אוטונומי לחלוטין. עליך להעלות את המשקלים ללוח דרך USB בעת ההפעלה. הוא עדיין לא מכשיר עצמאי שטוען נתונים מכרטיס SD.
זה עדיין לא דמו ענן. החישובים מתבצעים מקומית על השבב. זהו צעד עצום מעל פרויקטים שרק מעבירים (stream) נתונים לשרת.
למה זה חשוב?
מודלים קטנים בדרך כלל נתקלים ב"קיר". הם יכולים להיות מקסימים, אך הם לא מסוגלים לבצע הוראות. p-for-llm מנסה לצלוח את המכשול הזה. הוא תומך ב-prompts מסוג ChatML ומראה סימנים ראשוניים של tool calling.
הפרויקט הזה מראה שקידמה אמיתית מתרחשת לעיתים קרובות בשקט. בעוד פרויקטים ויראליים רודפים אחרי כותרות, בונים רציניים מפרסמים את המגבלות שלהם ואת הערות השוליים שלהם.
אני אבחן את החומרה הזו באופן אישי כדי לאמת את המספרים הללו.
קהילת למידה אופציונלית: https://t.me/GyaanSetuAi
