10 ڈالر کے چپ پر 180M پیرامیٹر والا LLM
p-for-llm نامی ایک نیا پروجیکٹ کچھ متاثر کن کر رہا ہے۔ یہ ESP32-P4 مائیکرو کنٹرولر پر 180.9 ملین پیرامیٹر والا ماڈل چلاتا ہے۔ اس چپ کی قیمت چھ سے دس ڈالر کے درمیان ہے۔
چھوٹی چپس پر زیادہ تر وائرل ہونے والے AI پروجیکٹس سادہ کاموں پر توجہ مرکوز کرتے ہیں۔ وہ ایک ایسا ماڈل دکھاتے ہیں جو مختصر کہانیاں لکھتا ہے۔ ان ماڈلز میں اکثر پیرامیٹرز بہت کم ہوتے ہیں اور ان کا کوئی حقیقی استعمال نہیں ہوتا۔
p-for-llm مختلف ہے۔ اس کا مقصد افادیت ہے۔
یہ اس طرح کام کرتا ہے:
- یہ Mixture-of-Experts (MoE) آرکیٹیکچر کا استعمال کرتا ہے۔
- ہر ٹوکن کے لیے، روٹر 29 میں سے ایک ماہر (expert) کا انتخاب کرتا ہے۔
- باقی 28 ماہرین غیر فعال رہتے ہیں۔
- یہ زیادہ معلومات برقرار رکھتے ہوئے کمپیوٹ پاور بچاتا ہے۔
- یہ ماڈل کو چھوٹی میموری میں فٹ کرنے کے لیے ternary weights کا استعمال کرتا ہے۔
- ماڈل سیکنڈ میں تقریباً 9 ٹوکنز تیار کرتا ہے۔
ٹریننگ کا عمل بھی قابل ذکر ہے۔ ڈویلپر نے صرف ایک RTX 5060 Ti کنزیومر گرافکس کارڈ کا استعمال کیا۔ یہاں کوئی بڑی لیبارٹری یا بھاری بجٹ نہیں ہے۔ بس ایک شخص، ایک درمیانے درجے کا GPU اور صبر و تحمل ہے۔
ایک ایسی بات ہے جو آپ کو معلوم ہونی چاہیے۔ ماڈل ابھی مکمل طور پر خود مختار نہیں ہے۔ آپ کو اسٹارٹ اپ کے وقت USB کے ذریعے بورڈ پر weights منتقل کرنے پڑتے ہیں۔ یہ ابھی تک کوئی ایسا اسٹینڈ الون ڈیوائس نہیں ہے جو SD کارڈ سے لوڈ ہو سکے۔
یہ ابھی کلاؤڈ ڈیمو نہیں ہے۔ تمام حساب کتاب مقامی طور پر چپ پر ہوتا ہے۔ یہ ان پروجیکٹس کے مقابلے میں ایک بہت بڑا قدم ہے جو صرف سرور پر ڈیٹا اسٹریم کرتے ہیں۔
یہ کیوں اہم ہے؟
چھوٹے ماڈلز عام طور پر ایک حد پر آ کر رک جاتے ہیں۔ وہ دلچسپ تو ہو سکتے ہیں لیکن ہدایات پر عمل نہیں کر سکتے۔ p-for-llm اس حد کو عبور کرنے کی کوشش کرتا ہے۔ یہ ChatML پرامپٹس کو سپورٹ کرتا ہے اور ٹول کالنگ کے ابتدائی آثار دکھاتا ہے۔
یہ پروجیکٹ ظاہر کرتا ہے کہ حقیقی ترقی اکثر خاموشی سے ہوتی ہے۔ جہاں وائرل پروجیکٹس شہرت کے پیچھے بھاگتے ہیں، وہیں سنجیدہ بنانے والے اپنی حدود اور تفصیلات شائع کرتے ہیں۔
میں ان اعداد و شمار کی تصدیق کے لیے ذاتی طور پر اس ہارڈ ویئر کی جانچ کروں گا۔
Optional learning community: https://t.me/GyaanSetuAi
