Kimi K3، Kimi ٹیم کا تازہ ترین اوپن ویٹس ماڈل، 2.8 ٹریلین پیرامیٹر مکسچر آف ایکسپرٹس (MoE) بیک بون اور 1 ملین ٹوکن کانٹیکسٹ ونڈو کے ساتھ آتا ہے، جو فوری طور پر ڈویلپرز کے لیے ان صلاحیتوں کو بڑھا دیتا ہے جنہیں وہ کسی کلوزڈ-API لاک-ان کے بغیر مقامی طور پر چلا سکتے ہیں۔

MoE ڈیزائن فعال پیرامیٹر کی تعداد کو 104 بلین تک محدود رکھتا ہے، جس سے رفتار کو مستحکم رکھتے ہوئے ملٹی ٹریلین ماڈل جیسی استدلال کی طاقت حاصل ہوتی ہے۔ یہ کارکردگی پچھلے Kimi K2 ورژن کے مقابلے میں 2.5 گنا اضافہ فراہم کرتی ہے—یہ ان تمام لوگوں کے لیے ایک بڑی چھلانگ ہے جو موجودہ اوپن ماڈلز پر کمپیوٹ یا لیٹنسی کی حدوں کا سامنا کر رہے ہیں۔

یہ اپ گریڈ اب کیوں اہم ہے

اوپن ویٹس ماڈلز روایتی طور پر پیمانے اور کانٹیکسٹ کی لمبائی کے معاملے میں ملکیتی (proprietary) سسٹمز سے پیچھے رہے ہیں۔ Kimi K3 اس صورتحال کو بدل دیتا ہے، کیونکہ یہ اپنی وسیع وسعت کو ایک ایسے کانٹیکسٹ ونڈو کے ساتھ جوڑتا ہے جو پورے ایک ملین ٹوکنز کو سنبھال سکتا ہے—جو ایک ہی بار میں مکمل کوڈ ریپوزٹری یا ایک طویل تحقیقی مقالہ پڑھنے کے لیے کافی ہے۔ ان ڈویلپرز کے لیے جو retrieval-augmented generation (RAG) پائپ لائنز، طویل فارم اسسٹنٹس، یا خود مختار ڈی بگنگ ٹولز بنا رہے ہیں، یہ اضافی کانٹیکسٹ چنکنگ (chunking) کی حکمت عملیوں کی ضرورت کو کم کر دیتا ہے۔

تکنیکی ڈھانچہ

  • Stable LatentMoE routing: ٹوکنز کو 896 ماہرین (experts) میں تقسیم کیا جاتا ہے، جن میں سے ہر ٹوکن کے لیے 16 ماہرین کو فعال کیا جاتا ہے۔ یہ سپارس ایکٹیویشن میموری کے استعمال کو کم کرتی ہے جبکہ معلومات کے ایک وسیع ذخیرے سے فائدہ اٹھاتی رہتی ہے۔
  • Kimi Delta Attention (KDA): ایک نیا attention variant جو گہرے نیٹ ورکس میں معلومات کے بہاؤ کو مستحکم کرتا ہے، جس سے گریڈینٹ عدم استحکام (gradient instability) کا خطرہ کم ہو جاتا ہے جو کہ بہت بڑے ماڈلز کے لیے مسئلہ بن سکتا ہے۔
  • Expert-parallel training: ٹیم نے کمپیوٹ کو اس طرح ترتیب دیا ہے کہ ہر ماہر (expert) اپنے ہارڈ ویئر کے مخصوص حصے پر چلتا ہے، جس سے ان رکاوٹوں (bottlenecks) سے بچا جا سکتا ہے جو اس وقت پیدا ہوتی ہیں جب بہت سے ماہرین ایک ہی وسائل کے لیے مقابلہ کرتے ہیں۔
  • Advanced memory management: کسٹم الاکیشن حکمت عملیوں کی بدولت ماڈل GPU میموری کو ختم کیے بغیر reinforcement-learning پر مبنی ایجنٹ ٹریننگ کو سپورٹ کر سکتا ہے۔

اوپن ویٹس کیا ممکن بناتے ہیں

چونکہ ویٹس عوامی طور پر دستیاب ہیں، صارفین ماڈل کی اندرونی نمائندگی (internal representations) کا آڈٹ کر سکتے ہیں، تعصبات (biases) کی نشاندہی کر سکتے ہیں، یا اسے مخصوص شعبوں کے لیے تیار کر سکتے ہیں۔ ملکیتی ڈیٹا پر fine-tuning کے لیے اب کلاؤڈ کنٹریکٹ کی ضرورت نہیں ہے؛ پوری پائپ لائن آن پریم (on-prem) ہارڈ ویئر پر چلائی جا سکتی ہے جو ٹیم کی expert-parallel ضروریات کو پورا کرتی ہو۔

ڈویلپرز کے لیے فوری استعمال کے کیسز

  • Retrieval-augmented generation سسٹمز جو ایک ہی پرامپٹ میں وسیع دستاویزاتی ذخائر سے معلومات حاصل کرتے ہیں۔
  • طویل فارم کوڈنگ اسسٹنٹس جو پورے پروجیکٹ کے کانٹیکسٹ کو میموری میں رکھتے ہیں۔
  • ریپوزٹری پر مبنی کوڈ تجزیہ کرنے والے ٹولز جو پرامپٹ کو خراب کیے بغیر لاکھوں لائنوں کو اسکین کرتے ہیں۔
  • خود مختار ڈی بگنگ ایجنٹس جو اصلاحات کے بارے میں استدلال کرتے ہوئے مکمل ایگزیکیوشن ٹریس (execution trace) برقرار رکھتے ہیں۔