جہاں Cerebras کسٹم AI چپس بناتا ہے، وہیں فرانسیسی اسٹارٹ اپ Kog ان GPUs سے بھرپور کارکردگی حاصل کرتا ہے جو ادارے پہلے سے ہی استعمال کر رہے ہیں۔ موجودہ ڈیٹا سینٹر ہارڈ ویئر کے لیے لو-لیول (low-level) سافٹ ویئر کو دوبارہ لکھ کر، Kog ان لیٹنسی (latency) رکاوٹوں کو ختم کرتا ہے جو AI ورک فلو کو سست کرتی ہیں۔
کسٹم AI سلیکون کی ضرورت کو چیلنج کرنا
AI انڈسٹری اب انفرنس (inference) کے لیے خاص طور پر تیار کردہ چپس کی طرف مائل ہو گئی ہے۔ Kog کے CEO، Gaël Delalleau کا کہنا ہے کہ یہ خیال کہ معیاری GPUs ڈی کوڈنگ (decoding) نہیں سنبھال سکتے، غلط ہے۔ جدید GPUs—Nvidia H200، AMD MI300X—ایسی میموری بینڈوتھ (memory bandwidth) فراہم کرتے ہیں جسے موجودہ سافٹ ویئر غیر استعمال شدہ چھوڑ دیتا ہے۔
Kog کا Kog Inference Engine (KIE) "انتہائی تیز سنگل-ریکویسٹ ڈی کوڈنگ" کو ہدف بناتا ہے، جو کہ ریئل ٹائم ایپس کے لیے ناگزیر ہے۔ ایک حالیہ ڈیمو میں کمپنی نے Laneformer 2B کے ساتھ 3,000 ٹوکن فی سیکنڈ (TPS) کا ہدف حاصل کیا، جو کہ ان کے اسٹیک کے لیے تیار کردہ ایک اوپن سورس 2-بلین پیرامیٹر ماڈل ہے۔ ڈیمو میں ایک چھوٹا ماڈل استعمال کیا گیا ہے، لیکن Kog ان فوائد کو بہت بڑے LLMs تک پھیلانے کا ارادہ رکھتا ہے۔
GPU انجینئرنگ کے لیے ایک "ہیکر" طرز کا طریقہ کار
ZML جیسے ہارڈ ویئر سے آزاد فراہم کنندگان کے برعکس، Kog گہرائی میں جاتا ہے۔ ٹیم GPUs کو اسمبلی اور بائنری لیولز پر ریورس انجینئر کرتی ہے، اور سلیکون کو مہارت حاصل کرنے کے لیے طبیعی قوانین کے ایک مجموعے کے طور پر دیکھتی ہے۔
یہ لو-لیول توجہ کارکردگی کا ہر قطرہ نکال لیتی ہے، لیکن اس میں وقت لگتا ہے۔ 11 انجینئرز کی ایک مختصر ٹیم کے ساتھ، Kog سپورٹ شامل کرنے سے پہلے ہر نئے GPU آرکیٹیکچر کا باریک بینی سے جائزہ لینے میں ہفتوں یا مہینے صرف کرتا ہے۔ یہ طریقہ اعلیٰ درجے کی کارکردگی فراہم کرتا ہے لیکن اس سے یہ حد بندی ہو جاتی ہے کہ Kog کتنی تیزی سے نئے ہارڈ ویئر کو کور کر سکتا ہے۔
اعلیٰ قدر والے AI استعمال کے کیسز کو ہدف بنانا
Kog ان شعبوں پر توجہ مرکوز کرتا ہے جہاں لیٹنسی کا مطلب ہے آمدنی کا نقصان:
- Software engineering: Claude Code جیسے ٹولز منٹوں کے لیے رک جاتے ہیں۔ Kog کا مقصد "گھنٹوں انتظار" کو تقریباً فوری نتائج میں بدلنا ہے۔
- Generative app/game design: صارفین کو مصروف رکھنے اور آمدنی برقرار رکھنے کے لیے پرامپٹ-ٹو-ایپ (prompt-to-app) پائپ لائنز کو تیز رفتار تکرار کی ضرورت ہوتی ہے۔
کمپنی کا اگلا سنگ میل اپنے پہلے بڑے پیمانے کے ماڈل پر 10 گنا رفتار میں اضافہ کرنا ہے۔ Scaleway، Bpifrance اور French Tech 2030 پروگرام کے تعاون سے، Kog خود کو یورپ کی AI خودمختاری کی مہم میں ایک اہم کھلاڑی کے طور پر پیش کرتا ہے۔
اہم نکات
- ہارڈ ویئر کے بجائے آپٹیمائزیشن: Kog انتہائی لو-لیول سافٹ ویئر انجینئرنگ کے ذریعے Nvidia H200 اور AMD MI300X GPUs کی میموری بینڈوتھ کو حد تک لے جاتا ہے۔
- لیٹنسی کی رکاوٹ کو توڑنا: اسٹارٹ اپ ریئل ٹائم پروفیشنل ورک فلو جیسے کہ خودکار کوڈنگ اور جنریٹیو ڈیزائن کے لیے LLM انفرنس کی رفتار میں 30 گنا اضافے کا ہدف رکھتا ہے۔
- ڈیپ-لیول انجینئرنگ: "ہیکر" ذہنیت اپنانے کے ذریعے، Kog GPU اسمبلی اور بائنری کوڈ کو ریورس انجینئر کرتا ہے تاکہ ایسی کارکردگی حاصل کی جا سکے جو معیاری اسٹیکس نہیں پہنچ سکتے۔
ایک فرانسیسی اسٹارٹ اپ، Kog کا کہنا ہے کہ اس کا Kog Inference Engine اسی Nvidia H200 یا AMD MI300X GPUs پر LLM ڈی کوڈنگ کو 30 گنا تک تیز چلانے کا ہدف رکھتا ہے جو ڈیٹا سینٹر آپریٹرز کے پاس پہلے سے موجود ہیں۔
رفتار کے لیے کوشش اب کیوں اہم ہے
LLM انفرنس اب کوڈ-کمپلیشن اسسٹنٹ، آن دی فلائی (on-the-fly) مواد تیار کرنے والے ٹولز، اور انٹرایکٹو گیم ڈیزائن ٹولز جیسے پروڈکٹس کی رفتار کو سست کر رہا ہے۔ ان حالات میں، صارف کے پرامپٹ اور ماڈل کے جواب کے درمیان وقفہ براہ راست پیداواریت اور آمدنی پر اثر انداز ہوتا ہے۔ CUDA جیسی ہائی-لیول APIs میموری بینڈوتھ کا ایک بڑا حصہ غیر استعمال شدہ چھوڑ دیتی ہیں، خاص طور پر ٹوکن-بائی-ٹوکن ڈی کوڈنگ کے دوران، جو ریئل ٹائم استعمال کے کیسز میں غالب ہوتی ہے۔
Kog کا لو-لیول جواب
Kog روایتی سافٹ ویئر لیئرز کو چھوڑ کر براہ راست سلیکون سے بات کرتا ہے۔ اس کے انجینئرز اسمبلی لیول پر GPU کو ریورس انجینئر کرتے ہیں، اور ہارڈ ویئر کو ایک ایسی چیز کے طور پر دیکھتے ہیں جس پر عمل کرنا ضروری ہے، نہ کہ کسی ایسی بلیک باکس کے طور پر جسے صرف ایبسٹریکٹ (abstract) کیا جائے۔ اس کا نتیجہ ایک کسٹم ایگزیکیوشن پاتھ کی صورت میں نکلتا ہے جو ڈیٹا کو GPU کے میموری پائپس کے ذریعے تقریباً مکمل صلاحیت کے ساتھ بہنے میں مدد دیتا ہے۔
ایک حالیہ ڈیمو میں کمپنی نے Laneformer 2B—جو کہ ان کے اسٹیک کے لیے تیار کردہ ایک 2-بلین پیرامیٹر اوپن سورس ماڈل ہے—چلایا اور زیادہ ٹوکن تھرو پٹ (throughput) رپورٹ کیا۔ یہ ماڈل بڑے تجارتی سسٹمز کے مقابلے میں معمولی ہے، لیکن رفتار میں اضافہ یہ ظاہر کرتا ہے کہ ایک خاص مقصد کے لیے تیار کردہ سافٹ ویئر اسٹیک اسی ہارڈ ویئر سے کیا کچھ حاصل کر سکتا ہے۔
انجینئرنگ کا توازن (Trade-off)
اس کا فائدہ ایک بھاری قیمت کے ساتھ آتا ہے۔ Kog کی 11 انجینئرز کی ٹیم ہر نئے GPU آرکیٹیکچر کو سپورٹ کرنے سے پہلے اس کا باریک بینی سے جائزہ لینے میں ہفتوں یا مہینے صرف کرتی ہے۔ یہ گہرائی ہدف بنائے گئے کارڈز پر اعلیٰ کارکردگی تو فراہم کرتی ہے، لیکن اس کا مطلب یہ بھی ہے کہ Kog مارکیٹ میں آنے والے ہر نئے GPU کے لیے فوری طور پر سپورٹ فراہم نہیں کر سکتا۔ صارفین کو صرف اس صورت میں فائدہ ہوتا ہے اگر ان کے پاس Nvidia H200 یا AMD MI300X GPUs موجود ہوں جنہیں Kog پہلے ہی آپٹیمائز کر چکا ہے۔
کس کو فائدہ ہوگا
- Software-engineering tools – Products that generate code, such as Claude Code, often stall for minutes while the model processes a request. Cutting that wait to a few seconds would make interactive development far more fluid.
- Generative design pipelines – Studios turning textual prompts into app prototypes or game assets need rapid iteration to keep creators engaged. Faster decoding shortens design loops and boosts conversion rates.
Both sectors translate latency directly into lost billable hours or churn, so a 30× speed boost could be a decisive competitive edge.
The broader picture
Kog’s strategy runs counter to the industry trend of building custom AI silicon. Companies like Cerebras pour billions into chips that promise higher throughput per watt. Kog argues that today’s GPUs already have enough memory bandwidth for decoding; the missing piece is software that can actually use it. If the claim holds at scale, developers could defer costly hardware upgrades and rely on a software upgrade to achieve near-real-time inference.
Potential headwinds
- Maintenance burden – Every new GPU generation will require fresh reverse-engineering. As the market diversifies, the small team could be stretched thin.
- Scalability to larger models – The demo used a 2 B-parameter model. Scaling the same techniques to much larger systems may hit memory-capacity limits or demand additional engineering tricks not yet disclosed.
- Alternative paths – Cloud providers already offer inference-optimized instances that bundle specialized chips and software. For some workloads, the marginal gain from Kog’s stack may not outweigh the convenience of a managed service.
What to watch
- First large-model rollout – Kog says its next milestone is a 10× speedup on a “major large-scale model.” The gap between the 2 B demo and an enterprise-grade model will be the clearest test of the approach.
- Hardware support expansion – Adding support for newer GPUs or other accelerators will signal whether the low-level model can keep pace with rapid hardware cadence.
Takeaway
Kog shows that squeezing more work from existing GPUs is possible when you rewrite the software stack from the ground up. The promise of 30× faster LLM decoding could reshape how developers price and architect AI services—provided the company can sustain the intense engineering effort needed for each new piece of silicon.
