Cerebras যেখানে কাস্টম AI চিপ তৈরি করছে, ফরাসি স্টার্টআপ Kog সেখানে এন্টারপ্রাইজগুলোর কাছে থাকা বিদ্যমান GPU থেকে সর্বোচ্চ পারফরম্যান্স বের করে আনছে। বিদ্যমান ডেটাসেন্টার হার্ডওয়্যারের জন্য লো-লেভেল সফটওয়্যার নতুন করে লেখার মাধ্যমে, Kog সেই ল্যাটেন্সি বা বিলম্বের বাধাগুলো দূর করে যা AI ওয়ার্কফ্লোকে ধীর করে দেয়।

কাস্টম AI সিলিকনের প্রয়োজনীয়তাকে চ্যালেঞ্জ জানানো

AI শিল্প এখন ইনফারেন্সের জন্য বিশেষায়িত চিপের দিকে ঝুঁকে পড়েছে। Kog-এর CEO, Gaël Delalleau বলেন, সাধারণ GPU দিয়ে ডিকোডিং করা সম্ভব নয়—এই ধারণাটি ভুল। আধুনিক GPU—Nvidia H200, AMD MI300X—এমন মেমরি ব্যান্ডউইথ প্রদান করে যা বর্তমান সফটওয়্যারগুলো ব্যবহার না করেই ফেলে রাখে।

Kog-এর Kog Inference Engine (KIE) "অত্যন্ত দ্রুত সিঙ্গেল-রিকোয়েস্ট ডিকোডিং"-এর লক্ষ্য রাখে, যা রিয়েল-টাইম অ্যাপ্লিকেশনের জন্য অপরিহার্য। একটি সাম্প্রতিক ডেমোতে কোম্পানিটি Laneformer 2B (তাদের স্ট্যাকের জন্য টিউন করা একটি ওপেন-সোর্স ২-বিলিয়ন প্যারামিটার মডেল) ব্যবহার করে প্রতি সেকেন্ডে ৩,০০০ টোকেন (TPS) গতি অর্জন করেছে। ডেমোতে একটি ছোট মডেল ব্যবহার করা হলেও, Kog এই সাফল্য আরও বড় LLM-গুলোতে সম্প্রসারণ করার পরিকল্পনা করছে।

GPU ইঞ্জিনিয়ারিংয়ে একটি "হ্যাকার" দৃষ্টিভঙ্গি

ZML-এর মতো হার্ডওয়্যার-অ্যাগনস্টিক (hardware-agnostic) প্রদানকারীদের বিপরীতে, Kog অনেক গভীরে কাজ করে। তাদের টিম অ্যাসেম্বলি এবং বাইনারি লেভেলে GPU-কে রিভার্স-ইঞ্জিনিয়ার করে, যেখানে সিলিকনকে আয়ত্ত করার জন্য এক সেট ভৌত নিয়ম হিসেবে বিবেচনা করা হয়।

এই লো-লেভেল ফোকাস প্রতিটি ওজ পরিমাণ দক্ষতা বের করে আনে, তবে এর জন্য সময়ের প্রয়োজন হয়। মাত্র ১১ জন ইঞ্জিনিয়ারের একটি ছোট টিমের মাধ্যমে, Kog প্রতিটি নতুন GPU আর্কিটেকচার সাপোর্ট করার আগে সেটি বিশ্লেষণ করতে সপ্তাহ বা মাস ব্যয় করে। এই পদ্ধতিটি শীর্ষমানের পারফরম্যান্স প্রদান করলেও, Kog কত দ্রুত নতুন হার্ডওয়্যার কভার করতে পারবে তার ওপর সীমাবদ্ধতা তৈরি করে।

উচ্চ-মূল্যের AI ব্যবহারের ক্ষেত্রগুলোকে লক্ষ্য করা

Kog সেই সব সেক্টরে মনোযোগ দেয় যেখানে ল্যাটেন্সি বা বিলম্ব মানেই রাজস্বের ক্ষতি:

  • সফটওয়্যার ইঞ্জিনিয়ারিং: Claude Code-এর মতো টুলগুলো কয়েক মিনিট আটকে থাকে। Kog লক্ষ্য রাখছে "ঘন্টার পর ঘন্টা অপেক্ষা"-কে প্রায় তাৎক্ষণিক ফলাফলে পরিণত করার।
  • জেনারেটিভ অ্যাপ/গেম ডিজাইন: ব্যবহারকারীদের ধরে রাখতে এবং রেভিনিউ বা আয় বজায় রাখতে প্রম্পট-টু-অ্যাপ পাইপলাইনের দ্রুত ইটারেশন প্রয়োজন।

কোম্পানির পরবর্তী মাইলফলক হলো তাদের প্রথম বড় স্কেলের মডেলে ১০ গুণ গতি বৃদ্ধি করা। Scaleway, Bpifrance এবং French Tech 2030 প্রোগ্রামের সহায়তায়, Kog ইউরোপের AI সার্বভৌমত্ব চালনায় নিজেকে একজন গুরুত্বপূর্ণ খেলোয়াড় হিসেবে প্রতিষ্ঠিত করছে।

মূল বিষয়সমূহ

  • হার্ডওয়্যারের চেয়ে অপ্টিমাইজেশন: Kog অত্যন্ত লো-লেভেল সফটওয়্যার ইঞ্জিনিয়ারিংয়ের মাধ্যমে Nvidia H200 এবং AMD MI300X GPU-এর মেমরি ব্যান্ডউইথকে সর্বোচ্চ সীমায় নিয়ে যায়।
  • ল্যাটেন্সি বা বিলম্বের বাধা ভাঙা: স্টার্টআপটি অটোমেটেড কোডিং এবং জেনারেটিভ ডিজাইনের মতো রিয়েল-টাইম প্রফেশনাল ওয়ার্কফ্লোর জন্য LLM ইনফারেন্স স্পিডে ৩০ গুণ বৃদ্ধির লক্ষ্য নির্ধারণ করেছে।
  • ডিপ-লেভেল ইঞ্জিনিয়ারিং: একটি "হ্যাকার" মানসিকতা গ্রহণ করে, Kog GPU অ্যাসেম্বলি এবং বাইনারি কোড রিভার্স-ইঞ্জিনিয়ার করে এমন পারফরম্যান্স অর্জন করে যা সাধারণ স্ট্যাকগুলো অর্জন করতে পারে না।

ফরাসি স্টার্টআপ Kog জানিয়েছে যে, তাদের Kog Inference Engine-এর লক্ষ্য হলো ডেটা-সেন্টার অপারেটরদের কাছে থাকা বিদ্যমান Nvidia H200 বা AMD MI300X GPU-তে লার্জ-ল্যাঙ্গুয়েজ-মডেল (LLM) ডিকোডিং ৩০ গুণ পর্যন্ত দ্রুত চালানো।

কেন এখন গতির জন্য এই প্রচেষ্টা গুরুত্বপূর্ণ

LLM ইনফারেন্স এখন কোড-কমপ্লিশন অ্যাসিস্ট্যান্ট, অন-দ্য-ফ্লাই কন্টেন্ট জেনারেটর এবং ইন্টারেক্টিভ গেম-ডিজাইন টুলের মতো পণ্যগুলোর গতি কমিয়ে দিচ্ছে। এই পরিস্থিতিতে, ব্যবহারকারীর প্রম্পট এবং মডেলের উত্তরের মধ্যবর্তী ব্যবধান সরাসরি উৎপাদনশীলতা এবং আয়ের ওপর প্রভাব ফেলে। CUDA-এর মতো হাই-লেভেল API-গুলো GPU মেমরি ব্যান্ডউইথের একটি বড় অংশ অব্যবহৃত রেখে দেয়, বিশেষ করে টোকেন-বাই-টোকেন ডিকোডিংয়ের সময়, যা রিয়েল-টাইম ব্যবহারের ক্ষেত্রে প্রধান ভূমিকা পালন করে।

Kog-এর লো-লেভেল সমাধান

Kog প্রচলিত সফটওয়্যার লেয়ারগুলো বাদ দিয়ে সরাসরি সিলিকনের সাথে যোগাযোগ করে। তাদের ইঞ্জিনিয়াররা অ্যাসেম্বলি লেভেলে GPU-কে রিভার্স-ইঞ্জিনিয়ার করে, যেখানে হার্ডওয়্যারকে কোনো ব্ল্যাক বক্স হিসেবে না দেখে বরং মেনে চলার জন্য এক সেট সীমাবদ্ধতা (constraints) হিসেবে বিবেচনা করা হয়। এর ফলে একটি কাস্টম এক্সিকিউশন পাথ তৈরি হয় যা GPU-এর মেমরি পাইপের মাধ্যমে ডেটা প্রায় পূর্ণ ক্ষমতায় প্রবাহিত রাখতে পারে।

একটি সাম্প্রতিক ডেমোতে কোম্পানিটি Laneformer 2B—তাদের স্ট্যাকের জন্য টিউন করা একটি ২-বিলিয়ন প্যারামিটার ওপেন-সোর্স মডেল—চালিয়েছে এবং উচ্চ টোকেন থ্রুপুট রিপোর্ট করেছে। বড় বাণিজ্যিক সিস্টেমের তুলনায় মডেলটি ছোট হলেও, এই গতির বৃদ্ধি দেখায় যে একটি বিশেষায়িত সফটওয়্যার স্ট্যাক একই হার্ডওয়্যার থেকে কী পরিমাণ সুবিধা বের করে আনতে পারে।

ইঞ্জিনিয়ারিংয়ের ভারসাম্য বা ট্রেড-অফ

এই সুবিধার বিপরীতে একটি বড় চ্যালেঞ্জ রয়েছে। Kog-এর ১১ জন ইঞ্জিনিয়ারের টিম প্রতিটি নতুন GPU আর্কিটেকচার সাপোর্ট করার আগে সেটি বিশ্লেষণ করতে সপ্তাহ বা মাস ব্যয় করে। এই গভীরতা লক্ষ্য করা কার্ডগুলোতে উচ্চ পারফরম্যান্স প্রদান করলেও, এর মানে হলো Kog বাজারে আসা প্রতিটি নতুন GPU-এর জন্য তাৎক্ষণিকভাবে সাপোর্ট যোগ করতে পারে না। গ্রাহকরা কেবল তখনই উপকৃত হবেন যদি তাদের কাছে Kog-এর অপ্টিমাইজ করা Nvidia H200 বা AMD MI300X GPU থাকে।

কারা লাভবান হবে

  • Software-engineering tools – Products that generate code, such as Claude Code, often stall for minutes while the model processes a request. Cutting that wait to a few seconds would make interactive development far more fluid.
  • Generative design pipelines – Studios turning textual prompts into app prototypes or game assets need rapid iteration to keep creators engaged. Faster decoding shortens design loops and boosts conversion rates.

Both sectors translate latency directly into lost billable hours or churn, so a 30× speed boost could be a decisive competitive edge.

The broader picture

Kog’s strategy runs counter to the industry trend of building custom AI silicon. Companies like Cerebras pour billions into chips that promise higher throughput per watt. Kog argues that today’s GPUs already have enough memory bandwidth for decoding; the missing piece is software that can actually use it. If the claim holds at scale, developers could defer costly hardware upgrades and rely on a software upgrade to achieve near-real-time inference.

Potential headwinds

  • Maintenance burden – Every new GPU generation will require fresh reverse-engineering. As the market diversifies, the small team could be stretched thin.
  • Scalability to larger models – The demo used a 2 B-parameter model. Scaling the same techniques to much larger systems may hit memory-capacity limits or demand additional engineering tricks not yet disclosed.
  • Alternative paths – Cloud providers already offer inference-optimized instances that bundle specialized chips and software. For some workloads, the marginal gain from Kog’s stack may not outweigh the convenience of a managed service.

What to watch

  • First large-model rollout – Kog says its next milestone is a 10× speedup on a “major large-scale model.” The gap between the 2 B demo and an enterprise-grade model will be the clearest test of the approach.
  • Hardware support expansion – Adding support for newer GPUs or other accelerators will signal whether the low-level model can keep pace with rapid hardware cadence.

Takeaway

Kog shows that squeezing more work from existing GPUs is possible when you rewrite the software stack from the ground up. The promise of 30× faster LLM decoding could reshape how developers price and architect AI services—provided the company can sustain the intense engineering effort needed for each new piece of silicon.