در حالی که Cerebras در حال ساخت تراشه‌های اختصاصی هوش مصنوعی است، استارتاپ فرانسوی Kog عملکرد را از GPUهایی که شرکت‌ها از قبل در اختیار دارند، استخراج می‌کند. Kog با بازنویسی نرم‌افزارهای سطح پایین برای سخت‌افزارهای موجود در مراکز داده، گلوگاه‌های تأخیر (latency) را که باعث کندی جریان‌های کاری هوش مصنوعی می‌شوند، از بین می‌برد.

به چالش کشیدن ضرورت سیلیکون‌های اختصاصی هوش مصنوعی

صنعت هوش مصنوعی به سمت تراشه‌های ساخته‌شده برای استنتاج (inference) تغییر جهت داده است. Gaël Delalleau، مدیرعامل Kog، می‌گوید این باور که GPUهای استاندارد نمی‌توانند رمزگشایی (decoding) را انجام دهند، اشتباه است. GPUهای مدرن — مانند Nvidia H200 و AMD MI300X — پهنای باند حافظه‌ای را ارائه می‌دهند که نرم‌افزارهای فعلی آن را بلااستفاده رها می‌کنند.

Kog Inference Engine (KIE) شرکت Kog، «رمزگشایی بسیار سریع برای تک‌درخواست» را هدف قرار داده است؛ ویژگی‌ای که برای اپلیکیشن‌های بلادرنگ (real-time) ضروری است. در یک دمو اخیر، این شرکت با استفاده از Laneformer 2B (یک مدل متن‌باز با ۲ میلیارد پارامتر که برای پشته نرم‌افزاری آن‌ها بهینه شده است)، به سرعت ۳۰۰۰ توکن در ثانیه (TPS) دست یافت. اگرچه این دمو از یک مدل کوچک استفاده می‌کند، اما Kog قصد دارد این دستاوردها را به مدل‌های زبانی بزرگ‌تر (LLMs) نیز تعمیم دهد.

رویکردی «هکری» به مهندسی GPU

برخلاف ارائه‌دهندگان مستقل از سخت‌افزار (hardware-agnostic) مانند ZML، Kog عمیق‌تر عمل می‌کند. این تیم GPUها را در سطوح اسمبلی (assembly) و باینری (binary) مهندسی معکوس می‌کند و با سیلیکون مانند مجموعه‌ای از قوانین فیزیکی برخورد می‌کند که باید بر آن‌ها مسلط شد.

این تمرکز بر سطح پایین، تمام قطره‌های کارایی را استخراج می‌کند، اما هزینه زمان را به همراه دارد. Kog با تیم کوچکی متشکل از ۱۱ مهندس، هفته‌ها یا ماه‌ها وقت صرف کالبدشکافی هر معماری جدید GPU می‌کند تا بتواند پشتیبانی از آن را اضافه کند. این روش عملکردی در سطح بالا ارائه می‌دهد، اما سرعت پوشش دادن سخت‌افزارهای جدید توسط Kog را محدود می‌کند.

هدف قرار دادن موارد استفاده با ارزش بالای هوش مصنوعی

Kog بر بخش‌هایی تمرکز دارد که در آن‌ها تأخیر به معنای از دست رفتن درآمد است:

  • مهندسی نرم‌افزار: ابزارهایی مانند Claude Code برای دقایق متوقف می‌شوند. هدف Kog تبدیل «ساعت‌ها انتظار» به نتایج تقریباً آنی است.
  • طراحی اپلیکیشن/بازی‌های مولد: خط لوله‌های تبدیل دستور (prompt) به اپلیکیشن، برای حفظ تعامل کاربران و جریان درآمد، به تکرار و اصلاح سریع نیاز دارند.

نقطه عطف بعدی شرکت، دستیابی به ۱۰ برابر سرعت بیشتر در اولین مدل بزرگ‌مقیاس اصلی خود است. Kog با حمایت Scaleway، Bpifrance و برنامه French Tech 2030، خود را به عنوان یک بازیگر کلیدی در تلاش اروپا برای حاکمیت در حوزه هوش مصنوعی معرفی می‌کند.

نکات کلیدی

  • بهینه‌سازی به جای سخت‌افزار: Kog با مهندسی نرم‌افزار بسیار سطح پایین، پهنای باند حافظه GPUهای Nvidia H200 و AMD MI300X را به حد نهایی می‌رساند.
  • شکستن سد تأخیر: این استارتاپ هدف خود را افزایش ۳۰ برابری سرعت استنتاج LLM برای جریان‌های کاری حرفه‌ای و بلادرنگ، مانند کدنویسی خودکار و طراحی مولد، قرار داده است.
  • مهندسی در سطوح عمیق: Kog با اتخاذ طرز فکر «هکری»، کد اسمبلی و باینری GPU را مهندسی معکوس می‌کند تا به عملکردی دست یابد که پشته‌های نرم‌افزاری استاندارد قادر به رسیدن به آن نیستند.

Kog، یک استارتاپ فرانسوی، می‌گوید Kog Inference Engine آن را هدف گرفته است که رمزگشایی مدل‌های زبانی بزرگ (LLM) را تا ۳۰ برابر سریع‌تر روی همان GPUهای Nvidia H200 یا AMD MI300X که اپراتورهای مرکز داده در حال حاضر در اختیار دارند، اجرا کند.

چرا فشار برای سرعت در حال حاضر اهمیت دارد

استنتاج LLM در حال حاضر باعث محدود شدن عملکرد محصولاتی مانند دستیارهای تکمیل کد، تولیدکنندگان محتوای آنی و ابزارهای تعاملی طراحی بازی می‌شود. در این محیط‌ها، فاصله بین دستور (prompt) کاربر و پاسخ مدل مستقیماً بر بهره‌وری و درآمد تأثیر می‌گذارد. APIهای سطح بالا مانند CUDA بخش بزرگی از پهنای باند حافظه GPU را بلااستفاده رها می‌کنند، به‌ویژه در طول رمزگشایی توکن‌به‌توکن که در موارد استفاده بلادرنگ غالب است.

پاسخ سطح پایین Kog

Kog لایه‌های نرم‌افزاری متداول را نادیده می‌گیرد و مستقیماً با سیلیکون صحبت می‌کند. مهندسان آن GPU را در سطح اسمبلی مهندسی معکوس می‌کنند و با سخت‌افزار به جای یک جعبه سیاه برای انتزاع (abstraction)، به عنوان مجموعه‌ای از محدودیت‌ها برای رعایت کردن برخورد می‌کنند. نتیجه، یک مسیر اجرای سفارشی است که باعث می‌شود داده‌ها با ظرفیت نزدیک به کامل در لوله‌های حافظه GPU جریان یابند.

در یک دمو اخیر، این شرکت Laneformer 2B را — یک مدل متن‌باز با ۲ میلیارد پارامتر که برای پشته نرم‌افزاری آن بهینه شده است — اجرا کرد و نرخ عبور (throughput) بالای توکن را گزارش داد. این مدل در مقایسه با سیستم‌های تجاری بزرگ‌تر، کوچک است، اما افزایش سرعت نشان می‌دهد که یک پشته نرم‌افزاری اختصاصی چه میزان می‌تواند از همان سخت‌افزار بهره‌برداری کند.

موازنه مهندسی

مزیت این رویکرد با یک منحنی هزینه سنگین همراه است. تیم ۱۱ نفره مهندسان Kog هفته‌ها یا ماه‌ها وقت صرف کالبدشکافی هر معماری جدید GPU می‌کند تا بتواند از آن پشتیبانی کند. این عمق کار، عملکرد بالایی را در کارت‌های هدف‌شده به ارمغان می‌آورد، اما به این معناست که Kog نمی‌تواند بلافاصله پشتیبانی از هر GPU جدیدی را که وارد بازار می‌شود، اضافه کند. مشتریان تنها در صورتی سود می‌برند که ناوگان آن‌ها شامل GPUهای Nvidia H200 یا AMD MI300X باشد که Kog قبلاً آن‌ها را بهینه کرده است.

چه کسانی سود خواهند برد

  • ابزارهای مهندسی نرم‌افزار – محصولاتی که کد تولید می‌کنند، مانند Claude Code، اغلب در حالی که مدل در حال پردازش یک درخواست است، برای چندین دقیقه متوقف می‌شوند. کاهش این زمان انتظار به چند ثانیه، توسعه تعاملی را بسیار روان‌تر می‌کند.
  • خط لوله طراحی مولد (Generative design pipelines) – استودیوهایی که دستورات متنی را به پروتوتایپ‌های اپلیکیشن یا دارایی‌های بازی تبدیل می‌کنند، برای درگیر نگه داشتن سازندگان به تکرار سریع نیاز دارند. رمزگشایی (decoding) سریع‌تر، حلقه‌های طراحی را کوتاه‌تر کرده و نرخ تبدیل را افزایش می‌دهد.

هر دو بخش، تأخیر (latency) را مستقیماً به ساعت‌های قابل پرداخت از دست رفته یا ریزش مشتری تبدیل می‌کنند؛ بنابراین، افزایش سرعت ۳۰ برابری می‌تواند یک مزیت رقابتی تعیین‌کننده باشد.

تصویر گسترده‌تر

استراتژی Kog برخلاف روند فعلی صنعت در ساخت سیلیکون‌های اختصاصی هوش مصنوعی است. شرکت‌هایی مانند Cerebras میلیاردها دلار را صرف تراشه‌هایی می‌کنند که وعده توان عملیاتی (throughput) بالاتر در هر وات را می‌دهند. Kog استدلال می‌کند که GPUهای امروزی از قبل پهنای باند حافظه کافی برای رمزگشایی دارند؛ قطعه گمشده، نرم‌افزاری است که واقعاً بتواند از آن استفاده کند. اگر این ادعا در مقیاس بزرگ نیز صادق باشد، توسعه‌دهندگان می‌توانند ارتقای هزینه‌بر سخت‌افزار را به تعویق بیندازند و برای دستیابی به استنتاج (inference) نزدیک به زمان واقعی، به ارتقای نرم‌افزاری تکیه کنند.

چالش‌های احتمالی

  • بار نگهداری – هر نسل جدید از GPU نیازمند مهندسی معکوس مجدد خواهد بود. با متنوع شدن بازار، این تیم کوچک ممکن است با کمبود نیرو مواجه شود.
  • مقیاس‌پذیری برای مدل‌های بزرگ‌تر – در نسخه نمایشی از یک مدل با ۲ میلیارد پارامتر استفاده شده است. مقیاس‌بندی همین تکنیک‌ها برای سیستم‌های بسیار بزرگ‌تر ممکن است با محدودیت‌های ظرفیت حافظه مواجه شود یا نیازمند ترفندهای مهندسی اضافی باشد که هنوز فاش نشده‌اند.
  • مسیرهای جایگزین – ارائه‌دهندگان ابری در حال حاضر نمونه‌های (instances) بهینه‌سازی‌شده برای استنتاج را ارائه می‌دهند که تراشه‌ها و نرم‌افزارهای تخصصی را با هم ترکیب می‌کنند. برای برخی از حجم‌های کاری، سود حاشیه‌ای حاصل از پشته (stack) نرم‌افزاری Kog ممکن است از راحتی یک سرویس مدیریت‌شده کمتر باشد.

آنچه باید زیر نظر داشت

  • اولین عرضه مدل بزرگ – Kog می‌گوید نقطه عطف بعدی آن، افزایش سرعت ۱۰ برابری در یک «مدل بزرگ‌مقیاس اصلی» است. فاصله بین نسخه نمایشی ۲ میلیاردی و یک مدل در سطح سازمانی، شفاف‌ترین آزمون برای این رویکرد خواهد بود.
  • گسترش پشتیبانی از سخت‌افزار – اضافه کردن پشتیبانی از GPUهای جدیدتر یا سایر شتاب‌دهنده‌ها نشان خواهد داد که آیا این مدل سطح پایین (low-level) می‌تواند با سرعت بالای تغییرات سخت‌افزاری همگام شود یا خیر.

جمع‌بندی

Kog نشان می‌دهد که وقتی پشته نرم‌افزاری را از پایه بازنویسی می‌کنید، استخراج کار بیشتر از GPUهای موجود امکان‌پذیر است. وعده رمزگشایی ۳۰ برابر سریع‌تر LLM می‌تواند نحوه قیمت‌گذاری و معماری سرویس‌های هوش مصنوعی توسط توسعه‌دهندگان را تغییر دهد؛ البته به شرطی که شرکت بتواند تلاش‌های مهندسی شدیدی را که برای هر قطعه سیلیکون جدید لازم است، حفظ کند.