بينما تقوم Cerebras ببناء رقائق ذكاء اصطناعي مخصصة، تعمل الشركة الفرنسية الناشئة Kog على استخراج أقصى قدر من الأداء من وحدات معالجة الرسومات (GPUs) التي تمتلكها الشركات بالفعل. ومن خلال إعادة كتابة البرمجيات منخفضة المستوى للأجهزة الحالية في مراكز البيانات، تقضي Kog على اختناقات زمن الاستجابة (latency) التي تبطئ سير عمل الذكاء الاصطناعي.
تحدي ضرورة وجود سيليكون مخصص للذكاء الاصطناعي
تحول قطاع الذكاء الاصطناعي نحو الرقائق المصممة خصيصاً لعمليات الاستدلال (inference). ويقول Gaël Delalleau، الرئيس التنفيذي لشركة Kog، إن الاعتقاد بأن وحدات معالجة الرسومات القياسية لا يمكنها التعامل مع فك التشفير (decoding) هو اعتقاد خاطئ. توفر وحدات معالجة الرسومات الحديثة — مثل Nvidia H200 و AMD MI300X — عرض نطاق ترددي للذاكرة (memory bandwidth) تتركه البرمجيات الحالية دون استغلال.
يستهدف محرك Kog Inference Engine (KIE) "فك تشفير فائق السرعة للطلب الواحد"، وهو أمر ضروري للتطبيقات التي تعمل في الوقت الفعلي. وفي عرض توضيحي أخير، حققت الشركة 3,000 رمز في الثانية (TPS) باستخدام Laneformer 2B، وهو نموذج مفتوح المصدر يحتوي على 2 مليار معلمة (parameter) تم ضبطه ليتناسب مع بنيتهم البرمجية. يستخدم العرض نموذجاً صغيراً، لكن Kog تخطط لتوسيع هذه المكاسب لتشمل نماذج لغوية كبيرة (LLMs) أكبر بكثير.
نهج "المخترقين" (Hacker) في هندسة وحدات معالجة الرسومات
على عكس المزودين الذين لا يرتبطون بأجهزة محددة مثل ZML، تتعمق Kog في التفاصيل. حيث يقوم الفريق بالهندسة العكسية لوحدات معالجة الرسومات على مستويات التجميع (assembly) والبرمجيات الثنائية (binary)، مع التعامل مع السيليكون كمجموعة من القوانين الفيزيائية التي يجب إتقانها.
هذا التركيز على المستوى المنخفض يستخرج كل ذرة كفاءة ممكنة، لكنه يستغرق وقتاً. ومع فريق رشيق يتكون من 11 مهندساً، تقضي Kog أسابيع أو شهوراً في تشريح كل بنية جديدة لوحدات معالجة الرسومات قبل إضافة الدعم لها. توفر هذه الطريقة أداءً من الطراز الأول، ولكنها تحد من سرعة تغطية Kog للأجهزة الجديدة.
استهداف حالات استخدام الذكاء الاصطناعي عالية القيمة
تركز Kog على القطاعات التي يعني فيها زمن الاستجابة المرتفع خسارة في الإيرادات:
- هندسة البرمجيات: تتوقف أدوات مثل Claude Code لعدة دقائق. تهدف Kog إلى تحويل "ساعات الانتظار" إلى نتائج فورية تقريباً.
- تصميم التطبيقات/الألعاب التوليدية: تحتاج مسارات العمل من "المطالبة إلى التطبيق" (Prompt-to-app) إلى التكرار السريع للحفاظ على تفاعل المستخدمين وتدفق الإيرادات.
تتمثل المحطة الرئيسية التالية للشركة في تحقيق تسريع بمقدار 10 أضعاف على أول نموذج ضخم رئيسي لها. وبدعم من Scaleway و Bpifrance وبرنامج French Tech 2030، تضع Kog نفسها كلاعب رئيسي في مساعي السيادة الأوروبية في مجال الذكاء الاصطناعي.
النقاط الرئيسية
- التحسين بدلاً من الأجهزة: تدفع Kog عرض النطاق الترددي لذاكرة وحدات معالجة الرسومات Nvidia H200 و AMD MI300X إلى أقصى حد من خلال هندسة برمجيات متطرفة منخفضة المستوى.
- كسر حاجز زمن الاستجابة: تستهدف الشركة الناشئة زيادة بمقدار 30 ضعفاً في سرعة استدلال النماذج اللغوية الكبيرة (LLM) لسير العمل المهني في الوقت الفعلي، مثل البرمجة الآلية والتصميم التوليدي.
- الهندسة العميقة: من خلال تبني عقلية "المخترقين"، تقوم Kog بالهندسة العكسية لبرمجيات التجميع (assembly) والبرمجيات الثنائية (binary) لوحدات معالجة الرسومات لتحقيق أداء لا يمكن للمجموعات البرمجية القياسية الوصول إليه.
تقول Kog، وهي شركة فرنسية ناشئة، إن محرك Kog Inference Engine الخاص بها يهدف إلى تشغيل فك تشفير النماذج اللغوية الكبيرة (LLM) بسرعة أكبر بـ 30 مرة على نفس وحدات معالجة الرسومات Nvidia H200 أو AMD MI300X التي يمتلكها مشغلو مراكز البيانات بالفعل.
لماذا يكتسب السعي وراء السرعة أهمية الآن
يؤدي استدلال النماذج اللغوية الكبيرة (LLM) حالياً إلى إبطاء منتجات مثل مساعدي إكمال الكود، ومولدات المحتوى الفورية، وأدوات تصميم الألعاب التفاعلية. وفي هذه البيئات، تؤثر الفجوة بين مطالبة المستخدم ورد النموذج مباشرة على الإنتاجية والإيرادات. تترك واجهات برمجة التطبيقات (APIs) عالية المستوى مثل CUDA جزءاً كبيراً من عرض النطاق الترددي لذاكرة وحدة معالجة الرسومات دون استغلال، خاصة أثناء عملية فك التشفير رمزاً تلو الآخر (token-by-token)، والتي تهيمن على حالات الاستخدام في الوقت الفعلي.
حل Kog منخفض المستوى
تتجاوز Kog طبقات البرمجيات التقليدية وتتواصل مباشرة مع السيليكون. حيث يقوم مهندسوها بالهندسة العكسية لوحدة معالجة الرسومات على مستوى التجميع (assembly)، مع التعامل مع الأجهزة كمجموعة من القيود التي يجب الالتزام بها بدلاً من كونها "صندوقاً أسود" يتم التجريد منه. والنتيجة هي مسار تنفيذ مخصص يحافظ على تدفق البيانات عبر أنابيب ذاكرة وحدة معالجة الرسومات بسعة تقترب من الحد الأقصى.
في عرض توضيحي أخير، قامت الشركة بتشغيل Laneformer 2B — وهو نموذج مفتوح المصدر يحتوي على 2 مليار معلمة تم ضبطه ليتناسب مع بنيتها البرمجية — وأبلغت عن إنتاجية عالية للرموز (token throughput). يعد النموذج متواضعاً مقارنة بالأنظمة التجارية الأكبر، لكن مكاسب السرعة تظهر ما يمكن لمجموعة برمجية مصممة خصيصاً استخراجه من نفس الأجهزة.
المقايضة الهندسية
تأتي الميزة مع منحنى تكلفة حاد. يقضي فريق Kog المكون من 11 مهندساً أسابيع أو شهوراً في تشريح كل بنية جديدة لوحدات معالجة الرسومات قبل إمكانية دعمها. هذا العمق يحقق أداءً عالياً على البطاقات المستهدفة، ولكنه يعني أيضاً أن Kog لا تستطيع إضافة الدعم فوراً لكل وحدة معالجة رسومات جديدة تطرح في السوق. يستفيد العملاء فقط إذا كانت مجموعات أجهزتهم تتضمن وحدات Nvidia H200 أو AMD MI300X التي قامت Kog بتحسينها بالفعل.
من المستفيد
- أدوات هندسة البرمجيات – المنتجات التي تولد الكود، مثل Claude Code، غالباً ما تتوقف لعدة دقائق بينما يعالج النموذج الطلب. إن تقليص وقت الانتظار هذا إلى بضع ثوانٍ سيجعل عملية التطوير التفاعلية أكثر سلاسة بكثير.
- مسارات التصميم التوليدي – تحتاج الاستوديوهات التي تحول المطالبات النصية إلى نماذج أولية للتطبيقات أو أصول الألعاب إلى تكرار سريع للحفاظ على تفاعل المبدعين. يؤدي فك الترميز الأسرع إلى تقصير حلقات التصميم وتعزيز معدلات التحويل.
يترجم كلا القطاعين زمن الاستجابة (latency) مباشرة إلى ساعات عمل ضائعة أو فقدان للعملاء، لذا فإن زيادة السرعة بمقدار 30 ضعفاً قد تشكل ميزة تنافسية حاسمة.
الصورة الأوسع
تتعارض استراتيجية Kog مع التوجه السائد في الصناعة نحو بناء رقائق ذكاء اصطناعي مخصصة. تضخ شركات مثل Cerebras المليارات في رقائق تَعِد بإنتاجية أعلى لكل واط. وتجادل Kog بأن وحدات معالجة الرسومات (GPUs) الحالية تمتلك بالفعل نطاق ترددي كافٍ للذاكرة لعملية فك الترميز؛ والقطعة المفقودة هي البرمجيات التي يمكنها استخدامه فعلياً. وإذا ثبتت صحة هذا الادعاء على نطاق واسع، فقد يتمكن المطورون من تأجيل ترقيات الأجهزة المكلفة والاعتماد على ترقية برمجية لتحقيق استدلال (inference) في الوقت الفعلي تقريباً.
التحديات المحتملة
- عبء الصيانة – سيتطلب كل جيل جديد من وحدات معالجة الرسومات عملية هندسة عكسية جديدة. ومع تنوع السوق، قد يواجه الفريق الصغير ضغوطاً كبيرة.
- القابلية للتوسع مع النماذج الأكبر – استخدم العرض التجريبي نموذجاً بـ 2 مليار معلمة (2B-parameter model). قد يؤدي توسيع نطاق التقنيات نفسها لتشمل أنظمة أكبر بكثير إلى الاصطدام بحدود سعة الذاكرة أو يتطلب حيلًا هندسية إضافية لم يتم الكشف عنها بعد.
- مسارات بديلة – يقدم مزودو الخدمات السحابية بالفعل مثيلات (instances) محسنة للاستدلال تجمع بين رقائق وبرمجيات متخصصة. بالنسبة لبعض أعباء العمل، قد لا تفوق المكاسب الهامشية من حزمة برمجيات Kog سهولة استخدام الخدمة المدارة.
ما يجب مراقبته
- أول إطلاق لنموذج ضخم – تقول Kog إن محطتها الرئيسية التالية هي تسريع بمقدار 10 أضعاف لـ "نموذج رئيسي واسع النطاق". ستكون الفجوة بين العرض التجريبي لنموذج 2B ونموذج بمستوى المؤسسات هي الاختبار الأوضح لهذا النهج.
- توسيع دعم الأجهزة – سيشير إضافة الدعم لوحدات معالجة الرسومات الأحدث أو المسرعات الأخرى إلى ما إذا كان النموذج منخفض المستوى قادراً على مواكبة الوتيرة السريعة لتطور الأجهزة.
الخلاصة
تُظهر Kog أن استخراج المزيد من الأداء من وحدات معالجة الرسومات الحالية أمر ممكن عند إعادة كتابة الحزمة البرمجية من الصفر. إن الوعد بفك ترميز أسرع لنماذج اللغات الكبيرة (LLM) بمقدار 30 ضعفاً قد يعيد تشكيل كيفية تسعير وهندسة خدمات الذكاء الاصطناعي — بشرط أن تتمكن الشركة من الحفاظ على الجهد الهندسي المكثف المطلوب لكل قطعة سيليكون جديدة.
