Cerebras özel yapım yapay zeka çipleri üretirken, Fransız startup Kog, işletmelerin halihazırda sahip olduğu GPU'lardan maksimum performansı çıkarıyor. Kog, mevcut veri merkezi donanımları için düşük seviyeli yazılımları yeniden yazarak yapay zeka iş akışlarını yavaşlatan gecikme darboğazlarını ortadan kaldırıyor.
Özel Yapay Zeka Silikonunun Gerekliliğini Sorgulamak
Yapay zeka endüstrisi, çıkarım (inference) için özel olarak üretilmiş çiplere yöneldi. Kog CEO'su Gaël Delalleau, standart GPU'ların kod çözme (decoding) işlemini yapamayacağı inancının yanlış olduğunu söylüyor. Modern GPU'lar —Nvidia H200, AMD MI300X— mevcut yazılımların boşta bıraktığı bir bellek bant genişliği sunuyor.
Kog'un Kog Inference Engine (KIE) teknolojisi, gerçek zamanlı uygulamalar için olmazsa olmaz olan "son derece hızlı tek istekli kod çözme" işlemini hedefliyor. Şirket, yakın zamanda gerçekleştirdiği bir demoda, kendi yığınına (stack) göre optimize edilmiş 2 milyar parametreli açık kaynaklı bir model olan Laneformer 2B ile saniyede 3.000 token (TPS) hızına ulaştı. Demo küçük bir model kullanıyor ancak Kog, bu kazanımları çok daha büyük LLM'lere genişletmeyi planlıyor.
GPU Mühendisliğine "Hacker" Yaklaşımı
ZML gibi donanımdan bağımsız (hardware-agnostic) sağlayıcıların aksine Kog, derinlemesine çalışıyor. Ekip, GPU'ları assembly ve binary seviyelerinde tersine mühendislik yöntemleriyle inceliyor ve silikonu ustalaşılması gereken bir dizi fiziksel yasa olarak ele alıyor.
Bu düşük seviyeli odaklanma her bir verimlilik kırıntısını ortaya çıkarıyor ancak bu durum zaman maliyeti yaratıyor. 11 mühendisten oluşan yalın bir ekiple Kog, destek eklemeden önce her yeni GPU mimarisini incelemek için haftalarca hatta aylarca harcıyor. Bu yöntem üst düzey performans sağlıyor ancak Kog'un yeni donanımları ne kadar hızlı kapsayabileceğini sınırlıyor.
Yüksek Değerli Yapay Zeka Kullanım Durumlarını Hedeflemek
Kog, gecikmenin gelir kaybı anlamına geldiği sektörlere odaklanıyor:
- Yazılım mühendisliği: Claude Code gibi araçlar dakikalarca duraksıyor. Kog, "saatlerce beklemeyi" neredeyse anlık sonuçlara dönüştürmeyi hedefliyor.
- Üretken uygulama/oyun tasarımı: Prompt-to-app (komutla uygulama oluşturma) süreçleri, kullanıcıları bağlı tutmak ve gelirin akışını sağlamak için hızlı yinelemelere ihtiyaç duyar.
Şirketin bir sonraki dönüm noktası, ilk büyük ölçekli modelinde 10 kat hızlanma sağlamak. Scaleway, Bpifrance ve French Tech 2030 programı tarafından desteklenen Kog, kendisini Avrupa'nın yapay zeka egemenliği hamlesinde kilit bir oyuncu olarak konumlandırıyor.
Önemli Çıkarımlar
- Donanım yerine optimizasyon: Kog, aşırı düşük seviyeli yazılım mühendisliği ile Nvidia H200 ve AMD MI300X GPU'larının bellek bant genişliğini sınırlarına kadar zorluyor.
- Gecikme bariyerini aşmak: Startup; otomatik kodlama ve üretken tasarım gibi gerçek zamanlı profesyonel iş akışları için LLM çıkarım hızında 30 katlık bir artış hedefliyor.
- Derin seviyeli mühendislik: Kog, bir "hacker" zihniyetini benimseyerek, standart yazılım yığınlarının ulaşamayacağı performansa ulaşmak için GPU assembly ve binary kodlarını tersine mühendislik ile inceliyor.
Fransız bir startup olan Kog, Kog Inference Engine'in, veri merkezi operatörlerinin halihazırda sahip olduğu Nvidia H200 veya AMD MI300X GPU'larında, büyük dil modeli (LLM) kod çözme işlemini 30 kata kadar daha hızlı çalıştırmayı hedeflediğini belirtiyor.
Hız arayışı neden şimdi önemli?
LLM çıkarımı şu anda kod tamamlama asistanları, anlık içerik oluşturucular ve etkileşimli oyun tasarım araçları gibi ürünleri yavaşlatıyor. Bu ortamlarda, kullanıcının istemi (prompt) ile modelin yanıtı arasındaki boşluk, üretkenliği ve geliri doğrudan etkiliyor. CUDA gibi yüksek seviyeli API'lar, özellikle gerçek zamanlı kullanım durumlarına hakim olan token tabanlı kod çözme sırasında GPU bellek bant genişliğinin büyük bir kısmını boşta bırakıyor.
Kog'un düşük seviyeli çözümü
Kog, geleneksel yazılım katmanlarını atlayarak doğrudan silikonla konuşuyor. Mühendisleri, donanımı soyutlanacak bir kara kutu olarak değil, uyulması gereken bir dizi kısıtlama olarak ele alarak GPU'yu assembly seviyesinde tersine mühendislik ile inceliyor. Sonuç, verilerin GPU'nun bellek yollarından neredeyse tam kapasiteyle akmasını sağlayan özel bir yürütme yoludur (execution path).
Şirket, yakın zamanda gerçekleştirdiği bir demoda, kendi yığınına göre optimize edilmiş 2 milyar parametreli açık kaynaklı bir model olan Laneformer 2B'yi çalıştırdı ve yüksek bir token verimliliği (throughput) bildirdi. Model, daha büyük ticari sistemlere kıyasla mütevazı olsa da, elde edilen hız artışı, özel yapım bir yazılım yığınının aynı donanımdan neler çıkarabileceğini gösteriyor.
Mühendislik ödünleşimi
Bu avantaj, yüksek bir maliyetle birlikte geliyor. Kog'un 11 mühendisten oluşan ekibi, destek sağlayabilmek için her yeni GPU mimarisini incelemek için haftalarca hatta aylarca harcıyor. Bu derinlik, hedeflenen kartlarda yüksek performans sağlıyor ancak aynı zamanda Kog'un piyasaya çıkan her yeni GPU'ya anında destek ekleyemeyeceği anlamına geliyor. Müşteriler, yalnızca donanım envanterleri Kog'un halihazırda optimize ettiği Nvidia H200 veya AMD MI300X GPU'larını içeriyorsa bu durumdan yararlanabiliyor.
Kimler kazançlı çıkacak?
- Yazılım mühendisliği araçları – Claude Code gibi kod üreten ürünler, model bir isteği işlerken genellikle dakikalarca takılıp kalır. Bu bekleme süresini birkaç saniyeye indirmek, etkileşimli geliştirmeyi çok daha akıcı hale getirecektir.
- Üretken tasarım süreçleri – Metin tabanlı istemleri (prompts) uygulama prototiplerine veya oyun varlıklarına dönüştüren stüdyolar, içerik üreticilerini bağlı tutmak için hızlı yinelemeye ihtiyaç duyar. Daha hızlı kod çözme (decoding), tasarım döngülerini kısaltır ve dönüşüm oranlarını artırır.
Her iki sektör de gecikmeyi doğrudan kaybedilen faturalandırılabilir saatlere veya müşteri kaybına (churn) dönüştürür; bu nedenle 30 katlık bir hız artışı, belirleyici bir rekabet avantajı sağlayabilir.
Genel resim
Kog'un stratejisi, sektörün özel yapay zeka silikonu üretme eğilimine ters düşüyor. Cerebras gibi şirketler, watt başına daha yüksek iş çıkarma kapasitesi vaat eden çipler için milyarlarca dolar harcıyor. Kog, günümüz GPU'larının kod çözme işlemi için halihazırda yeterli bellek bant genişliğine sahip olduğunu; eksik olan parçanın ise bunu gerçekten kullanabilecek yazılım olduğunu savunuyor. Eğer bu iddia ölçeklenebilir düzeyde geçerliliğini korursa, geliştiriciler maliyetli donanım yükseltmelerini erteleyebilir ve gerçek zamanlıya yakın çıkarım (inference) elde etmek için bir yazılım yükseltmesine güvenebilirler.
Potansiyel zorluklar
- Bakım yükü – Her yeni GPU nesli, yeni bir tersine mühendislik süreci gerektirecektir. Pazar çeşitlendikçe, küçük ekip yetersiz kalabilir.
- Daha büyük modellere ölçeklenebilirlik – Demo, 2 milyar parametreli bir model kullandı. Aynı teknikleri çok daha büyük sistemlere ölçeklendirmek, bellek kapasitesi sınırlarına takılabilir veya henüz açıklanmamış ek mühendislik hileleri gerektirebilir.
- Alternatif yollar – Bulut sağlayıcıları halihazırda özel çipler ve yazılımları bir araya getiren, çıkarım (inference) için optimize edilmiş örnekler (instances) sunuyor. Bazı iş yükleri için Kog'un yazılım yığınından (stack) elde edilecek marjinal kazanç, yönetilen bir hizmetin (managed service) sağladığı kolaylığın önüne geçmeyebilir.
Takip edilmesi gerekenler
- İlk büyük model yayılımı – Kog, bir sonraki dönüm noktasının "büyük ölçekli ana bir modelde" 10 kat hızlanma olduğunu söylüyor. 2 milyar parametreli demo ile kurumsal düzeydeki bir model arasındaki fark, bu yaklaşımın en net testi olacaktır.
- Donanım desteğinin genişletilmesi – Yeni GPU'lar veya diğer hızlandırıcılar için destek eklenmesi, düşük seviyeli modelin hızlı donanım temposuna ayak uydurup uyduramayacağını gösterecektir.
Özet
Kog, yazılım yığınını (software stack) temelden yeniden yazdığınızda mevcut GPU'lardan daha fazla verim almanın mümkün olduğunu gösteriyor. 30 kat daha hızlı LLM kod çözme vaadi, şirket her yeni silikon parçası için gereken yoğun mühendislik çabasını sürdürebildiği sürece, geliştiricilerin yapay zeka hizmetlerini nasıl fiyatlandıracağını ve mimarisini nasıl oluşturacağını yeniden şekillendirebilir.
