જ્યારે Cerebras કસ્ટમ AI ચિપ્સ બનાવે છે, ત્યારે ફ્રેન્ચ સ્ટાર્ટઅપ Kog એ એન્ટરપ્રાઇઝ પાસે પહેલેથી જ ઉપલબ્ધ GPUs માંથી વધુ પ્રદર્શન મેળવે છે. હાલના ડેટા સેન્ટર હાર્ડવેર માટે લો-લેવલ સોફ્ટવેરને ફરીથી લખીને, Kog એ લેટન્સી (latency) અવરોધોને દૂર કરે છે જે AI વર્કફ્લોને ધીમો પાડે છે.
કસ્ટમ AI સિલિકોનની આવશ્યકતાને પડકાર
AI ઉદ્યોગ ઇન્ફરન્સ (inference) માટે ખાસ બનાવેલી ચિપ્સ તરફ વળ્યો છે. Kog ના CEO, Gaël Delalleau કહે છે કે એ માન્યતા ખોટી છે કે સ્ટાન્ડર્ડ GPUs ડિકોડિંગ હેન્ડલ કરી શકતા નથી. આધુનિક GPUs—Nvidia H200, AMD MI300X—એવું મેમરી બેન્ડવિડ્થ (memory bandwidth) આપે છે જે હાલનું સોફ્ટવેર વણવપરાયેલું (idle) રહેવા દે છે.
Kog નું Kog Inference Engine (KIE) "અત્યંત ઝડપી સિંગલ-રિક્વેસ્ટ ડિકોડિંગ" ને લક્ષ્ય બનાવે છે, જે રિયલ-ટાઇમ એપ્સ માટે અનિવાર્ય છે. તાજેતરના ડેમોમાં કંપનીએ Laneformer 2B સાથે પ્રતિ સેકન્ડ 3,000 ટોકન્સ (TPS) પ્રાપ્ત કર્યા છે, જે તેમના સ્ટેક માટે ટ્યુન કરેલ એક ઓપન-સોર્સ 2-બિલિયન-પેરામીટર મોડેલ છે. ડેમોમાં નાનું મોડેલ વપરાયેલું છે, પરંતુ Kog આ લાભોને ઘણા મોટા LLMs સુધી વિસ્તારવાની યોજના ધરાવે છે.
GPU એન્જિનિયરિંગ માટે "Hacker" અભિગમ
ZML જેવા હાર્ડવેર-એગ્નોસ્ટિક (hardware-agnostic) પ્રદાતાઓથી વિપરીત, Kog ઊંડાણપૂર્વક કામ કરે છે. ટીમ એસેમ્બલી અને બાઈનરી સ્તરે GPUs ને રિવર્સ-એન્જિનિયર કરે છે, સિલિકોનને માસ્ટર કરવા માટે ભૌતિક નિયમોના સમૂહ તરીકે જુએ છે.
તે લો-લેવલ ફોકસ કાર્યક્ષમતાનો દરેક અંશ કાઢે છે, પરંતુ તેમાં સમય લાગે છે. 11 એન્જિનિયરોની નાની ટીમ સાથે, Kog સપોર્ટ ઉમેરતા પહેલા દરેક નવા GPU આર્કિટેક્ચરનું વિશ્લેષણ કરવામાં અઠવાડિયા અથવા મહિનાઓ વિતાવે છે. આ પદ્ધતિ ટોપ-ટિયર પ્રદર્શન આપે છે પરંતુ Kog કેટલી ઝડપથી નવા હાર્ડવેરને આવરી શકે છે તેના પર મર્યાદા મૂકે છે.
ઉચ્ચ-મૂલ્ય ધરાવતા AI ઉપયોગના કિસ્સાઓને લક્ષ્ય બનાવવું
Kog એવા ક્ષેત્રો પર ધ્યાન કેન્દ્રિત કરે છે જ્યાં લેટન્સી એટલે આવકમાં નુકસાન:
- Software engineering: Claude Code જેવા સાધનો મિનિટો માટે અટકી જાય છે. Kog 'કલાકો સુધી રાહ જોવી' ને લગભગ ત્વરિત પરિણામોમાં બદલવાનું લક્ષ્ય રાખે છે.
- Generative app/game design: વપરાશકર્તાઓને જોડે રાખવા અને આવક જાળવી રાખવા માટે Prompt-to-app પાઇપલાઇન્સમાં ઝડપી ઇટરેશનની જરૂર હોય છે.
કંપનીનું આગામી માઈલસ્ટોન તેના પ્રથમ મુખ્ય મોટા પાયાના મોડેલ પર 10× સ્પીડઅપ મેળવવાનું છે. Scaleway, Bpifrance અને French Tech 2030 પ્રોગ્રામ દ્વારા સમર્થિત, Kog યુરોપના AI સાર્વભૌમત્વ અભિયાનમાં એક મુખ્ય ખેલાડી તરીકે પોતાને સ્થાપિત કરે છે.
મુખ્ય મુદ્દાઓ
- Optimization over hardware: Kog અત્યંત લો-લેવલ સોફ્ટવેર એન્જિનિયરિંગ સાથે Nvidia H200 અને AMD MI300X GPUs ની મેમરી બેન્ડવિડ્થને તેની મર્યાદા સુધી લઈ જાય છે.
- Breaking the latency barrier: સ્ટાર્ટઅપ ઓટોમેટેડ કોડિંગ અને જનરેટિવ ડિઝાઇન જેવા રિયલ-ટાઇમ પ્રોફેશનલ વર્કફ્લો માટે LLM ઇન્ફરન્સ સ્પીડમાં 30× વધારાનું લક્ષ્ય રાખે છે.
- Deep-level engineering: 'Hacker' માનસિકતા અપનાવીને, Kog GPU એસેમ્બલી અને બાઈનરી કોડને રિવર્સ-એન્જિનિયર કરે છે જેથી એવું પ્રદર્શન પ્રાપ્ત કરી શકાય જે સ્ટાન્ડર્ડ સ્ટેક્સ પ્રાપ્ત કરી શકતા નથી.
ફ્રેન્ચ સ્ટાર્ટઅપ Kog કહે છે કે તેનું Kog Inference Engine એ જ Nvidia H200 અથવા AMD MI300X GPUs પર large-language-model (LLM) ડિકોડિંગને 30 ગણું ઝડપી ચલાવવાનું લક્ષ્ય રાખે છે જે ડેટા-સેન્ટર ઓપરેટરો પાસે પહેલેથી જ છે.
અત્યારે ઝડપ માટેનો આ પ્રયાસ શા માટે મહત્વપૂર્ણ છે
LLM ઇન્ફરન્સ હવે કોડ-કમ્પ્લીશન આસિસ્ટન્ટ્સ, ઓન-ધ-ફ્લાય કન્ટેન્ટ જનરેટર્સ અને ઇન્ટરેક્ટિવ ગેમ-ડિઝાઇન ટૂલ્સ જેવા ઉત્પાદનોને અવરોધે છે. આ સેટિંગ્સમાં, વપરાશકર્તાના પ્રોમ્પ્ટ અને મોડેલના જવાબ વચ્ચેનો તફાવત સીધી રીતે ઉત્પાદકતા અને આવક પર અસર કરે છે. CUDA જેવા હાઈ-લેવલ APIs GPU મેમરી બેન્ડવિડ્થનો મોટો હિસ્સો વણવપરાયેલું (idle) રહેવા દે છે, ખાસ કરીને ટોકન-બાય-ટોકન ડિકોડિંગ દરમિયાન, જે રિયલ-ટાઇમ ઉપયોગના કિસ્સાઓમાં પ્રભુત્વ ધરાવે છે.
Kog નો લો-લેવલ જવાબ
Kog પરંપરાગત સોફ્ટવેર લેયર્સને છોડી દે છે અને સીધું સિલિકોન સાથે વાત કરે છે. તેના એન્જિનિયરો એસેમ્બલી સ્તરે GPU ને રિવર્સ-એન્જિનિયર કરે છે, હાર્ડવેરને એબ્સ્ટ્રેક્ટ કરવા માટેના બ્લેક બોક્સને બદલે પાલન કરવા માટેના નિયમોના સમૂહ તરીકે જુએ છે. પરિણામ એક કસ્ટમ એક્ઝિક્યુશન પાથ છે જે GPU ના મેમરી પાઇપ્સ દ્વારા ડેટાને લગભગ પૂર્ણ ક્ષમતા સાથે વહેતો રાખે છે.
તાજેતરના ડેમોમાં કંપનીએ Laneformer 2B—તેના સ્ટેક માટે ટ્યુન કરેલ એક 2-બિલિયન-પેરામીટર ઓપન-સોર્સ મોડેલ—ચલાવ્યું અને ઉચ્ચ ટોકન થ્રુપુટ (throughput) નોંધાવ્યું. મોટા વ્યાપારી સિસ્ટમોની તુલનામાં આ મોડેલ સામાન્ય છે, પરંતુ સ્પીડમાં થયેલો વધારો દર્શાવે છે કે એક ખાસ બનાવેલ સોફ્ટવેર સ્ટેક તે જ હાર્ડવેરમાંથી શું મેળવી શકે છે.
એન્જિનિયરિંગ ટ્રેડ-ઓફ
આના ફાયદા સાથે મોટો ખર્ચ પણ જોડાયેલો છે. Kog ની 11-એન્જિનિયરની ટીમ સપોર્ટ કરી શકાય તે પહેલાં દરેક નવા GPU આર્કિટેક્ચરનું વિશ્લેષણ કરવામાં અઠવાડિયા અથવા મહિનાઓ વિતાવે છે. આ ઊંડાઈ લક્ષિત કાર્ડ્સ પર ઉચ્ચ પ્રદર્શન આપે છે, પરંતુ તેનો અર્થ એ પણ છે કે Kog બજારમાં આવતા દરેક નવા GPU માટે તરત જ સપોર્ટ ઉમેરી શકતું નથી. ગ્રાહકોને ત્યારે જ ફાયદો થાય છે જો તેમના ફ્લીટમાં Nvidia H200 અથવા AMD MI300X GPUs હોય જે Kog એ પહેલેથી જ ઓપ્ટિમાઇઝ કર્યા છે.
કોને ફાયદો થશે
- સોફ્ટવેર-એન્જિનિયરિંગ સાધનો – એવા ઉત્પાદનો જે કોડ જનરેટ કરે છે, જેમ કે Claude Code, મોડેલ જ્યારે વિનંતી (request) પર પ્રક્રિયા કરતું હોય ત્યારે ઘણીવાર મિનિટો સુધી અટકી જાય છે. આ રાહ જોવાનો સમય ઘટાડીને થોડી સેકન્ડોમાં લાવવાથી ઇન્ટરેક્ટિવ ડેવલપમેન્ટ વધુ સરળ બનશે.
- જનરેટિવ ડિઝાઇન પાઇપલાઇન્સ – ટેક્સ્ટ્યુઅલ પ્રોમ્પ્ટ્સને એપ પ્રોટોટાઇપ્સ અથવા ગેમ એસેટ્સમાં બદલતા સ્ટુડિયોઝને સર્જકોને સક્રિય રાખવા માટે ઝડપી ઇટરેશનની જરૂર હોય છે. ઝડપી ડિકોડિંગ ડિઝાઇન લૂપ્સને ટૂંકા કરે છે અને કન્વર્ઝન રેટમાં વધારો કરે છે.
બંને ક્ષેત્રોમાં લેટન્સી સીધી રીતે ગુમાવેલા બિલિંગ કલાકો અથવા ચર્ન (churn) માં પરિણમે છે, તેથી 30× સ્પીડ બૂસ્ટ એક નિર્ણાયક સ્પર્ધાત્મક લાભ બની શકે છે.
વ્યાપક ચિત્ર
Kog ની વ્યૂહરચના કસ્ટમ AI સિલિકોન બનાવવાની ઉદ્યોગની પ્રવૃત્તિથી વિરુદ્ધ છે. Cerebras જેવી કંપનીઓ એવા ચિપ્સમાં અબજો ડોલર ખર્ચે છે જે પ્રતિ વોટ વધુ થ્રુપુટ (throughput) આપવાનું વચન આપે છે. Kog નો દાવો છે કે આજકાલના GPUs માં ડિકોડિંગ માટે પૂરતો મેમરી બેન્ડવિડ્થ પહેલેથી જ છે; ખૂટતો ભાગ એ સોફ્ટવેર છે જે ખરેખર તેનો ઉપયોગ કરી શકે. જો આ દાવો મોટા પાયે સાચો ઠરે છે, તો ડેવલપર્સ ખર્ચાળ હાર્ડવેર અપગ્રેડ્સને મોકૂફ રાખી શકે છે અને નજીક-રીઅલ-ટાઇમ ઇન્ફરન્સ મેળવવા માટે સોફ્ટવેર અપગ્રેડ પર આધાર રાખી શકે છે.
સંભવિત અવરોધો
- મેન્ટેનન્સનો બોજ – દરેક નવી GPU પેઢી માટે તાજી રિવર્સ-એન્જિનિયરિંગની જરૂર પડશે. જેમ જેમ બજાર વૈવિધ્યસભર બનશે, તેમ નાની ટીમ પર કામનું ભારણ વધી શકે છે.
- મોટા મોડેલ્સ માટે સ્કેલેબિલિટી – ડેમોમાં 2 B-પેરામીટર મોડેલનો ઉપયોગ કરવામાં આવ્યો હતો. સમાન તકનીકોને ઘણા મોટા સિસ્ટમો સુધી સ્કેલ કરવાથી મેમરી-ક્ષમતાની મર્યાદાઓ આવી શકે છે અથવા હજુ સુધી જાહેર ન કરાયેલ વધારાની એન્જિનિયરિંગ ટ્રિક્સની જરૂર પડી શકે છે.
- વૈકલ્પિક માર્ગો – ક્લાઉડ પ્રોવાઇડર્સ પહેલેથી જ ઇન્ફરન્સ-ઓપ્ટિમાઇઝ્ડ ઇન્સ્ટન્સ ઓફર કરે છે જે સ્પેશિયલાઇઝ્ડ ચિપ્સ અને સોફ્ટવેરને સાથે લાવે છે. કેટલાક વર્કલોડ્સ માટે, Kog ના સ્ટેકમાંથી મળતો નજીવો ફાયદો મેનેજ્ડ સર્વિસની સુવિધા કરતા વધુ ન હોઈ શકે.
શું જોવા જેવું છે
- પ્રથમ મોટા મોડેલનું રોલઆઉટ – Kog કહે છે કે તેનું આગામી લક્ષ્ય "મુખ્ય મોટા પાયાના મોડેલ" પર 10× સ્પીડઅપ મેળવવાનું છે. 2 B ડેમો અને એન્ટરપ્રાઇઝ-ગ્રેડ મોડેલ વચ્ચેનું અંતર આ અભિગમનું સૌથી સ્પષ્ટ પરીક્ષણ હશે.
- હાર્ડવેર સપોર્ટનું વિસ્તરણ – નવા GPUs અથવા અન્ય એક્સિલરેટર્સ માટે સપોર્ટ ઉમેરવાથી એ સંકેત મળશે કે લો-લેવલ મોડેલ ઝડપી હાર્ડવેરની ગતિ સાથે કદમ મિલાવી શકે છે કે નહીં.
સારાંશ
Kog દર્શાવે છે કે જ્યારે તમે સોફ્ટવેર સ્ટેકને પાયાથી ફરીથી લખો છો, ત્યારે હાલના GPUs માંથી વધુ કામ લેવું શક્ય છે. 30× ઝડપી LLM ડિકોડિંગનું વચન ડેવલપર્સ કેવી રીતે AI સેવાઓના ભાવ નક્કી કરે છે અને તેનું આર્કિટેક્ચર બનાવે છે તેને નવો આકાર આપી શકે છે—જો કંપની દરેક નવા સિલિકોન માટે જરૂરી તીવ્ર એન્જિનિયરિંગ પ્રયાસોને જાળવી રાખવામાં સક્ષમ હોય.
