Cerebras కస్టమ్ AI చిప్లను తయారు చేస్తుంటే, ఫ్రెంచ్ స్టార్టప్ Kog సంస్థలు ఇప్పటికే కలిగి ఉన్న GPUs నుండి గరిష్ట పనితీరును వెలికితీస్తుంది. ఇప్పటికే ఉన్న డేటాసెంటర్ హార్డ్వేర్ కోసం లో-లెవల్ సాఫ్ట్వేర్ను తిరిగి వ్రాయడం ద్వారా, Kog AI వర్క్ఫ్లోలను నెమ్మదింపజేసే లేటెన్సీ (latency) అడ్డంకులను తొలగిస్తుంది.
కస్టమ్ AI సిలికాన్ అవసరాన్ని సవాలు చేయడం
AI పరిశ్రమ ఇన్ఫరెన్స్ (inference) కోసం ప్రత్యేకంగా తయారు చేసిన చిప్ల వైపు మళ్లింది. సాధారణ GPUs డీకోడింగ్ను నిర్వహించలేవనే నమ్మకం తప్పని Kog CEO, Gaël Delalleau అంటున్నారు. ఆధునిక GPUs—Nvidia H200, AMD MI300X—ప్రస్తుత సాఫ్ట్వేర్ వాడుకోకుండా వదిలేసిన మెమరీ బ్యాండ్విడ్త్ను అందిస్తాయి.
Kog యొక్క Kog Inference Engine (KIE) "అత్యంత వేగవంతమైన సింగిల్-రిక్వెస్ట్ డీకోడింగ్"ను లక్ష్యంగా చేసుకుంటుంది, ఇది రియల్-టైమ్ యాప్లకు అత్యవసరం. ఇటీవలి డెమోలో, కంపెనీ వారి స్టాక్ కోసం ట్యూన్ చేయబడిన ఓపెన్-సోర్స్ 2-బిలియన్ పారామీటర్ మోడల్ అయిన Laneformer 2B తో సెకనుకు 3,000 టోకెన్ల (TPS) వేగాన్ని సాధించింది. ఈ డెమోలో చిన్న మోడల్ను ఉపయోగించినప్పటికీ, ఆ ప్రయోజనాలను మరింత పెద్ద LLMలకు విస్తరించాలని Kog యోచిస్తోంది.
GPU ఇంజనీరింగ్కు ఒక "హ్యాకర్" విధానం
ZML వంటి హార్డ్వేర్-అజ్ఞాత (hardware-agnostic) ప్రొవైడర్లలా కాకుండా, Kog లోతుగా పరిశోధిస్తుంది. ఈ బృందం GPUsను అసెంబ్లీ మరియు బైనరీ స్థాయిలలో రివర్స్-ఇంజనీర్ చేస్తుంది, సిలికాన్ను అధిగమించాల్సిన భౌతిక నియమాల సమితిగా పరిగణిస్తుంది.
ఈ లో-లెవల్ ఫోకస్ ప్రతి అణువు నుండి సామర్థ్యాన్ని వెలికితీస్తుంది, కానీ దీనికి సమయం పడుతుంది. కేవలం 11 మంది ఇంజనీర్లతో ఉన్న Kog బృందం, కొత్త GPU ఆర్కిటెక్చర్కు మద్దతు ఇవ్వడానికి ముందు దానిని విశ్లేషించడానికి వారాలు లేదా నెలల సమయం తీసుకుంటుంది. ఈ పద్ధతి అత్యుత్తమ పనితీరును అందిస్తుంది కానీ, కొత్త హార్డ్వేర్ను ఎంత వేగంగా కవర్ చేయగలరు అనే దానిపై పరిమితులను కలిగిస్తుంది.
అధిక విలువ కలిగిన AI వినియోగ సందర్భాలను లక్ష్యంగా చేసుకోవడం
Kog ఈ క్రింది రంగాలపై దృష్టి పెడుతుంది, ఇక్కడ లేటెన్సీ అంటే ఆదాయ నష్టం:
- సాఫ్ట్వేర్ ఇంజనీరింగ్: Claude Code వంటి సాధనాలు నిమిషాల పాటు ఆగిపోతాయి. "గంటల తరబడి వేచి ఉండటం"ను దాదాపు తక్షణ ఫలితాలుగా మార్చడమే Kog లక్ష్యం.
- జనరేటివ్ యాప్/గేమ్ డిజైన్: వినియోగదారులను ఆకట్టుకోవడానికి మరియు ఆదాయం పెరగడానికి Prompt-to-app పైప్లైన్లకు వేగవంతమైన పునరావృతం (iteration) అవసరం.
కంపెనీ యొక్క తదుపరి మైలురాయి దాని మొదటి ప్రధాన భారీ స్థాయి మోడల్పై 10× వేగవంతం చేయడం. Scaleway, Bpifrance మరియు French Tech 2030 ప్రోగ్రామ్ మద్దతుతో, Kog యూరప్ యొక్క AI సార్వభౌమాధికార డ్రైవ్లో ఒక కీలక పాత్ర పోషిస్తోంది.
ముఖ్య అంశాలు
- హార్డ్వేర్ కంటే ఆప్టిమైజేషన్ ముఖ్యం: Kog అత్యంత లో-లెవల్ సాఫ్ట్వేర్ ఇంజనీరింగ్తో Nvidia H200 మరియు AMD MI300X GPUs యొక్క మెమరీ బ్యాండ్విడ్త్ను గరిష్ట స్థాయికి తీసుకెళ్తుంది.
- లేటెన్సీ అడ్డంకిని అధిగమించడం: ఆటోమేటెడ్ కోడింగ్ మరియు జనరేటివ్ డిజైన్ వంటి రియల్-టైమ్ ప్రొఫెషనల్ వర్క్ఫ్లోల కోసం LLM ఇన్ఫరెన్స్ వేగంలో 30× పెరుగుదలను ఈ స్టార్టప్ లక్ష్యంగా పెట్టుకుంది.
- డీప్-లెవల్ ఇంజనీరింగ్: "హ్యాకర్" మైండ్సెట్ను అవలంబించడం ద్వారా, Kog సాధారణ స్టాక్లు చేరుకోలేని పనితీరును సాధించడానికి GPU అసెంబ్లీ మరియు బైనరీ కోడ్ను రివర్స్-ఇంజనీర్ చేస్తుంది.
ఫ్రెంచ్ స్టార్టప్ అయిన Kog, తన Kog Inference Engine ద్వారా డేటా-సెంటర్ ఆపరేటర్లు ఇప్పటికే కలిగి ఉన్న Nvidia H200 లేదా AMD MI300X GPUs పైనే లార్జ్-లాంగ్వేజ్-మోడల్ (LLM) డీకోడింగ్ను 30 రెట్లు వేగంగా నడపాలని లక్ష్యంగా పెట్టుకుంది.
ఇప్పుడు వేగం కోసం ప్రయత్నించడం ఎందుకు ముఖ్యం
LLM ఇన్ఫరెన్స్ ఇప్పుడు కోడ్-కంప్లీషన్ అసిస్టెంట్లు, ఆన్-ది-ఫ్లై కంటెంట్ జనరేటర్లు మరియు ఇంటరాక్టివ్ గేమ్-డిజైన్ టూల్స్ వంటి ఉత్పత్తుల వేగాన్ని తగ్గిస్తోంది. అటువంటి సందర్భాలలో, వినియోగదారుని ప్రాంప్ట్ మరియు మోడల్ సమాధానం మధ్య ఉన్న వ్యత్యాసం నేరుగా ఉత్పాదకత మరియు ఆదాయంపై ప్రభావం చూపుతుంది. CUDA వంటి హై-లెవల్ APIs, ముఖ్యంగా రియల్-టైమ్ వినియోగ సందర్భాలలో ఎక్కువగా ఉండే టోకెన్-బై-టోకెన్ డీకోడింగ్ సమయంలో, GPU మెమరీ బ్యాండ్విడ్త్లో పెద్ద భాగాన్ని వాడుకోకుండా వదిలేస్తాయి.
Kog యొక్క లో-లెవల్ పరిష్కారం
Kog సంప్రదాయ సాఫ్ట్వేర్ లేయర్లను దాటవేసి నేరుగా సిలికాన్తో మాట్లాడుతుంది. దీని ఇంజనీర్లు GPUను అసెంబ్లీ స్థాయిలో రివర్స్-ఇంజనీర్ చేస్తారు, హార్డ్వేర్ను ఒక బ్లాక్ బాక్స్గా కాకుండా, పాటించాల్సిన పరిమితుల సమితిగా పరిగణిస్తారు. దీని ఫలితంగా, GPU యొక్క మెమరీ పైపుల ద్వారా డేటా దాదాపు పూర్తి సామర్థ్యంతో ప్రవహించేలా చేసే ఒక కస్టమ్ ఎగ్జిక్యూషన్ పాత్ (execution path) ఏర్పడుతుంది.
ఇటీవలి డెమోలో, కంపెనీ తన స్టాక్ కోసం ట్యూన్ చేయబడిన 2-బిలియన్ పారామీటర్ ఓపెన్-సోర్స్ మోడల్ అయిన Laneformer 2B ను నడిపి, అధిక టోకెన్ త్రూపుట్ను (throughput) నమోదు చేసింది. పెద్ద వాణిజ్య వ్యవస్థలతో పోలిస్తే ఈ మోడల్ చిన్నదే అయినప్పటికీ, ఒక ప్రత్యేకంగా తయారు చేసిన సాఫ్ట్వేర్ స్టాక్ అదే హార్డ్వేర్ నుండి ఎంత వేగాన్ని వెలికితీయగలదో ఇది చూపుతుంది.
ఇంజనీరింగ్ ట్రేడ్-ఆఫ్ (Trade-off)
దీని ప్రయోజనంతో పాటు ఒక సవాలు కూడా ఉంది. Kog యొక్క 11 మంది ఇంజనీర్ల బృందం, ప్రతి కొత్త GPU ఆర్కిటెక్చర్కు మద్దతు ఇవ్వడానికి ముందు దానిని విశ్లేషించడానికి వారాలు లేదా నెలల సమయం తీసుకుంటుంది. ఈ లోతైన పరిశోధన లక్ష్యిత కార్డ్లపై అధిక పనితీరును ఇస్తుంది, కానీ మార్కెట్లోకి వచ్చే ప్రతి కొత్త GPUకు Kog తక్షణమే మద్దతు ఇవ్వలేదని కూడా అర్థం. వినియోగదారులు Kog ఇప్పటికే ఆప్టిమైజ్ చేసిన Nvidia H200 లేదా AMD MI300X GPUsలను కలిగి ఉంటేనే దీని వల్ల ప్రయోజనం పొందుతారు.
ఎవరికి ప్రయోజనం ఉంటుంది
- సాఫ్ట్వేర్-ఇంజనీరింగ్ సాధనాలు – Claude Code వంటి కోడ్ను రూపొందించే ఉత్పత్తులు, మోడల్ ఒక రిక్వెస్ట్ను ప్రాసెస్ చేస్తున్నప్పుడు తరచుగా నిమిషాల తరబడి ఆగిపోతుంటాయి. ఆ వేచి ఉండే సమయాన్ని కొన్ని సెకన్లకు తగ్గించడం వల్ల ఇంటరాక్టివ్ డెవలప్మెంట్ మరింత సులభతరం అవుతుంది.
- జనరేటివ్ డిజైన్ పైప్లైన్స్ – టెక్స్ట్ual ప్రాంప్ట్లను యాప్ ప్రోటోటైప్లుగా లేదా గేమ్ అసెట్లుగా మార్చే స్టూడియోలకు సృష్టికర్తలను నిమగ్నం చేయడానికి వేగవంతమైన పునరావృతం (iteration) అవసరం. వేగవంతమైన డీకోడింగ్ డిజైన్ లూప్లను తగ్గిస్తుంది మరియు కన్వర్షన్ రేట్లను పెంచుతుంది.
ఈ రెండు రంగాలలోనూ లేటెన్సీ (latency) నేరుగా కోల్పోయిన బిల్లింగ్ గంటలు లేదా వినియోగదారుల తగ్గింపుకు (churn) దారితీస్తుంది, కాబట్టి 30× వేగవంతమైన పెరుగుదల ఒక నిర్ణయాత్మక పోటీ ప్రయోజనం కావచ్చు.
విస్తృత దృక్పథం
కస్టమ్ AI సిలికాన్ను నిర్మించే పరిశ్రమ ధోరణికి విరుద్ధంగా Kog వ్యూహం ఉంది. Cerebras వంటి కంపెనీలు వాట్ (watt) కి అధిక త్రూపుట్ (throughput) వాగ్దానం చేసే చిప్ల కోసం బిలియన్ల కొద్దీ ఖర్చు చేస్తున్నాయి. డీకోడింగ్ కోసం నేటి GPUలకు ఇప్పటికే తగినంత మెమరీ బ్యాండ్విడ్త్ ఉందని, కానీ దాన్ని వాడగలిగే సాఫ్ట్వేర్ లేకపోవడమే లోటు అని Kog వాదిస్తోంది. ఈ వాదన పెద్ద ఎత్తున నిజమైతే, డెవలపర్లు ఖరీదైన హార్డ్వేర్ అప్గ్రేడ్లను వాయిదా వేసి, నయానంతర (near-real-time) ఇన్ఫరెన్స్ సాధించడానికి సాఫ్ట్వేర్ అప్గ్రేడ్పై ఆధారపడవచ్చు.
ఎదురయ్యే సవాళ్లు
- మెయింటెనెన్స్ భారం – ప్రతి కొత్త GPU జనరేషన్కు కొత్త రివర్స్-ఇంజనీరింగ్ అవసరమవుతుంది. మార్కెట్ వైవిధ్యం పెరిగే కొద్దీ, చిన్న బృందంపై ఒత్తిడి పెరగవచ్చు.
- పెద్ద మోడళ్లకు స్కేలబిలిటీ – డెమోలో 2B-పారామీటర్ మోడల్ను ఉపయోగించారు. అదే పద్ధతులను చాలా పెద్ద వ్యవస్థలకు విస్తరించడం వల్ల మెమరీ సామర్థ్య పరిమితులు ఎదురుకావచ్చు లేదా ఇంకా వెల్లడించని అదనపు ఇంజనీరింగ్ ట్రిక్స్ అవసరం కావచ్చు.
- ప్రత్యామ్నాయ మార్గాలు – క్లౌడ్ ప్రొవైడర్లు ఇప్పటికే ప్రత్యేక చిప్లు మరియు సాఫ్ట్వేర్లను కలిపి ఇన్ఫరెన్స్-ఆప్టిమైజ్డ్ ఇన్స్టెన్స్లను అందిస్తున్నారు. కొన్ని వర్క్లోడ్ల కోసం, Kog స్టాక్ నుండి వచ్చే స్వల్ప లాభం మేనేజ్డ్ సర్వీస్ యొక్క సౌలభ్యంతో పోలిస్తే తక్కువగా ఉండవచ్చు.
గమనించవలసినవి
- మొదటి పెద్ద మోడల్ రోల్అవుట్ – Kog తన తదుపరి మైలురాయి "ప్రధాన పెద్ద స్థాయి మోడల్" (major large-scale model) పై 10× వేగవంతం అని చెబుతోంది. 2B డెమో మరియు ఎంటర్ప్రైజ్-గ్రేడ్ మోడల్ మధ్య ఉన్న వ్యత్యాసం ఈ విధానానికి స్పష్టమైన పరీక్ష అవుతుంది.
- హార్డ్వేర్ సపోర్ట్ విస్తరణ – కొత్త GPUలు లేదా ఇతర యాక్సిలరేటర్లకు మద్దతు ఇవ్వడం ద్వారా, ఈ లో-లెవల్ మోడల్ వేగంగా మారుతున్న హార్డ్వేర్ వేగంతో పోటీ పడగలదా లేదా అనేది తెలుస్తుంది.
ముగింపు
సాఫ్ట్వేర్ స్టాక్ను మొదటి నుండి తిరిగి రాసినప్పుడు, ఇప్పటికే ఉన్న GPUల నుండి మరింత పనిని పొందవచ్చని Kog చూపుతోంది. 30× వేగవంతమైన LLM డీకోడింగ్ వాగ్దానం, డెవలపర్లు AI సేవలకు ధర నిర్ణయించే మరియు ఆర్కిటెక్ట్ చేసే విధానాన్ని మార్చివేయవచ్చు—కానీ ప్రతి కొత్త సిలికాన్ ముక్క కోసం అవసరమైన తీవ్రమైన ఇంజనీరింగ్ ప్రయత్నాన్ని కంపెనీ కొనసాగించగలిగితేనే ఇది సాధ్యమవుతుంది.
