Mazingira ya miundombinu ya AI yanapitia mabadiliko makubwa huku mtaji ukihamia kutoka kwenye mafunzo ya modeli (model training) kwenda kwenye utekelezaji wa modeli (model execution). Mkopo mkubwa wa dola milioni 400 kutoka kwa kampuni ya uwekezaji wa teknolojia ya Upper90 kwenda kwa kampuni changa ya AI inference ya General Compute unashuhudia hatua muhimu ya kihistoria katika jinsi vifaa vya kompyuta (hardware) vinavyofadhiliwa na kutumika.

Enzi Mpya ya Dhamana: Kufadhili Chip za Inference

Katika hatua inayofanana na siku za awali za ufadhili wa GPU, Upper90 inajihusisha na aina mpya ya rasilimali: silicon maalum kwa ajili ya inference. Wakati wimbi lililopita la ufadhili—lililoanzishwa na makampuni kama CoreWeave—lililenga Nvidia GPUs zinazotumiwa kwa kazi kubwa za mafunzo, mkataba huu wa dola milioni 400 unatumia chip zilizoundwa mahususi kwa ajili ya kuendesha modeli ambazo tayari zimefunzwa kama dhamana.

General Compute, inayoongozwa na Mkurugenzi Mtendaji Finn Puklowski, inajenga "neocloud"—mtoa huduma wa miundombinu maalum ulioundwa mahususi kwa ajili ya kazi za AI badala ya kompyuta za matumizi ya jumla. Tofauti hii ni muhimu; wakati watoa huduma wakubwa wa jadi kama AWS na Azure wanatoa huduma pana, neoclouds zinaboresha mahitaji ya kipekee ya latency na throughput ya Large Language Models (LLMs).

Faida ya Kiufundi ya SambaNova’s SN50

Kiini cha mkakati wa General Compute ni ushirikiano wake na SambaNova, mtengenezaji wa chip anayesaidiwa na Intel. Kampuni hiyo inatumia chip za SambaNova’s SN50, ambazo zimeundwa kutoa ongezeko kubwa la utendaji ikilinganishwa na vifaa vya jadi.

Kulingana na General Compute, chip hizi zinaweza kutoa kasi ya inference hadi mara 16 zaidi ya mawingu (clouds) yanayotegemea GPU kwa sasa. Zaidi ya kasi pekee, SN50 inatoa faida mbili kuu za kiutendaji:

  • Ufanisi wa Nishati: Hutumia nishati kidogo kwa kila token, hivyo kupunguza gharama kubwa za uendeshaji wa AI.
  • Ubaridi Rahisi: Tofauti na GPU za hali ya juu ambazo mara nyingi zinahitaji mifumo tata na ghali ya upoaji kwa maji, chip hizi zinaruhusu uwekaji haraka katika mazingira mbalimbali ya kawaida ya vituo vya data (data centers).

Kuvunja Utawala wa Nvidia

Mkataba huu ni zaidi ya kuingiza mtaji tu; ni ishara ya kimkakati kwamba soko linatafuta mbadala wa utawala wa Nvidia. Wakati gharama za token na ufikiaji wa modeli za kisasa (frontier models) zikiendelea kuwa kikwazo kwa watengenezaji, kuna mahitaji yanayoongezeka ya ufikiaji wa bei rahisi na wenye ufanisi wa modeli za open-source.

Kuongezeka kwa modeli za open-source zenye utendaji wa juu—kama vile K3 ya Kimi, inayoshindana na Anthropic na OpenAI katika vipimo vya uandishi wa kodi (coding benchmarks)—kunamaanisha kuwa kikwazo cha tasnia kinahamia kutoka "tunawezaje kujenga modeli?" kwenda "tunawezaje kuziendesha kwa gharama nafuu?" Kwa kutumia silicon isiyo ya Nvidia, General Compute na washindani kama TensorWave (wakishirikiana na AMD) wanajiandaa kutoa Gharama Bora ya Umiliki (Total Cost of Ownership - TCO).

Kama alivyobainisha Puklowski, mkataba huu unawakilisha "mtaji kujipanga wenyewe" ili kuvunja utawala wa Nvidia kwenye mfumo wa AI. Kwa kuwekeza kwenye vifaa maalum vya inference, wawekezaji wanatambua kuwa hatua inayofuata ya ukuaji wa AI itaendeshwa na ukubwa, ufanisi, na kuenea kwa AI katika matumizi ya kila siku.

Mambo Muhimu ya Kuzingatia

  • Ufadhili wa Kwanza kwa Inference: Mkataba wa dola milioni 400 unaashiria mabadiliko kuelekea kutumia chip maalum za inference, badala ya GPU za mafunzo pekee, kama dhamana kwa mikopo mikubwa.
  • Ongezeko la Utendaji: General Compute inalenga kufanya vizuri zaidi kuliko mawingu yanayotegemea GPU kwa hadi mara 16 kwa kutumia chip za SambaNova’s SN50, ambazo hutoa ufanisi bora wa nishati na uwekaji rahisi.
  • Kupanua Teknolojia (Diversifying the Stack): Hatua hii inaashiria mahitaji yanayoongezeka ya soko kwa silicon isiyo ya Nvidia ili kusaidia upanuzi wa gharama nafuu wa LLMs za open-source.