Kimi K3, model ya hivi karibuni yenye uzani wa wazi (open-weights) kutoka kwa timu ya Kimi, inakuja na mfumo mkuu wa mixture-of-experts (MoE) wenye vigezo (parameters) trilioni 2.8 na dirisha la muktadha la tokeni milioni 1, ikipanua papo hapo uwezo wa watengenezaji kuendesha mifumo ndani ya mashine zao bila kulazimika kutegemea API zilizofungwa.

Muundo wa MoE unaweka kikomo cha idadi ya vigezo hai katika bilioni 104, ukitoa uwezo wa kufikiri wa model yenye trilioni nyingi huku ukidumisha kasi thabiti. Ufanisi huo unatoa ongezeko la mara 2.5 ikilinganishwa na toleo la awali la Kimi K2—hatua kubwa kwa yeyote aliyewahi kukumbana na vikwazo vya uwezo wa kompyuta (compute) au ucheleweshaji (latency) kwenye model za wazi zilizopo.

Kwa nini maboresho haya ni muhimu sasa

Model za open-weights kwa kawaida zimekuwa zikiwa nyuma ya mifumo ya umiliki binafsi (proprietary systems) katika ukubwa na urefu wa muktadha. Kimi K3 inabadilisha mwelekeo huo kwa kuunganisha ukubwa mkubwa na dirisha la muktadha linaloweza kubeba tokeni milioni nzima—inatosha kusoma repository nzima ya kodi au makala ndefu ya utafiti kwa mara moja. Kwa watengenezaji wanaojenga mifumo ya retrieval-augmented generation (RAG), wasaidizi wa maandishi marefu, au zana za kurekebisha makosa (debugging) zinazojiendesha, muktadha huu wa ziada unapunguza hitaji la mbinu za kugawa data katika vipande (chunking strategies).

Muundo wa kiufundi

  • Stable LatentMoE routing: Token zinatumiwa kupitia wataalamu (experts) 896, huku wataalamu 16 wakichochewa kwa kila token. Uanzishaji huu adimu (sparse activation) unapunguza matumizi ya kumbukumbu (memory footprint) huku bado ukitumia rasilimali kubwa ya maarifa.
  • Kimi Delta Attention (KDA): Aina mpya ya attention inayotuliza mtiririko wa habari katika mitandao mirefu (deep networks), ikipunguza hatari ya kutokuwa thabiti kwa gradient (gradient instability) ambayo inaweza kuathiri model kubwa sana.
  • Expert-parallel training: Timu ilipanga uwezo wa kompyuta (compute) ili kila mtaalamu (expert) uendeshwe kwenye sehemu yake ya vifaa (hardware), kuzuia vikwazo (bottlenecks) vinavyotokea wakati wataalamu wengi wanashindania rasilimali zilezile.
  • Advanced memory management: Mbinu maalum za ugawaji (allocation strategies) huruhusu model kusaidia mafunzo ya wakala (agent training) yanayotegemea reinforcement learning bila kuisha kumbukumbu ya GPU.

Kile ambacho uzani wa wazi (open weights) unaruhusu

Kwa sababu uzani (weights) uko wazi kwa umma, watumiaji wanaweza kukagua uwakilishi wa ndani wa model, kubaini upendeleo (biases), au kuifanyia marekebisho kwa ajili ya maeneo maalum. Kurekebisha kwa kina (fine-tuning) kwa data za umiliki binafsi haihitaji tena mkataba wa wingu (cloud contract); mfumo mzima unaweza kuendeshwa kwenye vifaa vya ndani (on-prem hardware) vinavyokidhi mahitaji ya expert-parallel ya timu hiyo.

Matumizi ya haraka kwa watengenezaji

  • Mifumo ya retrieval-augmented generation inayochukua habari kutoka kwenye hifadhi kubwa za nyaraka kupitia prompt moja.
  • Wasaidizi wa kodi wa maandishi marefu wanaohifadhi muktadha wa mradi mzima kwenye kumbukumbu.
  • Zana za uchambuzi wa kodi katika repository nzima zinazochunguza mamilioni ya mistari bila kuvuruga prompt.
  • Wakala wa kurekebisha makosa (debugging agents) wanaojitegemea ambao wanadumisha kumbukumbu kamili ya utekelezaji (execution trace) wakati wakifikiria marekebisho.