Tencent imezindua modeli ya WeMM-Embedding wiki hii, mfumo wa multimodal wenye vigezo bilioni 2 ambao tayari umeunganishwa katika mifumo ya utafutaji, mapendekezo na biashara ya kielektroniki ya WeChat. Utoaji huu ni muhimu kwa sababu unaonyesha modeli inayotoa ubora wa upatikanaji wa ulimwengu halisi, ucheleweshaji mdogo (low latency) na ukubwa mdogo wa indeksi.
Kwa nini kuna msisimko kuhusu "hadithi ya utekelezaji"
Modeli nyingi mpya za AI huja na majedwali ya kulinganisha (benchmarks) yenye mvuto yanayolinganisha alama kwenye seti za data zilizochujwa. Namba hizo huwasaidia watafiti kuthibitisha hoja zao, lakini mara chache hutafsiriwa katika vipimo vinavyoendesha bidhaa: jinsi swali linavyojibu haraka, kiasi cha kumbukumbu kinachotumiwa na indeksi, na jinsi modeli inavyoweza kukabiliana na maudhui yenye kelele yaliyoundwa na watumiaji. WeMM inabadilisha mwelekeo kwa kuwa kiungo cha kiwango cha uzalishaji (production-grade) tangu siku ya kwanza. Si jaribio la maabara linalosubiri timu ya baadaye kukiidhinisha; tayari inaendesha Channels, Moments, na biashara ya kielektroniki.
Mambo ya kiufundi ambayo watengenezaji wanapaswa kuzingatia
Ushughulikiaji wa kweli wa multimodal – Modeli hii huchukua maandishi, picha, fremu za video na picha ndogo za nyaraka (thumbnails) na kuziweka katika nafasi moja ya embedding. Mtumiaji anaweza kuandika "sunset" na kupata kipande cha video kinachoendana, picha, au makala ya habari bila kuhitaji kuunganisha mifumo tofauti ya maandishi pekee na picha pekee.
Ukubwa ni muhimu, lakini si kwa njia unayofikiria – Kwa vigezo 2B, modeli hii ni "ndogo" ikilinganishwa na modeli za zaidi ya 9B zinazotawala majedwali ya kulinganisha. Hata hivyo, inakidhi bajeti za ucheleweshaji (latency budgets) zinazohitajika kwa huduma zinazoingiliana. Modeli inayofaa kwenye vifaa vyako inaweza kufanya vizuri zaidi kuliko modeli kubwa na polepole katika mfumo unaofanya kazi mubashara.
Matryoshka embeddings hutoa uwezo wa kubadilisha vipimo – WeMM inasaidia "Matryoshka" embeddings, ikimaanisha kuwa mtandao uleule unaweza kutoa vekta za urefu tofauti, kama vile vipimo 256 au 512. Majaribio yanaonyesha kuwa kupunguza kutoka vipimo 512 hadi 256 kunaendelea kudumisha karibu utendaji kamili wa upatikanaji huku ukipunguza matumizi ya kumbukumbu kwa nusu, jambo linalopunguza moja kwa moja gharama za uhifadhi na kuharakisha utafutaji wa jirani wa karibu (nearest-neighbor searches).
Kanuni tatu za vitendo kwa ajili ya kujenga mifumo ya upatikanaji
Thibitisha kwa kutumia data yako mwenyewe – Benchmarks ni safi; data za uzalishaji ni changamani. Ikiwa watumiaji wako wanapakia picha za skrini (screenshots), maelezo ya mkono au video zenye utata wa chini (low-resolution), endesha modeli kwa mchanganyiko huo kabla ya kuamua kama inafaa.
Chukulia urefu wa vekta kama nyenzo ya kudhibiti gharama – Vekta kubwa huongeza hesabu zinazohitajika kwa utafutaji wa ufanani na pia nafasi ya diski kwa ajili ya indeksi. Anza na kipimo kidogo zaidi ambacho bado kinakidhi lengo lako la ubora. Ongeza ukubwa pale tu unapopata anguko wazi katika recall au precision.
Epuka mifumo iliyotengwa (siloed pipelines) – Kujenga kanzi (encoders) tofauti kwa kila aina ya maudhui (modality) kunakulazimisha kutengeneza kwa mkono mifumo ya uzito kwa ajili ya hatua ya mwisho ya upangaji. Tabaka la embedding la ulimwengu wote huondoa kodi hiyo ya ziada, inapunguza gharama za kihandisi na kufanya majaribio ya A/B kuwa rahisi.
Athari pana zaidi
Kwa kampuni zinazotegemea utafutaji au mapendekezo, uchaguzi wa modeli ya embedding unaweza kuamua matumizi ya miundombinu. Bajeti za ucheleweshaji (latency) zinazidi kuwa finyu kadiri matarajio ya watumiaji yanavyoongezeka; modeli inayoongeza hata milisekunde chache kwa kila swali inaweza kuifanya huduma isivuke kiwango cha utendaji kinachokubalika, na kusababisha watumiaji kuacha huduma (churn).
Uamuzi wa Tencent wa kufanya uzani (weights) kuwa open-source chini ya leseni ya Apache 2.0 pia unabadilisha mwelekeo wa gharama kwa watengenezaji. Badala ya kujadili mikataba ya umiliki au kujenga modeli kuanzia mwanzo, timu zinaweza kupakua checkpoint, kuifanyia marekebisho (fine-tune) kwa kutumia data mahususi za nyanja husika, na kuifanyia tathmini dhidi ya mifano michache ya kushindwa.
Mahali ambapo modeli inaweza kufeli
Modeli inashughulikia aina nne za maudhui—maandishi, picha, video, na nyaraka—lakini haijafunika kila aina inayowezekana ya ingizo.
Nini cha kufuatilia baadaye
Muhtasari
WeMM inaonyesha kuwa modeli ya embedding ya multimodal yenye ukubwa wa wastani inaweza kushughulikia maswali ya kila siku wakati ikiundwa kwa kuzingatia vikwazo vya uzalishaji. Kwa watengenezaji, ujumbe uko wazi: kipaumbele uwe ubora wa upatikanaji wa ulimwengu halisi, uweke vipimo vya vekta vidogo kadiri inavyowezekana, na uunganishe aina mbalimbali za maudhui katika tabaka moja la embedding. Chaguzi hizo zinaweza kupunguza ucheleweshaji, kupunguza gharama za uhifadhi na, hatimaye, kutoa uzoefu bora kwa watumiaji wa mwisho.
