World Labs imefunua Atlas, modeli ya jumla (omni-model) inayobadilisha picha chache za kawaida kuwa ulimwengu wa 3-D unaoweza kutembelewa kikamilifu na kutoa video ya hadi dakika moja yenye ubora wa 1440p. Kampuni hiyo inasema teknolojia hiyo inatengeneza mfumo wa “real-to-sim” (kutoka halisi hadi kwenye simulizi).

Kwa nini mabadiliko kutoka kwenye mfuatano bapa ni muhimu

Mifumo mingi ya AI ya multimodal leo inachukulia ingizo (inputs) kama mtiririko wa dimenisheni moja au mbili—kama vile maandishi, mfululizo wa picha, au fremu za video. Muundo huo unailazimisha modeli kuhisi uhusiano wa kijiometri kutoka kwenye data inayokosa jiometri ya wazi, jambo linalozuia usahihi wa video inayozalishwa na ujenzi upya wa 3-D. Atlas inatupa mbinu hiyo. Kila token ambayo modeli inachakata imeunganishwa na nukta mahususi katika nafasi ya dimenisheni tatu, mbinu ambayo kampuni inaiita spatial anchoring. Kwa kufundishwa tangu mwanzo kwa kutumia maandishi, picha, video, na data ya 3-D kwa usanifu unaozingatia muundo wa 3-D—au hata 4-D (muda)—Atlas inaweza kuelewa na kudhibiti jiometri moja kwa moja.

Kutoka video ya “slot-machine” hadi uzalishaji unaodhibitiwa na kamera

Zana za sasa za uzalishaji wa video zinategemea maelekezo (prompts) ya maandishi yasiyo wazi ili kusogeza kamera ya kidijitali, jambo ambalo mara nyingi huleta matokeo yasiyotabirika. Atlas inachukua nafasi ya maelekezo hayo kwa kutumia ingizo la kijiometri: mtumiaji huainisha mkao wa kamera au njia, na modeli inatoa mandhari kutoka katika mtazamo huo mahususi. Katika maonyesho, mfumo huo ulitoa video laini yenye ubora wa juu ambayo ilibaki thabiti wakati kamera inasogea—hatua kubwa kuelekea udhibiti wa kiwango cha kitaalamu.

Kujenga upya ulimwengu kwa picha chache sana

Atlas inaweza kujenga upya mazingira tata kuanzia picha moja tu hadi mamia machache, bila kuhitaji vifaa maalum vya upigaji picha. Katika onyesho la hadhara, modeli hiyo ilichukua seti ndogo ya picha za chini za uwanja wa chuo kikuu na kutengeneza mitazamo ya angani iliyoendana na mpangilio uliotarajiwa. Modeli zinazoshindana kama VGGT na InfiniteVGGT mara nyingi huleta picha zisizoeleweka au hitilafu za kijiometri wakati kamera inasogea; Atlas ilidumisha uimara wa muundo katika hatua zote.

Zaidi ya video, modeli hii hutoa mifumo ya asili ya 3-D—point clouds na 3-D Gaussian splats. Point clouds ni mkusanyiko wa nukta katika nafasi zinazowakilisha umbo la uso; Gaussian splats huhifadhi kila nukta kama kizuizi kidogo kinachobadilika kwa ulaini, hali inayowezesha uwasilishaji wa maelezo madogo madogo kwa ufanisi. Kwa kutoa kina (depth) pamoja na rangi za RGB, Atlas inageuza picha chache za smartphone kuwa pacha wa kidijitali (digital twin) unaoweza kuchunguzwa kutoka pembe yoyote.

Real-to-sim kwa ajili ya roboti

Watengenezaji wa roboti wamekuwa wakihangaika kwa muda mrefu na pengo kati ya data ya ulimwengu halisi na mazingira ya mafunzo ya simulizi. Atlas inaahidi kuziba pengo hilo kwa kutengeneza mtiririko sahihi wa sensa ambao roboti ingeona katika chumba kilichojengwa upya. Watengenezaji wanaweza kisha kubadilisha vitu, mwanga, au mandhari katika pacha huyo wa kidijitali, wakitengeneza maelfu ya matukio tofauti kutoka kwenye picha moja ya ulimwengu halisi. World Labs ilionyesha mtiririko huo wa kazi kwa kutumia teknolojia iliyonunuliwa kutoka kwa kampuni changu inayojikita katika utengenezaji wa mandhari (scene synthesis); mfumo huo ulitoa mabadiliko ya kutosha kuwezesha mifumo mitano tofauti ya roboti kufanya kazi yenyewe kwa saa moja bila kuingiliwa na binadamu.

Vipimo vya utendaji na madai ya ufanisi

Katika majaribio ya moja kwa moja, waevaliaji wa binadamu walipendelea video za Atlas zinazoelekezwa na kamera kuliko mshindani mkuu katika asilimia 94 ya ulinganishaji, na kuliko modeli nyingine kubwa katika asilimia 81 ya matukio. Kwa ajili ya ujenzi upya, Atlas ilifikia wastani wa makosa (median error) wa 25.3, ikishinda washindani walioripoti alama za makosa za juu zaidi. Modeli hii inaunganisha faida za kasi za mifumo mikubwa ya lugha—ikitumia KV caching kurejesha mahesabu ya kati—na matokeo ya hali ya juu ya mifumo ya diffusion, ambayo hurekebisha picha hatua kwa hatua.

Changamoto zinazoweza kutokea na maswali ya wazi

Matangazo ya World Labs yanategemewa na maonyesho ya kuvutia, lakini teknolojia hii bado ipo katika hatua za awali. Kufundisha na kuendesha modeli inayoshughulikia maandishi, picha, video, na data ya 3-D kwa azimio la juu kunahitaji nguvu kubwa ya kompyuta (compute), na kampuni haijafichua sifa za vifaa au gharama za utendaji (inference costs). Vipimo hivi vinategemea upendeleo wa binadamu na vipimo vya wastani wa makosa; bado hayaonyeshi jinsi Atlas inavyofanya kazi katika kazi za baadaye kama vile viwango vya mafanikio vya uendeshaji wa roboti ikilinganishwa na data halisi pekee. Wakosoaji wanaweza pia kuashiria kuwa ingawa modeli inaweza kutengeneza jiometri inayowezekana kutokana na picha chache, haiwezi kuchukua nafasi ya usahihi wa skani za lidar au upigaji picha wa mwanga uliopangwa (structured-light) wakati vipimo sahihi vinapohitajika.

Nini cha kufuatilia baadaye

  • Kukubalika na mifumo ya roboti – Ikiwa timu za roboti zitajumuisha ulimwengu uliotengenezwa na Atlas katika mizunguko yao ya mafunzo na kuripoti mafanikio yanayopimika, dai la uigaaji (simulation) wa bei nafuu na wenye mabadiliko zaidi litapata kuaminika.
  • Mifumo ya utengenezaji wa maudhui – Studio na watengenezaji wa michezo wanaojaribu Atlas kwa ajili ya utengenezaji wa haraka wa mifano (rapid prototyping) wanaweza kuonyesha ikiwa matokeo ya asili ya 3-D ya modeli hii yanaendana na mifumo ya sasa ya rasilimali (asset pipelines).
  • Tathmini za chanzo huru au za upande wa tatu – Watafiti huru wanaorejelea namba za kielelezo (benchmark numbers) wataisaidia kuthibitisha ubora wa modeli hii dhidi ya viwango vya sasa.
  • Ufunuo wa vifaa na gharama – Kuelewa bajeti ya kompyuta kwa ajili ya inference kutaamua ikiwa Atlas inaweza kufanya kazi kwenye vifaa vya ukingoni (edge devices) au itabaki kuwa huduma ya wingu pekee.

Hitimisho

Atlas inaonyesha kuwa kuunganisha tokeni za AI katika nafasi ya kimwili kunaruhusu modeli moja kutengeneza, kujenga upya, na kuiga mazingira nzima kutokana na maingizo madogo ya picha. Ikiwa utendaji uliodhaminiwa utaweza kutumika katika matumizi ya ulimwengu halisi bila gharama kubwa za kompyuta, modeli hii inaweza kubadilisha jinsi roboti zinavyojifunza na jinsi maudhui ya kusisimua yanavyoundwa, ikibadilisha picha chache kuwa ulimwengu wa kidijitali unaoweza kuingiliana kikamilifu.