World Labs തങ്ങളുടെ പുതിയ Atlas എന്ന ഓമ്നി-മോഡൽ അവതരിപ്പിച്ചു. ഇത് ഏതാനും സാധാരണ ഫോട്ടോകളെ ഉപയോഗിച്ച് പൂർണ്ണമായും സഞ്ചരിക്കാവുന്ന ഒരു 3-D ലോകമാക്കി മാറ്റുകയും, ഒരു മിനിറ്റ് വരെ നീളമുള്ള 1440p വീഡിയോകൾ നിർമ്മിക്കുകയും ചെയ്യുന്നു. ഈ സാങ്കേതികവിദ്യ ഒരു “real-to-sim” പൈപ്പ്‌ലൈൻ സൃഷ്ടിക്കുന്നുവെന്നാണ് കമ്പനി പറയുന്നത്.

പരന്ന സീക്വൻസുകളിൽ നിന്നുള്ള മാറ്റം പ്രധാനമാകുന്നത് എന്തുകൊണ്ട്

ഇന്നത്തെ ഭൂരിഭാഗം മൾട്ടിമോഡൽ AI സംവിധാനങ്ങളും ഇൻപുട്ടുകളെ വൺ- അല്ലെങ്കിൽ ടു-ഡൈമൻഷണൽ സ്ട്രീമുകളായിട്ടാണ് (ടെക്സ്റ്റ് സ്ട്രിംഗുകൾ, ഇമേജ് ഗ്രിഡുകൾ അല്ലെങ്കിൽ വീഡിയോ ഫ്രെയിമുകൾ) പരിഗണിക്കുന്നത്. കൃത്യമായ ജ്യാമിതീയ രൂപമില്ലാത്ത (explicit geometry) ഡാറ്റയിൽ നിന്ന് സ്പേഷ്യൽ റിലേഷൻഷിപ്പുകൾ കണ്ടെത്താൻ ഈ രീതി മോഡലിനെ നിർബന്ധിക്കുന്നു, ഇത് നിർമ്മിക്കപ്പെടുന്ന വീഡിയോകളുടെയും 3-D പുനർനിർമ്മാണങ്ങളുടെയും കൃത്യതയെ പരിമിതപ്പെടുത്തുന്നു. Atlas ഈ രീതി ഉപേക്ഷിക്കുന്നു. മോഡൽ പ്രോസസ്സ് ചെയ്യുന്ന ഓരോ ടോക്കണും ത്രീ-ഡൈമൻഷണൽ സ്പേസിലെ ഒരു നിശ്ചിത പോയിന്റുമായി ബന്ധപ്പെട്ടിരിക്കുന്നു; ഈ സാങ്കേതികവിദ്യയെ കമ്പനി 'spatial anchoring' എന്ന് വിളിക്കുന്നു. ടെക്സ്റ്റ്, ഇമേജ്, വീഡിയോ, 3-D ഡാറ്റ എന്നിവ ഉപയോഗിച്ച് 3-D അല്ലെങ്കിൽ 4-D (സമയം) ഘടനകളെ തിരിച്ചറിയാൻ കഴിയുന്ന ഒരു ആർക്കിടെക്ചറിലൂടെയാണ് Atlas പരിശീലിപ്പിക്കപ്പെട്ടിരിക്കുന്നത്, അതിനാൽ ഇതിന് ജ്യാമിതീയ രൂപങ്ങളെ നേരിട്ട് മനസ്സിലാക്കാനും കൈകാര്യം ചെയ്യാനും സാധിക്കുന്നു.

“സ്ലോട്ട് മെഷീൻ” വീഡിയോകളിൽ നിന്ന് ക്യാമറ നിയന്ത്രിത ജനറേഷനിലേക്ക്

നിലവിലുള്ള ജനറേറ്റീവ് വീഡിയോ ടൂളുകൾ ഒരു വെർച്വൽ ക്യാമറ ചലിപ്പിക്കാൻ അവ്യക്തമായ ടെക്സ്റ്റ് പ്രോംപ്റ്റുകളെയാണ് ആശ്രയിക്കുന്നത്, ഇത് പലപ്പോഴും പ്രവചനാതീതമായ ഫലങ്ങൾ നൽകുന്നു. Atlas പ്രോംപ്റ്റുകൾക്ക് പകരം ഒരു ജ്യാമിതീയ ഇൻപുട്ട് (geometric input) ഉപയോഗിക്കുന്നു: ഉപയോക്താവ് ഒരു ക്യാമറ പോസ് അല്ലെങ്കിൽ പാത്ത് നിശ്ചയിക്കുന്നു, മോഡൽ ആ കൃത്യമായ കാഴ്ചപ്പാടിൽ നിന്ന് രംഗം റെൻഡർ ചെയ്യുന്നു. ഡെമോകളിൽ, ക്യാമറ ചലനങ്ങൾക്കിടയിലും സ്ഥിരത നിലനിർത്തുന്ന സുഗമവും ഉയർന്ന റെസല്യൂഷനുള്ളതുമായ വീഡിയോകൾ ഈ സിസ്റ്റം നിർമ്മിച്ചു—ഇത് പ്രൊഫഷണൽ നിലവാരത്തിലുള്ള നിയന്ത്രണത്തിലേക്കുള്ള ഒരു ചുവടുവെപ്പാണ്.

കുറഞ്ഞ ചിത്രങ്ങൾ ഉപയോഗിച്ച് ലോകങ്ങളെ പുനർനിർമ്മിക്കുന്നു

പ്രത്യേക ക്യാപ്‌ചർ ഹാർഡ്‌വെയറുകൾ ഇല്ലാതെ തന്നെ, ഒരു ചിത്രം മുതൽ ഏതാനും ഡസൻ ചിത്രങ്ങൾ വരെ ഉപയോഗിച്ച് സങ്കീർണ്ണമായ ചുറ്റുപാടുകൾ പുനർനിർമ്മിക്കാൻ Atlas-ന് കഴിയും. ഒരു പബ്ലിക് ഡെമോയിൽ, ഒരു യൂണിവേഴ്സിറ്റി കോർട്ട്യാർഡിന്റെ കുറച്ച് ഗ്രൗണ്ട്-ലെവൽ ഫോട്ടോകൾ ഉപയോഗിച്ച്, പ്രതീക്ഷിച്ച ലേഔട്ടിന് അനുയോജ്യമായ രീതിയിൽ ആകാശദൃശ്യങ്ങൾ (aerial perspectives) ഈ മോഡൽ നിർമ്മിച്ചു. ക്യാമറ ചലിക്കുമ്പോൾ VGGT, InfiniteVGGT തുടങ്ങിയ മത്സര മോഡലുകൾ പലപ്പോഴും മങ്ങിയ ടെക്സ്ചറുകളോ ജ്യാമിതീയ പിഴവുകളോ കാണിക്കാറുണ്ട്; എന്നാൽ Atlas ഘടനയുടെ പൂർണ്ണത നിലനിർത്തി.

വീഡിയോയ്ക്ക് പുറമെ, ഈ മോഡൽ നേറ്റീവ് 3-D ഫോർമാറ്റുകൾ—point clouds, 3-D Gaussian splats എന്നിവ ഔട്ട്‌പുട്ട് നൽകുന്നു. ഉപരിതലത്തിന്റെ ആകൃതി സൂചിപ്പിക്കുന്ന സ്പേസിലെ പോയിന്റുകളുടെ കൂട്ടമാണ് point clouds; Gaussian splats ഓരോ പോയിന്റിനെയും ചെറിയൊരു ബ്ലോബ് (blob) ആയി സൂക്ഷിക്കുന്നു, ഇത് സൂക്ഷ്മമായ വിശദാംശങ്ങൾ കാര്യക്ഷമമായി റെൻഡർ ചെയ്യാൻ സഹായിക്കുന്നു. RGB നിറത്തോടൊപ്പം ഡെപ്ത് (depth) കൂടി നൽകുന്നതിലൂടെ, ഏതാനും സ്മാർട്ട്ഫോൺ ചിത്രങ്ങളെ ഏത് കോണിൽ നിന്നും പരിശോധിക്കാവുന്ന ഒരു ഡിജിറ്റൽ ട്വിനായി (digital twin) Atlas മാറ്റുന്നു.

റോബോട്ടുകൾക്കായി Real-to-sim

യഥാർത്ഥ ലോകത്തെ ഡാറ്റയും സിമുലേറ്റഡ് ട്രെയിനിംഗ് എൻവയോൺമെന്റുകളും തമ്മിലുള്ള വ്യത്യാസം പരിഹരിക്കാൻ റോബോട്ടിക്സ് ഡെവലപ്പർമാർ ഏറെ കാലമായി ശ്രമിക്കുന്നുണ്ട്. പുനർനിർമ്മിച്ച ഒരു മുറിയിൽ ഒരു റോബോട്ട് കാണുന്ന അതേ സെൻസർ ഫീഡ് നിർമ്മിച്ചുകൊണ്ട് ആ വിടവ് നികത്തുമെന്ന് Atlas വാഗ്ദാനം ചെയ്യുന്നു. ഡെവലപ്പർമാർക്ക് ഡിജിറ്റൽ ട്വിനിലെ വസ്തുക്കളോ വെളിച്ചമോ പശ്ചാത്തലമോ മാറ്റാൻ സാധിക്കും, ഇതിലൂടെ ഒരു യഥാർത്ഥ ലോക ക്യാപ്‌ചറിൽ നിന്ന് ആയിരക്കണക്കിന് വ്യത്യസ്ത സാഹചര്യങ്ങൾ സൃഷ്ടിക്കാം. സീൻ സിന്തസിസിൽ (scene synthesis) ശ്രദ്ധ കേന്ദ്രീകരിക്കുന്ന ഒരു സ്റ്റാർട്ടപ്പിൽ നിന്ന് നേടിയ സാങ്കേതികവിദ്യ ഉപയോഗിച്ച് World Labs ഈ പ്രവർത്തനരീതി പ്രദർശിപ്പിച്ചു; മനുഷ്യ ഇടപെടലില്ലാതെ അഞ്ച് വ്യത്യസ്ത റോബോട്ട് പ്ലാറ്റ്‌ഫോമുകളെ ഒരു മണിക്കൂർ നേരം സ്വയം പ്രവർത്തിപ്പിക്കാൻ ആവശ്യമായ വൈവിധ്യമാർന്ന സാഹചര്യങ്ങൾ ഈ പൈപ്പ്‌ലൈൻ നിർമ്മിച്ചു.

ബെഞ്ച്മാർക്കുകളും പ്രകടന അവകാശവാദങ്ങളും

നേരിട്ടുള്ള പരീക്ഷണങ്ങളിൽ (head-to-head tests), 94% കേസുകളിൽ മനുഷ്യ evaluേറ്റർമാർ പ്രമുഖ എതിരാളിയേക്കാൾ Atlas-ന്റെ ക്യാമറ ഗൈഡഡ് വീഡിയോകളെയാണ് ഇഷ്ടപ്പെട്ടത്, കൂടാതെ മറ്റ് പ്രധാന മോഡലുകളെക്കാൾ 81% കേസുകളിലും Atlas മുൻപന്തിയിലായിരുന്നു. പുനർനിർമ്മാണത്തിന്റെ കാര്യത്തിൽ, Atlas 25.3 എന്ന മീഡിയൻ എറർ (median error) കൈവരിച്ചു, ഇത് ഉയർന്ന എറർ സ്കോറുകൾ രേഖപ്പെടുത്തിയ എതിരാളികളെക്കാൾ മികച്ചതാണ്. ലാർജ് ലാംഗ്വേജ് മോഡലുകളുടെ വേഗതയും (ഇടക്കാല കണക്കുകൂട്ടലുകൾ വീണ്ടും ഉപയോഗിക്കാൻ key-value (KV) caching ഉപയോഗിക്കുന്നു), ചിത്രങ്ങൾ ഘട്ടം ഘട്ടമായി മെച്ചപ്പെടുത്തുന്ന ഡിഫ്യൂഷൻ മോഡലുകളുടെ (diffusion models) ഉയർന്ന ഗുണനിലവാരമുള്ള ഔട്ട്‌പുട്ടും ഈ മോഡൽ സംയോജിപ്പിക്കുന്നു.

സാധ്യമായ പോരായ്മകളും തുറന്ന ചോദ്യങ്ങളും

World Labs-ന്റെ പ്രഖ്യാപനങ്ങൾക്ക് മികച്ച ഡെമോകൾ പിന്തുണയുണ്ടെങ്കിലും, ഈ സാങ്കേതികവിദ്യ ഇപ്പോഴും പ്രാരംഭ ഘട്ടത്തിലാണ്. ഉയർന്ന റെസല്യൂഷനിൽ ടെക്സ്റ്റ്, ഇമേജ്, വീഡിയോ, 3-D ഡാറ്റ എന്നിവ കൈകാര്യം ചെയ്യുന്ന ഒരു മോഡൽ പരിശീലിപ്പിക്കാനും പ്രവർത്തിപ്പിക്കാനും വലിയ തോതിലുള്ള കമ്പ്യൂട്ടിംഗ് പവർ ആവശ്യമാണ്, എന്നാൽ കമ്പനി ഹാർഡ്‌വെയർ സ്പെസിഫിക്കേഷനുകളോ ഇൻഫറൻസ് ചിലവോ വെളിപ്പെടുത്തിയിട്ടില്ല. ഈ ബെഞ്ച്മാർക്കുകൾ മനുഷ്യരുടെ താൽപ്പര്യത്തെയും മീഡിയൻ എറർ മെട്രിക്സിനെയും അടിസ്ഥാനമാക്കിയുള്ളതാണ്; യഥാർത്ഥ ഡാറ്റയുമായി താരതമ്യം ചെയ്യുമ്പോൾ റോബോട്ട് മാനിപുലേഷൻ വിജയ നിരക്ക് പോലുള്ള ഡൗൺസ്ട്രീം ടാസ്ക്കുകളിൽ Atlas എങ്ങനെ പ്രവർത്തിക്കുന്നു എന്ന് ഇത് ഇതുവരെ കാണしていട്ടില്ല. കുറഞ്ഞ ചിത്രങ്ങളിൽ നിന്ന് യുക്തിസഹമായ ജ്യാമിതീയ രൂപങ്ങൾ നിർമ്മിക്കാൻ മോഡലിന് കഴിയുമെങ്കിലും, കൃത്യമായ അളവുകൾ ആവശ്യമായി വരുമ്പോൾ lidar scans അല്ലെങ്കിൽ structured-light captures എന്നിവയുടെ കൃത്യത ഇതിന് നൽകാൻ കഴിയില്ലെന്ന് വിമർശകർ ചൂണ്ടിക്കാട്ടുന്നു.

ഇനി എന്താണ് ശ്രദ്ധിക്കേണ്ടത്

  • റോബോട്ടിക്സ് പ്ലാറ്റ്‌ഫോമുകളുടെ ഉപയോഗം – റോബോട്ട് ടീമുകൾ Atlas നിർമ്മിച്ച ലോകങ്ങളെ അവരുടെ പരിശീലന രീതികളിൽ (training loops) ഉൾപ്പെടുത്തുകയും അളക്കാവുന്ന നേട്ടങ്ങൾ റിപ്പോർട്ട് ചെയ്യുകയും ചെയ്താൽ, കുറഞ്ഞ ചിലവിലുള്ളതും കൂടുതൽ വൈവിധ്യമാർന്നതുമായ സിമുലേഷൻ എന്ന അവകാശവാദം വിശ്വാസ്യത നേടും.
  • ഉള്ളടക്ക നിർമ്മാണ പൈപ്പ്‌ലൈനുകൾ – വേഗത്തിലുള്ള പ്രോട്ടോടൈപ്പിംഗിനായി Atlas പരീക്ഷിക്കുന്ന സ്റ്റുഡിയോകളും ഗെയിം ഡെവലപ്പർമാരും, ഈ മോഡലിന്റെ തനതായ 3-D ഔട്ട്‌പുട്ട് നിലവിലുള്ള അസറ്റ് പൈപ്പ്‌ലൈനുകളുമായി യോജിക്കുന്നുണ്ടോ എന്ന് വെളിപ്പെടുത്തിയേക്കാം.
  • ഓപ്പൺ സോഴ്‌സ് അല്ലെങ്കിൽ മൂന്നാം കക്ഷി മൂല്യനിർണ്ണയങ്ങൾ – ബെഞ്ച്മാർക്ക് നമ്പറുകൾ പുനഃസ്ഥാപിക്കുന്ന സ്വതന്ത്ര ഗവേഷകർ, നിലവിലെ മാനദണ്ഡങ്ങളേക്കാൾ ഈ മോഡലിനുള്ള മുൻതൂക്കം സ്ഥിരീകരിക്കാൻ സഹായിക്കും.
  • ഹാർഡ്‌വെയർ, ചിലവ് എന്നിവയെക്കുറിച്ചുള്ള വെളിപ്പെടുത്തലുകൾ – ഇൻഫറൻസിനായുള്ള (inference) കമ്പ്യൂട്ട് ബജറ്റ് മനസ്സിലാക്കുന്നത്, Atlas എഡ്ജ് ഉപകരണങ്ങളിൽ (edge devices) പ്രവർത്തിപ്പിക്കാൻ കഴിയുമോ അതോ ക്ലൗഡ് സേവനമായി മാത്രം നിലനിൽക്കുമോ എന്ന് തീരുമാനിക്കും.

ചുരുക്കത്തിൽ

AI ടോക്കണുകളെ ഭൗതികമായ ഇടങ്ങളിൽ (physical space) ഉറപ്പിച്ചു നിർത്തുന്നത് വഴി, കുറഞ്ഞ വിഷ്വൽ ഇൻപുട്ടുകളിൽ നിന്ന് പോലും ഒരു മുഴുവൻ പരിസരത്തെയും നിർമ്മിക്കാനും പുനർനിർമ്മിക്കാനും സിമുലേറ്റ് ചെയ്യാനും ഒരു സിംഗിൾ മോഡലിന് കഴിയുമെന്ന് Atlas കാണിച്ചുതരുന്നു. വാഗ്ദാനം ചെയ്ത പ്രകടനം അമിതമായ കമ്പ്യൂട്ട് ചിലവില്ലാതെ യഥാർത്ഥ ലോകത്തിലെ ഉപയോഗങ്ങളിലേക്ക് വ്യാപിപ്പിക്കാൻ സാധിച്ചാൽ, റോബോട്ടുകൾ എങ്ങനെ പഠിക്കുന്നുവെന്നും ഇമ്മേഴ്‌സീവ് ഉള്ളടക്കം (immersive content) എങ്ങനെ നിർമ്മിക്കുന്നുവെന്നും ഈ മോഡൽ മാറ്റിമറിച്ചേക്കാം; ഏതാനും ഫോട്ടോകളെ പൂർണ്ണമായും സംവേദനാത്മകമായ (interactive) ഒരു ഡിജിറ്റൽ ലോകമാക്കി മാറ്റാൻ ഇതിന് സാധിക്കും.