World Labs தனது Atlas எனும் 'omni-model'-ஐ அறிமுகப்படுத்தியுள்ளது. இது சில சாதாரண புகைப்படங்களை முழுமையாகச் சுற்றிப் பார்க்கக்கூடிய ஒரு 3-D உலகமாக மாற்றுகிறது மற்றும் ஒரு நிமிடம் வரையிலான 1440p வீடியோவை உருவாக்குகிறது. இந்தத் தொழில்நுட்பம் ஒரு “real-to-sim” வழிமுறையை (pipeline) உருவாக்குகிறது என்று அந்த நிறுவனம் கூறுகிறது.
தட்டையான வரிசைகளிலிருந்து (flat sequences) மாறுபடுவது ஏன் முக்கியம்
இன்றைய பெரும்பாலான மல்டிமோடல் (multimodal) AI அமைப்புகள் உள்ளீடுகளை ஒன்று அல்லது இரண்டு பரிமாணத் தொடர்களாகவே—அதாவது உரைச் சரங்கள் (text strings), படக் கட்டங்கள் (image grids) அல்லது வீடியோ பிரேம்கள்—கருதுகின்றன. இந்த வடிவமைப்பு, தெளிவான வடிவியல் (geometry) இல்லாத தரவுகளிலிருந்து இடஞ்சார்ந்த உறவுகளைக் கண்டறிய மாடலைத் தூண்டுகிறது, இது உருவாக்கப்பட்ட வீடியோ மற்றும் 3-D மறுசீரமைப்புகளின் துல்லியத்தைக் குறைக்கிறது. Atlas இந்த அணுகுமுறையைக் கைவிடுகிறது. மாடல் செயலாக்கும் ஒவ்வொரு டோக்கனும் (token) முப்பரிமாண வெளியில் உள்ள ஒரு குறிப்பிட்ட புள்ளியுடன் இணைக்கப்பட்டுள்ளது; இந்தத் தொழில்நுட்பத்தை நிறுவனம் 'spatial anchoring' என்று அழைக்கிறது. உரை, படங்கள், வீடியோ மற்றும் 3-D தரவுகளைக் கொண்டு, 3-D அல்லது 4-D (நேரம்) கட்டமைப்பைப் புரிந்துகொள்ளும் ஒரு கட்டமைப்பின் மூலம் புதிதாகப் பயிற்சியளிப்பதன் மூலம், Atlas வடிவியலை நேரடியாகப் புரிந்துகொள்ளவும் கையாளவும் முடிகிறது.
“slot-machine” வீடியோவிலிருந்து கேமரா மூலம் கட்டுப்படுத்தப்படும் உருவாக்கம் வரை
தற்போதைய உருவாக்கும் வீடியோ கருவிகள் (generative video tools), ஒரு மெய்நிகர் கேமராவை நகர்த்த தெளிவற்ற உரைத் தூண்டுதல்களை (text prompts) நம்பியிருக்கின்றன, இது பெரும்பாலும் கணிக்க முடியாத முடிவுகளைத் தருகிறது. Atlas அந்தத் தூண்டுதலுக்குப் பதிலாக ஒரு வடிவியல் உள்ளீட்டைப் பயன்படுத்துகிறது: பயனர் ஒரு கேமரா நிலை (camera pose) அல்லது பாதையைத் தீர்மானிக்கிறார், மேலும் மாடல் அந்தத் துல்லியமான கோணத்திலிருந்து காட்சியை உருவாக்குகிறது. விளக்கக்காட்சிகளில் (demos), கேமரா நகர்வுகளின் போதும் சீராக இருக்கும் மென்மையான, உயர்-தீர்மான (high-resolution) வீடியோவை இந்த அமைப்பு உருவாக்கியது—இது தொழில்முறைத் தரத்திலான கட்டுப்பாட்டை நோக்கிய ஒரு முக்கியப் படியாகும்.
குறைந்தபட்சப் படங்களைக் கொண்டு உலகங்களை மறுசீரமைத்தல்
Atlas எந்தவொரு சிறப்புப் படமாக்கக் கருவியும் (capture hardware) இன்றி, ஒரு படம் முதல் சில டஜன் படங்கள் வரை மிகக் குறைந்த அளவிலான படங்களைக் கொண்டு சிக்கலான சூழல்களை மறுசீரமைக்க முடியும். ஒரு பொது விளக்கக்காட்சியில், ஒரு பல்கலைக்கழக வளாகத்தின் தரைமட்டப் புகைப்படங்களை எடுத்து, எதிர்பார்க்கப்படும் அமைப்பிற்குப் பொருந்தக்கூடிய வான்வழிப் பார்வைகளை (aerial perspectives) இந்த மாடல் உருவாக்கியது. VGGT மற்றும் InfiniteVGGT போன்ற போட்டியிடும் மாடல்கள் கேமரா நகரும்போது பெரும்பாலும் மங்கலான அமைப்புகளையோ (blurry textures) அல்லது வடிவியல் பிழைகளையோ (geometric glitches) உருவாக்குகின்றன; ஆனால் Atlas முழுவதிலும் கட்டமைப்பின் ஒருமைப்பாட்டைப் (structural integrity) பராமரித்தது.
வீடியோவைத் தாண்டி, இந்த மாடல் இயல்பான 3-D வடிவங்களான point clouds மற்றும் 3-D Gaussian splats ஆகியவற்றை வெளியிடுகிறது. Point clouds என்பது மேற்பரப்பின் வடிவத்தை குறியீடாக்கும் விண்வெளியில் உள்ள புள்ளிகளின் தொகுப்பாகும்; Gaussian splats ஒவ்வொரு புள்ளியையும் ஒரு சிறிய, மென்மையாக மாறுபடும் புள்ளியாகச் சேமிக்கிறது, இது நுணுக்கமான விவரங்களைச் சிறப்பாக உருவாக்க உதவுகிறது. RGB வண்ணத்துடன் ஆழத்தையும் (depth) வழங்குவதன் மூலம், Atlas சில ஸ்மார்ட்போன் புகைப்படங்களை எந்தக் கோணத்திலிருந்தும் ஆராயக்கூடிய ஒரு டிஜிட்டல் ட்வின் (digital twin) ஆக மாற்றுகிறது.
ரோபோக்களுக்கான Real-to-sim
ரோபோடிக்ஸ் உருவாக்குநர்கள் நீண்டகாலமாக நிஜ உலகத் தரவுக்கும் உருவகப்படுத்தப்பட்ட பயிற்சிச் சூழல்களுக்கும் (simulated training environments) இடையிலான இடைவெளியைக் குறைக்கப் போராடி வருகின்றனர். மறுசீரமைக்கப்பட்ட ஒரு அறையில் ஒரு ரோபோவைப் பார்க்கும் அதே துல்லியமான சென்சார் தரவை (sensor feed) உருவாக்குவதன் மூலம் அந்த இடைவெளியைக் குறைக்க Atlas உறுதியளிக்கிறது. இதன் மூலம் உருவாக்குநர்கள் டிஜிட்டல் ட்வினில் உள்ள பொருட்கள், ஒளி அல்லது பின்னணிகளை மாற்றியமைக்க முடியும், இதன் மூலம் ஒரே ஒரு நிஜ உலகப் படத்திலிருந்து ஆயிரக்கணக்கான மாறுபட்ட சூழல்களை உருவாக்க முடியும். காட்சித் தொகுப்பில் (scene synthesis) கவனம் செலுத்தும் ஒரு ஸ்டார்ட்அப் நிறுவனத்திடமிருந்து பெறப்பட்ட தொழில்நுட்பத்தைப் பயன்படுத்தி World Labs இந்தச் செயல்பாட்டை நிரூபித்தது; இந்த வழிமுறை ஐந்து வெவ்வேறு ரோபோ தளங்களை மனிதத் தலையீடு இன்றி ஒரு மணி நேரம் தன்னிச்சையாக இயங்க வைக்கும் அளவுக்குப் போதுமான மாறுபாடுகளை உருவாக்கியது.
அளவுகோல்கள் மற்றும் செயல்திறன் கூற்றுகள்
நேரடிச் சோதனைகளில், ஜோடி ஒப்பீடுகளில் (pairwise comparisons) 94% சந்தர்ப்பங்களில் மனித மதிப்பீட்டாளர்கள் ஒரு முன்னணிப் போட்டியாளரை விட Atlas-ன் கேமரா வழிகாட்டு வீடியோக்களையே விரும்பினர், மேலும் 81% சந்தர்ப்பங்களில் மற்றொரு முக்கிய மாடலை விடவும் Atlas சிறந்து விளங்கியது. மறுசீரமைப்பிற்கு (reconstruction), Atlas 25.3 என்ற இடைநிலைத் தவறு விகிதத்தை (median error) எட்டியது, இது அதிகத் தவறு விகிதங்களைக் கொண்ட மற்ற மாடல்களை விடச் சிறந்தது. இந்த மாடல், இடைநிலை கணக்கீடுகளை மீண்டும் பயன்படுத்த key-value (KV) caching முறையைப் பயன்படுத்தும் பெரிய மொழி மாதிரிகளின் (large language models) வேகத்தையும், படங்களைத் தொடர்ச்சியாகச் செம்மைப்படுத்தும் டிஃப்யூஷன் மாடல்களின் (diffusion models) உயர்தர வெளியீட்டையும் ஒருங்கிணைக்கிறது.
சாத்தியமான குறைபாடுகள் மற்றும் திறந்த கேள்விகள்
World Labs-ன் அறிவிப்புகள் ஈர்க்கக்கூடிய விளக்கக்காட்சிகளால் ஆதரிக்கப்படுகின்றன, ஆனால் இந்தத் தொழில்நுட்பம் இன்னும் ஆரம்ப நிலையிலேயே உள்ளது. உரை, படங்கள், வீடியோ மற்றும் 3-D தரவுகளை உயர் தீர்மானத்தில் கையாளும் ஒரு மாடலைப் பயிற்றுவிப்பதற்கும் இயக்குவதற்கும் கணிசமான கணினித் திறன் (compute) தேவைப்படுகிறது, மேலும் நிறுவனம் வன்பொருள் விவரங்கள் அல்லது இன்ஃபரன்ஸ் (inference) செலவுகளைத் தெரிவிக்கவில்லை. இந்த அளவுகோல்கள் மனித விருப்பம் மற்றும் இடைநிலைத் தவறு அளவீடுகளைச் சார்ந்தே உள்ளன; முற்றிலும் நிஜத் தரவுகளுடன் ஒப்பிடும்போது, ரோபோக்களின் செயல்பாட்டு வெற்றி விகிதங்கள் போன்ற அடுத்தகட்டப் பணிகளில் Atlas எவ்வாறு செயல்படுகிறது என்பதை இவை இன்னும் காட்டவில்லை. மேலும், சில படங்களிலிருந்து நம்பகமான வடிவியலை உருவாக்க முடிந்தாலும், துல்லியமான அளவீடுகள் தேவைப்படும்போது lidar ஸ்கேன்கள் அல்லது structured-light படமாக்கல்களின் துல்லியத்திற்கு இது ஈடாகாது என்று விமர்சகர்கள் சுட்டிக்காட்டலாம்.
அடுத்து கவனிக்க வேண்டியவை
- ரோபாட்டிக்ஸ் தளங்களால் ஏற்றுக்கொள்ளப்படுதல் – ரோபோ குழுக்கள் Atlas உருவாக்கிய உலகங்களை தங்களது பயிற்சிச் சுழற்சிகளில் (training loops) ஒருங்கிணைத்து, அளவிடக்கூடிய முன்னேற்றங்களை அறிக்கையிட்டால், மலிவான மற்றும் மாறுபட்ட உருவகப்படுத்துதல் (simulation) குறித்த கூற்று நம்பகத்தன்மையைப் பெறும்.
- உள்ளடக்க உருவாக்க வழிமுறைகள் (Content-creation pipelines) – விரைவான முன்மாதிரி உருவாக்கத்திற்காக (rapid prototyping) Atlas-ஐப் பயன்படுத்தி சோதிக்கும் ஸ்டுடியோக்கள் மற்றும் கேம் டெவலப்பர்கள், இந்த மாதிரியின் இயல்பான 3-D வெளியீடு தற்போதுள்ள சொத்து வழிமுறைகளுடன் (asset pipelines) பொருந்துகிறதா என்பதை வெளிப்படுத்தக்கூடும்.
- திறந்த மூல அல்லது மூன்றாம் தரப்பு மதிப்பீடுகள் – பெஞ்ச்மார்க் எண்களை மீண்டும் உருவாக்கும் சுதந்திரமான ஆராய்ச்சியாளர்கள், தற்போதைய தரநிலைகளை விட இந்த மாதிரியின் சிறப்பம்சத்தை உறுதிப்படுத்த உதவுவார்கள்.
- வன்பொருள் மற்றும் செலவு வெளிப்பாடுகள் – அனுமானத்திற்கான (inference) கணினித் திறன் பட்ஜெட்டைப் புரிந்துகொள்வது, Atlas எட்ஜ் சாதனங்களில் (edge devices) இயங்குமா அல்லது கிளவுட் சார்ந்த சேவையாக மட்டுமே இருக்குமா என்பதைத் தீர்மானிக்கும்.
இறுதி முடிவு
AI டோக்கன்களைப் பருப்பொருள் வெளியில் (physical space) நிலைநிறுத்துவதன் மூலம், மிகக் குறைந்த காட்சி உள்ளீட்டிலிருந்தே (visual input) ஒரு ஒற்றை மாதிரியால் முழுமையான சூழல்களை உருவாக்கவும், மறுசீரமைக்கவும் மற்றும் உருவகப்படுத்தவும் முடியும் என்பதை Atlas காட்டுகிறது. வாக்குறுதி அளிக்கப்பட்ட செயல்திறன், மிக அதிக கணினிச் செலவுகள் இன்றி நிஜ உலகப் பயன்பாடுகளுக்கு விரிவுபடுத்தப்பட்டால், ரோபோக்கள் எவ்வாறு கற்கின்றன மற்றும் மூழ்கிப்போகும் வகையிலான (immersive) உள்ளடக்கங்கள் எவ்வாறு உருவாக்கப்படுகின்றன என்பதை இந்த மாதிரி மாற்றி அமைக்கக்கூடும்; மேலும் சில புகைப்படங்களை ஒரு முழுமையான ஊடாடும் டிஜிட்டல் உலகமாக மாற்றும்.
