World Labs తమ Atlas అనే ఓమ్నీ-మోడల్ను (omni-model) పరిచయం చేసింది. ఇది కొన్ని సాధారణ ఫోటోలను పూర్తిగా నావిగేట్ చేయగలిగే 3-D ప్రపంచంగా మారుస్తుంది మరియు గరిష్టంగా ఒక నిమిషం పాటు 1440p వీడియోను రెండర్ చేస్తుంది. ఈ సాంకేతికత "real-to-sim" పైప్లైన్ను సృష్టిస్తుందని కంపెనీ చెబుతోంది.
ఫ్లాట్ సీక్వెన్స్ల నుండి మార్పు ఎందుకు ముఖ్యం
నేడు ఉన్న చాలా మల్టీమోడల్ AI వ్యవస్థలు ఇన్పుట్లను వన్- లేదా టూ-డైమెన్షనల్ స్ట్రీమ్లుగా—టెక్స్ట్ స్ట్రింగ్స్, ఇమేజ్ గ్రిడ్లు లేదా వీడియో ఫ్రేమ్లుగా—పరిగణిస్తాయి. ఈ డిజైన్ వల్ల, స్పష్టమైన జ్యామితి (geometry) లేని డేటా నుండి స్పేషియల్ రిలేషన్షిప్లను ఊహించాల్సి వస్తుంది, దీనివల్ల జనరేట్ చేయబడిన వీడియో మరియు 3-D పునర్నిర్మాణాల (reconstructions) నాణ్యత పరిమితం అవుతుంది. Atlas ఈ విధానాన్ని పక్కన పెట్టింది. మోడల్ ప్రాసెస్ చేసే ప్రతి టోకెన్ త్రీ-డైమెన్షనల్ స్పేస్లోని ఒక నిర్దిష్ట పాయింట్తో అనుసంధానించబడి ఉంటుంది, ఈ పద్ధతిని కంపెనీ "spatial anchoring" అని పిలుస్తుంది. టెక్స్ట్, ఇమేజెస్, వీడియో మరియు 3-D డేటాపై 3-D లేదా 4-D (సమయం) నిర్మాణాన్ని అర్థం చేసుకునే ఆర్కిటెక్చర్తో మొదటి నుండి శిక్షణ ఇవ్వడం ద్వారా, Atlas నేరుగా జ్యామితిని అర్థం చేసుకోగలదు మరియు మార్చగలదు.
“స్లాట్-మెషిన్” వీడియో నుండి కెమెరా-నియంత్రిత జనరేషన్కు
ప్రస్తుత జనరేటివ్ వీడియో టూల్స్ వర్చువల్ కెమెరాను కదిలించడానికి అస్పష్టమైన టెక్స్ట్ ప్రాంప్ట్లపై ఆధారపడతాయి, దీనివల్ల తరచుగా ఊహించని ఫలితాలు వస్తాయి. Atlas ఈ ప్రాంప్ట్ను జ్యామితీయ ఇన్పుట్తో (geometric input) భర్తీ చేస్తుంది: వినియోగదారు కెమెరా పోజ్ లేదా మార్గాన్ని (path) పేర్కొంటే, మోడల్ ఆ ఖచ్చితమైన వ్యూ పాయింట్ నుండి దృశ్యాన్ని రెండర్ చేస్తుంది. డెమోలలో, ఈ సిస్టమ్ కెమెరా కదలికల ద్వారా స్థిరంగా ఉండే స్మూత్, హై-రిజల్యూషన్ వీడియోను అందించింది—ఇది ప్రొఫెషనల్-గ్రేడ్ నియంత్రణ వైపు ఒక అడుగు.
అతి తక్కువ చిత్రాలతో ప్రపంచాలను పునర్నిర్మించడం
Atlas ఎటువంటి ప్రత్యేక క్యాప్చర్ హార్డ్వేర్ లేకుండా, కేవలం ఒకే ఒక చిత్రం నుండి కొన్ని డజన్ల చిత్రాల వరకు ఉపయోగించి సంక్లిష్టమైన వాతావరణాలను పునర్నిర్మించగలదు. ఒక పబ్లిక్ డెమోలో, ఈ మోడల్ ఒక యూనివర్సిటీ క్వాడ్ (quad) యొక్క తక్కువ సంఖ్యలో ఉన్న గ్రౌండ్-లెవల్ ఫోటోలను తీసుకుని, ఆశించిన లేఅవుట్కు సరిపోయే ఎయిరియల్ పర్స్పెక్టివ్లను (aerial perspectives) సింథసైజ్ చేసింది. VGGT మరియు InfiniteVGGT వంటి పోటీ మోడల్స్ కెమెరా కదిలినప్పుడు తరచుగా బ్లరీ టెక్స్చర్లను లేదా జ్యామితీయ లోపాలను (geometric glitches) చూపుతాయి; కానీ Atlas మొత్తం ప్రక్రియలో నిర్మాణ సమగ్రతను (structural integrity) కాపాడింది.
వీడియో మాత్రమే కాకుండా, ఈ మోడల్ నేటివ్ 3-D ఫార్మాట్లను—పాయింట్ క్లౌడ్స్ (point clouds) మరియు 3-D Gaussian splatsలను అవుట్పుట్గా ఇస్తుంది. పాయింట్ క్లౌడ్స్ అనేవి ఉపరితల ఆకారాన్ని ఎన్కోడ్ చేసే స్పేస్లోని పాయింట్ల సమూహాలు; Gaussian splats ప్రతి పాయింట్ను ఒక చిన్న, స్మూత్గా మారే బ్లోబ్ (blob) లాగా నిల్వ చేస్తాయి, ఇది సూక్ష్మ వివరాలను సమర్థవంతంగా రెండర్ చేయడానికి అనుమతిస్తుంది. RGB రంగుతో పాటు డెప్త్ను అందించడం ద్వారా, Atlas కొన్ని స్మార్ట్ఫోన్ షాట్లను ఏ కోణం నుండినైనా పరిశీలించగలిగే డిజిటల్ ట్విన్గా మారుస్తుంది.
రోబోల కోసం Real-to-sim
రోబోటిక్స్ డెవలపర్లు నిజ ప్రపంచ డేటా మరియు సిమ్యులేటెడ్ శిక్షణ వాతావరణాల మధ్య ఉన్న వ్యత్యాసంతో చాలా కాలంగా పోరాడుతున్నారు. పునర్నిర్మించిన గదిలో రోబోట్ చూసే ఖచ్చితమైన సెన్సార్ ఫీడ్ను జనరేట్ చేయడం ద్వారా Atlas ఆ అంతరాన్ని తగ్గించగలదని వాదిస్తోంది. డెవలపర్లు ఆ తర్వాత డిజిటల్ ట్విన్లో వస్తువులు, లైటింగ్ లేదా బ్యాక్గ్రౌండ్లను మార్చవచ్చు, తద్వారా ఒకే నిజ ప్రపంచ క్యాప్చర్ నుండి వేలకొద్దీ వేర్వేరు సినారియోలను సృష్టించవచ్చు. సీన్ సింథసిస్పై దృష్టి సారించిన ఒక స్టార్టప్ నుండి సేకరించిన సాంకేతికతను ఉపయోగించి World Labs ఈ వర్క్ఫ్లోను ప్రదర్శించింది; ఈ పైప్లైన్ మానవ జోక్యం లేకుండా ఐదు వేర్వేరు రోబోట్ ప్లాట్ఫారమ్లను ఒక గంట పాటు స్వయంప్రతిపత్తితో (autonomously) నడపడానికి సరిపడా వైవిధ్యాలను ఉత్పత్తి చేసింది.
బెంచ్మార్క్లు మరియు పనితీరు క్లెయిమ్లు
ముఖాముఖి పరీక్షలలో (head-to-head tests), పేర్వైస్ పోలికలలో (pairwise comparisons) 94% సందర్భాల్లో మానవ మూల్యాంకనదారులు ప్రముఖ పోటీదారు కంటే Atlas యొక్క కెమెరా-గైడెడ్ వీడియోలనే ఇష్టపడ్డారు, మరియు మరో ప్రధాన మోడల్ కంటే 81% సందర్భాల్లో వీటినే ఎంచుకున్నారు. పునర్నిర్మాణం (reconstruction) కోసం, Atlas 25.3 యొక్క మీడియన్ ఎర్రర్ను సాధించింది, ఇది ఎక్కువ ఎర్రర్ స్కోర్లను రిపోర్ట్ చేసిన ప్రత్యర్థుల కంటే మెరుగైనది. ఈ మోడల్ మధ్యంతర గణనలను (intermediate calculations) తిరిగి ఉపయోగించడానికి కీ-వాల్యూ (KV) క్యాషింగ్ను ఉపయోగించే లార్జ్ లాంగ్వేజ్ మోడల్స్ యొక్క వేగవంతమైన ప్రయోజనాలను, మరియు చిత్రాలను పునరావృతం చేస్తూ మెరుగుపరిచే డిఫ్యూజన్ మోడల్స్ యొక్క అధిక నాణ్యత కలిగిన అవుట్పుట్ను అనుసంధానిస్తుంది.
సంభావ్య లోపాలు మరియు పెండింగ్ ప్రశ్నలు
World Labs ప్రకటనలు ఆకట్టుకునే డెమోలతో మద్దతు పొందుతున్నప్పటికీ, ఈ సాంకేతికత ఇంకా ప్రారంభ దశలోనే ఉంది. హై-రిజల్యూషన్లో టెక్స్ట్, ఇమేజెస్, వీడియో మరియు 3-D డేటాను హ్యాండిల్ చేసే మోడల్కు శిక్షణ ఇవ్వడం మరియు నడపడం కోసం గణనీయమైన కంప్యూట్ పవర్ అవసరం, మరియు కంపెనీ హార్డ్వేర్ స్పెసిఫికేషన్లు లేదా ఇన్ఫరెన్స్ ఖర్చులను వెల్లడించలేదు. ఈ బెంచ్మార్క్లు మానవ ప్రాధాన్యత మరియు మీడియన్ ఎర్రర్ మెట్రిక్లపై ఆధారపడి ఉన్నాయి; కేవలం నిజమైన డేటాతో పోల్చినప్పుడు రోబోట్ మానిప్యులేషన్ సక్సెస్ రేట్లు వంటి డౌన్స్ట్రీమ్ టాస్క్లలో Atlas ఎలా పనిచేస్తుందో ఇవి ఇంకా చూపించలేదు. మోడల్ కొన్ని చిత్రాల నుండి నమ్మదగిన జ్యామితిని సృష్టించగలదు అయినప్పటికీ, ఖచ్చితమైన కొలతలు అవసరమైనప్పుడు ఇది లిడార్ (lidar) స్కాన్లు లేదా స్ట్రక్చర్డ్-లైట్ క్యాప్చర్ల నాణ్యతను భర్తీ చేయలేదని విమర్శకులు పేర్కొనవచ్చు.
తదుపరి ఏం గమనించాలి
- రోబోటిక్స్ ప్లాట్ఫారమ్ల ద్వారా స్వీకరణ – రోబోట్ బృందాలు Atlas ద్వారా సృష్టించబడిన ప్రపంచాలను తమ శిక్షణ ప్రక్రియలలో (training loops) అనుసంధానించి, కొలవదగిన ప్రయోజనాలను నివేదిస్తే, తక్కువ ఖర్చుతో కూడిన, మరింత వైవిధ్యమైన సిమ్యులేషన్ అనే వాదనకు విశ్వసనీయత లభిస్తుంది.
- కంటెంట్ సృష్టి పైప్లైన్లు – వేగవంతమైన ప్రోటోటైపింగ్ కోసం Atlasతో ప్రయోగాలు చేస్తున్న స్టూడియోలు మరియు గేమ్ డెవలపర్లు, ఈ మోడల్ యొక్క నేటివ్ 3-D అవుట్పుట్ ప్రస్తుతం ఉన్న అసెట్ పైప్లైన్లకు సరిపోతుందో లేదో తెలియజేయవచ్చు.
- ఓపెన్-సోర్స్ లేదా థర్డ్-పార్టీ మూల్యాంకనాలు – బెంచ్మార్క్ నంబర్లను తిరిగి సాధించే స్వతంత్ర పరిశోధకులు, ప్రస్తుత ప్రమాణాల కంటే ఈ మోడల్ కలిగి ఉన్న ఆధిక్యతను ధృవీకరించడానికి సహాయపడతారు.
- హార్డ్వేర్ మరియు ఖర్చు వివరాలు – ఇన్ఫరెన్స్ (inference) కోసం అవసరమయ్యే కంప్యూట్ బడ్జెట్ను అర్థం చేసుకోవడం ద్వారా, Atlas ఎడ్జ్ పరికరాలపై (edge devices) నడుస్తుందా లేదా క్లౌడ్-ఓన్లీ సర్వీస్గా మాత్రమే ఉంటుందా అనేది నిర్ణయించబడుతుంది.
సారాంశం
AI టోకెన్లను భౌతిక అంతరాళంలో (physical space) స్థిరపరచడం ద్వారా, అతి తక్కువ విజువల్ ఇన్పుట్ నుండి ఒకే మోడల్ మొత్తం వాతావరణాన్ని సృష్టించడానికి, పునర్నిర్మించడానికి మరియు సిమ్యులేట్ చేయడానికి వీలవుతుందని Atlas చూపుతోంది. వాగ్దానం చేయబడిన పనితీరు, విపరీతమైన కంప్యూట్ ఖర్చులు లేకుండా వాస్తవ ప్రపంచ వినియోగానికి అనుగుణంగా విస్తరించగలిగితే, రోబోలు ఎలా నేర్చుకుంటాయి మరియు ఇమ్మర్సివ్ కంటెంట్ ఎలా నిర్మించబడుతుంది అనే అంశాలను ఈ మోడల్ కొత్త రూపంలోకి మారుస్తుంది, తద్వారా కొన్ని ఫోటోలను పూర్తి ఇంటరాక్టివ్ డిజిటల్ ప్రపంచంగా మారుస్తుంది.
