એક્શન લેબલ્સ વગર ચીનનું Orca વર્લ્ડ મોડેલ સ્પેશિયલાઇઝ્ડ રોબોટિક્સને ટક્કર આપે છે

ચીનના સંશોધકો દ્વારા કરવામાં આવેલી એક મોટી સફળતા AI બુદ્ધિની મૂળભૂત વ્યાખ્યાને પડકાર આપી રહી છે, કારણ કે તે સાબિત કરે છે કે એક સંયુક્ત વર્લ્ડ મોડેલ સીધા સુપરવિઝન વગર રોબોટિક્સમાં નિપુણતા મેળવી શકે છે. Orca મોડેલ દર્શાવે છે કે માત્ર વિડિયો દ્વારા દુનિયા કેવી રીતે બદલાય છે તેનું અવલોકન કરીને, એક AI જટિલ ભૌતિક ક્રિયાઓ કરવા માટે સક્ષમ ઊંડું આંતરિક વિશ્લેષણ વિકસાવી શકે છે.

ડ્યુઅલ-લર્નિંગ એન્જિન: અનકોન્શિયસ અને કોન્શિયસ મોડ્સ

Orca તેના આંતરિક "world state" બનાવવા માટે બેવડા તાલીમ અભિગમનો ઉપયોગ કરીને પરંપરાગત સ્પેશિયલાઇઝ્ડ મોડેલ્સથી અલગ પડે છે. પ્રથમ પદ્ધતિ, "unconscious learning" (અચેતન શિક્ષણ), જેમાં 1,25,000 કલાકના અનલેબલ કરેલા વિડિયોનું પ્રોસેસિંગ સામેલ છે. આ તબક્કા દરમિયાન, મોડેલ એબ્સ્ટ્રેક્ટ સ્પેસમાં ભવિષ્યના ફ્રેમ્સનું અનુમાન લગાવે છે, જે તેને કોઈપણ કેપ્શનની જરૂરિયાત વિના ગતિની પેટર્ન, વસ્તુઓનું અવરોધન (occlusions) અને દ્રશ્યની ગતિશીલતા સમજવામાં મદદ કરે છે.

બીજી પદ્ધતિ, "conscious learning" (ચેતન શિક્ષણ), મૌખિક સૂચનાઓ અને વર્ણનો રજૂ કરે છે. વિડિયોને વિભાજિત કરીને અને તેના પરિણામે થતા સ્ટેટ ફેરફારોને લેબલ કરીને, Orca ચોક્કસ ક્રિયા અને તેના ભૌતિક પરિણામ વચ્ચેનો કારણભૂત સંબંધ (causal relationship) શીખે છે. આ સંયોજન મોડેલને કાચા વિઝ્યુઅલ પર્સેપ્શન અને ઉચ્ચ-સ્તરના ભાષાકીય તર્ક વચ્ચેના અંતરને ઘટાડવામાં મદદ કરે છે.

સ્વેપેબલ ઇન્ટેલિજન્સ મોડ્યુલ્સ સાથેનું ફ્રોઝન કોર

Orca ની આર્કિટેક્ચર અત્યંત બહુમુખી ઉપયોગ માટે ડિઝાઇન કરવામાં આવી છે. તે પ્રી-ટ્રેઇન્ડ Qwen3.5 લેંગ્વેજ-ઇમેજ મોડેલનો ઉપયોગ "frozen core" તરીકે કરે છે. દરેક કાર્ય માટે સમગ્ર સિસ્ટમને ફરીથી તાલીમ આપવાને બદલે, સંશોધકો આ સ્થિર પાયા સાથે સ્પેશિયલાઇઝ્ડ, હળવા "heads" જોડે છે:

  • Text Output: હાલના Qwen3.5 લેંગ્વેજ હેડનો ઉપયોગ કરે છે.
  • Image Generation: આંતરિક વર્લ્ડ સ્ટેટને વિઝ્યુઅલ અનુમાનમાં રૂપાંતરિત કરવા માટે Stable Diffusion 3.5 સાથે જોડાયેલા નાના એડેપ્ટર્સનો ઉપયોગ કરે છે.
  • Robot Control: વર્લ્ડ સ્ટેટ્સને ભૌતિક હલનચલનમાં રૂપાંતરિત કરવા માટે ખાસ તાલીમ પામેલા કસ્ટમ-બિલ્ટ "Action Expert" મોડ્યુલનો ઉપયોગ કરે છે.

આ મોડ્યુલારિટી સુનિશ્ચિત કરે છે કે દુનિયાની કેન્દ્રીય સમજ સુસંગત રહે, પછી ભલે મોડેલ પ્રશ્નનો જવાબ આપી રહ્યું હોય, વિડિયો બનાવી રહ્યું હોય અથવા મિકેનિકલ આર્મને નિયંત્રિત કરી રહ્યું હોય.

સ્પેશિયલાઇઝ્ડ મોડેલ્સ અને દિગ્ગજો કરતા શ્રેષ્ઠ પ્રદર્શન

Orca-4B માટેના પર્ફોર્મન્સ મેટ્રિક્સ નોંધપાત્ર છે. ટેક્સ્ટ-આધારિત વિડિયો બેન્ચમાર્ક પર, Orca-4B એ સરેરાશ 51.8 ટકા હાંસલ કર્યા છે, જે Emu3 (34B) જેવા ઘણા મોટા મોડેલ્સ અને DeepSeek-VL2-3B જેવા સ્પેશિયલાઇઝ્ડ VLMs કરતા વધુ સારું પ્રદર્શન કરે છે. PRICE-V0.1 બેન્ચમાર્ક દ્વારા ઇમેજ પ્રિડિક્શન કાર્યોમાં, Orca-4B એ 59.8 ટકા સ્કોર કર્યો છે, જે FLUX.2 small જેવા હાઇ-એન્ડ જનરેટર્સ કરતા પણ આગળ છે.

સૌથી આશ્ચર્યજનક રીતે, Orca પાંચ મેનિપ્યુલેશન કાર્યોમાં (જેમ કે વાટકા ગોઠવવા અને ખાંડ કાઢવી) $\pi$0.5—જે ફક્ત રોબોટિક એક્શન ડેટા પર બનેલી સિસ્ટમ છે—ની સાથે સમાનતા દર્શાવે છે. મહત્વની વાત એ છે કે, Orca એ તેના વિશાળ પ્રી-ટ્રેનિંગ તબક્કા દરમિયાન ક્યારેય એક્શન લેબલ જોયા વગર આ સિદ્ધિ મેળવી છે. તેણે શ્રેષ્ઠ એરર રિકવરી પણ દર્શાવી છે, જ્યાં સ્પેશિયલાઇઝ્ડ મોડેલ્સ વારંવાર એક જ લૂપમાં ફસાઈ જાય છે, ત્યાં Orca નિષ્ફળ ગયેલા પકડવાના પ્રયાસોને ફરીથી અજમાવે છે.

AI ના ભવિષ્ય માટે આ શા માટે મહત્વનું છે

Orca આધુનિક રોબોટિક્સની સૌથી મોટી અવરોધક સમસ્યાઓમાંથી એકનું સમાધાન કરે છે: લેબલ કરેલા એક્શન ડેટાની સતત અછત. AI નિષ્ક્રિય અવલોકન દ્વારા "દુનિયાના ભૌતિક વિજ્ઞાન" (physics of the world) ને શીખી શકે છે તે સાબિત કરીને, આ સંશોધન જનરલ-પર્પઝ રોબોટ્સ માટે માર્ગ મોકળો કરે છે, જેને લાખો કલાકના મેન્યુઅલ, હેન્ડ-લેબલ કરેલા ટેલિઓપરેશન ડેટાની જરૂરિયાત વિના નવા વાતાવરણમાં તૈનાત કરી શકાય છે.

મુખ્ય મુદ્દાઓ

  • Unsupervised Foundation: Orca અનલેબલ કરેલા વિડિયોના "unconscious learning" દ્વારા વર્લ્ડ ડાયનેમિક્સ શીખે છે, જે ખર્ચાળ માનવ-એનોટેટેડ ડેટાસેટ્સ પરની નિર્ભરતા ઘટાડે છે.
  • Modular Architecture: સ્વેપેબલ એડેપ્ટર્સ સાથેના ફ્રોઝન Qwen3.5 કોરનો ઉપયોગ એક જ મોડેલને ટેક્સ્ટ, ઇમેજ અને રોબોટિક કંટ્રોલ બંનેમાં એકસાથે શ્રેષ્ઠ બનવાની મંજૂરી આપે છે.
  • Robotic Parity: પ્રી-ટ્રેનિંગ દરમિયાન એક્શન લેબલ્સનો કોઈ અગાઉનો અનુભવ ન હોવા છતાં, Orca-4B મેનિપ્યુલેશન કાર્યોમાં સ્પેશિયલાઇઝ્ડ રોબોટિક્સ સિસ્ટમ્સના પ્રદર્શન સાથે મેળ ખવડાવે છે.