অ্যাকশন লেবেল ছাড়াই চীনের Orca ওয়ার্ল্ড মডেল বিশেষায়িত রোবোটিক্সের সমতুল্য
চীনের গবেষকদের একটি যুগান্তকারী আবিষ্কার এআই (AI) বুদ্ধিমত্তার মৌলিক সংজ্ঞাকে চ্যালেঞ্জ জানাচ্ছে। তারা প্রমাণ করেছেন যে, একটি সমন্বিত ওয়ার্ল্ড মডেল সরাসরি তত্ত্বাবধান ছাড়াই রোবোটিক্স আয়ত্ত করতে পারে। Orca মডেলটি দেখিয়ে দিয়েছে যে, কেবল ভিডিওর মাধ্যমে পৃথিবী কীভাবে পরিবর্তিত হয় তা পর্যবেক্ষণের মাধ্যমে একটি এআই গভীর অভ্যন্তরীণ ধারণা তৈরি করতে পারে, যা জটিল শারীরিক কাজ পরিচালনা করতে সক্ষম।
ডুয়াল-লার্নিং ইঞ্জিন: অবচেতন এবং সচেতন মোড
Orca তার অভ্যন্তরীণ "world state" বা বিশ্বের অবস্থা তৈরি করতে একটি দ্বিমুখী প্রশিক্ষণ পদ্ধতি ব্যবহার করে, যা একে প্রথাগত বিশেষায়িত মডেলগুলো থেকে আলাদা করে। প্রথম পদ্ধতিটি হলো "unconscious learning" বা অবচেতন শিক্ষা, যেখানে ১,২৫,০০০ ঘণ্টার আনলেবেলড (unlabeled) ভিডিও প্রসেস করা হয়। এই পর্যায়ে, মডেলটি একটি বিমূর্ত স্পেসে ভবিষ্যতের ফ্রেমগুলো অনুমান করে, যা কোনো ক্যাপশন ছাড়াই গতির ধরন, বস্তুর আড়াল হওয়া (occlusions) এবং দৃশ্যের গতিশীলতা বুঝতে সাহায্য করে।
দ্বিতীয় পদ্ধতিটি হলো "conscious learning" বা সচেতন শিক্ষা, যেখানে মৌখিক নির্দেশাবলী এবং বর্ণনা অন্তর্ভুক্ত করা হয়। ভিডিওগুলোকে বিভিন্ন অংশে ভাগ করে এবং এর ফলে অবস্থার পরিবর্তনগুলোকে লেবেল করার মাধ্যমে, Orca একটি নির্দিষ্ট কাজ এবং তার শারীরিক ফলাফলের মধ্যে কার্যকারণ সম্পর্ক (causal relationship) শিখতে পারে। এই সমন্বয় মডেলটিকে কাঁচা ভিজ্যুয়াল পারসেপশন এবং উচ্চ-স্তরের ভাষাগত যুক্তির মধ্যে ব্যবধান ঘুচিয়ে দিতে সাহায্য করে।
পরিবর্তনযোগ্য ইন্টেলিজেন্স মডিউলসহ একটি ফ্রোজেন কোর (Frozen Core)
Orca-এর আর্কিটেকচার অত্যন্ত বহুমুখী কাজের জন্য ডিজাইন করা হয়েছে। এটি প্রাক-প্রশিক্ষিত Qwen3.5 ল্যাঙ্গুয়েজ-ইমেজ মডেলকে একটি "frozen core" হিসেবে ব্যবহার করে। প্রতিটি কাজের জন্য পুরো সিস্টেমটি পুনরায় প্রশিক্ষণ দেওয়ার পরিবর্তে, গবেষকরা এই স্থিতিশীল ভিত্তির সাথে বিশেষায়িত, হালকা ওজনের "heads" যুক্ত করেন:
- Text Output: বিদ্যমান Qwen3.5 ল্যাঙ্গুয়েজ হেড ব্যবহার করে।
- Image Generation: অভ্যন্তরীণ ওয়ার্ল্ড স্টেটকে ভিজ্যুয়াল প্রেডিকশনে রূপান্তর করতে Stable Diffusion 3.5-এর সাথে সংযুক্ত ছোট অ্যাডাপ্টার ব্যবহার করে।
- Robot Control: ওয়ার্ল্ড স্টেটকে শারীরিক নড়াচড়ায় রূপান্তর করার জন্য বিশেষভাবে প্রশিক্ষিত একটি কাস্টম-বিল্ট "Action Expert" মডিউল ব্যবহার করে।
এই মডুলারিটি নিশ্চিত করে যে, মডেলটি কোনো প্রশ্নের উত্তর দিচ্ছে, ভিডিও তৈরি করছে বা একটি যান্ত্রিক হাত নিয়ন্ত্রণ করছে—বিশ্ব সম্পর্কে এর কেন্দ্রীয় ধারণাটি সব সময় সামঞ্জস্যপূর্ণ থাকে।
বিশেষায়িত মডেল এবং জায়ান্টদের ছাড়িয়ে যাওয়া
Orca-4B-এর পারফরম্যান্স মেট্রিক্স অত্যন্ত তাৎপর্যপূর্ণ। টেক্সট-ভিত্তিক ভিডিও বেঞ্চমার্কে, Orca-4B গড়ে ৫১.৮ শতাংশ অর্জন করেছে, যা Emu3 (34B)-এর মতো অনেক বড় মডেল এবং DeepSeek-VL2-3B-এর মতো বিশেষায়িত VLM-দের ছাড়িয়ে গেছে। PRICE-V0.1 বেঞ্চমার্কের মাধ্যমে ইমেজ প্রেডিকশন টাস্কে Orca-4B ৫৯.৮ শতাংশ স্কোর করেছে, যা FLUX.2 small-এর মতো উচ্চমানের জেনারেটরকেও ছাড়িয়ে গেছে।
সবচেয়ে চিত্তাকর্ষক বিষয় হলো, Orca পাঁচটি ম্যানিপুলেশন টাস্ক (যেমন বাটি স্তূপ করা এবং চিনি তোলা) জুড়ে $\pi$0.5-এর সমতুল্য পারফরম্যান্স দেখিয়েছে—যা মূলত শুধুমাত্র রোবোটিক অ্যাকশন ডেটার ওপর ভিত্তি করে তৈরি একটি সিস্টেম। সবচেয়ে গুরুত্বপূর্ণ বিষয় হলো, Orca তার বিশাল প্রাক-প্রশিক্ষণ (pre-training) পর্যায়ে কোনো অ্যাকশন লেবেল না দেখেই এটি অর্জন করেছে। এমনকি এটি উন্নত এরর রিকভারি (error recovery) ক্ষমতা দেখিয়েছে; যেখানে বিশেষায়িত মডেলগুলো প্রায়ই পুনরাবৃত্তিমূলক লুপে আটকে যায়, সেখানে Orca ব্যর্থ হওয়া গ্রাসপগুলো (grasps) পুনরায় চেষ্টা করে।
কেন এটি এআই-এর ভবিষ্যতের জন্য গুরুত্বপূর্ণ
Orca আধুনিক রোবোটিক্সের অন্যতম প্রধান বাধা সমাধান করে: লেবেলযুক্ত অ্যাকশন ডেটার দীর্ঘস্থায়ী অভাব। এআই যে প্যাসিভ পর্যবেক্ষণের মাধ্যমে "বিশ্বের পদার্থবিদ্যা" (physics of the world) শিখতে পারে তা প্রমাণ করার মাধ্যমে, এই গবেষণাটি বহুমুখী বা জেনারেল-পারপাস রোবটের পথ প্রশস্ত করেছে। এই রোবটগুলোকে লক্ষ লক্ষ ঘণ্টার ম্যানুয়াল বা হাতে লেবেল করা টেলিঅপারেশন ডেটা ছাড়াই নতুন পরিবেশে মোতায়েন করা সম্ভব হবে।
মূল বিষয়সমূহ
- Unsupervised Foundation: Orca আনলেবেলড ভিডিওর "unconscious learning"-এর মাধ্যমে বিশ্বের গতিশীলতা শেখে, যা ব্যয়বহুল মানুষের দ্বারা অ্যানোটেটেড ডেটাসেটের ওপর নির্ভরতা কমায়।
- Modular Architecture: একটি ফ্রোজেন Qwen3.5 কোর এবং পরিবর্তনযোগ্য অ্যাডাপ্টার ব্যবহারের ফলে একটি মডেল একই সাথে টেক্সট, ইমেজ এবং রোবোটিক কন্ট্রোলে পারদর্শী হতে পারে।
- Robotic Parity: প্রাক-প্রশিক্ষণের সময় কোনো অ্যাকশন লেবেলের সংস্পর্শে না আসা সত্ত্বেও, Orca-4B ম্যানিপুলেশন টাস্কগুলোতে বিশেষায়িত রোবোটিক্স সিস্টেমের পারফরম্যান্সের সমতুল্য ফলাফল দেখিয়েছে।