مدل دنیای Orca چین، بدون برچسبهای عملیاتی با رباتیک تخصصی برابری میکند
یک پیشرفت بزرگ توسط محققان چینی، با اثبات اینکه یک مدل دنیای واحد میتواند بدون نظارت مستقیم بر رباتیک تسلط یابد، تعریف بنیادی هوش مصنوعی را به چالش میکشد. مدل Orca نشان میدهد که یک هوش مصنوعی تنها با مشاهده چگونگی تغییر جهان از طریق ویدیو، میتواند درک درونی عمیقی ایجاد کند که قادر به هدایت اقدامات فیزیکی پیچیده باشد.
موتور یادگیری دوگانه: حالتهای ناخودآگاه و خودآگاه
Orca با استفاده از یک رویکرد آموزشی دو جانبه برای ساخت «وضعیت دنیای» داخلی خود، از مدلهای تخصصی سنتی فاصله میگیرد. روش اول، «یادگیری ناخودآگاه»، شامل پردازش ۱۲۵,۰۰۰ ساعت ویدیو بدون برچسب است. در این مرحله، مدل فریمهای آینده را در یک فضای انتزاعی پیشبینی میکند که به آن اجازه میدهد الگوهای حرکتی، انسداد اشیاء و پویایی صحنه را بدون نیاز به حتی یک زیرنویس درک کند.
روش دوم، «یادگیری خودآگاه»، دستورالعملها و توضیحات کلامی را معرفی میکند. Orca با بخشبندی ویدیوها و برچسبگذاری تغییرات وضعیت حاصل، رابطه علی و معلولی بین یک اقدام خاص و نتیجه فیزیکی آن را میآموزد. این ترکیب به مدل اجازه میدهد تا شکاف بین ادراک بصری خام و استدلال زبانی سطح بالا را پر کند.
یک هسته منجمد با ماژولهای هوش قابل تعویض
معماری Orca برای تطبیقپذیری بسیار بالا طراحی شده است. این مدل از مدل زبانی-تصویری پیشآموزشدیده Qwen3.5 به عنوان یک «هسته منجمد» استفاده میکند. محققان به جای بازآموزی کل سیستم برای هر وظیفه، «سر»های (heads) سبکوزن و تخصصی را به این پایه پایدار متصل میکنند:
- خروجی متن: از سر زبانی موجود Qwen3.5 استفاده میکند.
- تولید تصویر: از آداپتورهای کوچکی متصل به Stable Diffusion 3.5 برای تبدیل وضعیت دنیای داخلی به پیشبینیهای بصری استفاده میکند.
- کنترل ربات: از یک ماژول اختصاصی ساخته شده به نام "Action Expert" استفاده میکند که بهطور ویژه برای تبدیل وضعیتهای جهان به حرکات فیزیکی آموزش دیده است.
این ماژولار بودن تضمین میکند که درک مرکزی از جهان ثابت باقی بماند، خواه مدل در حال پاسخ دادن به یک سوال باشد، خواه در حال تولید ویدیو یا کنترل یک بازوی مکانیکی.
عملکرد بهتر نسبت به مدلهای تخصصی و غولها
معیارهای عملکرد Orca-4B قابل توجه است. در بنچمارکهای ویدیویی مبتنی بر متن، Orca-4B به میانگین ۵۱.۸ درصد دست یافت که از مدلهای بسیار بزرگتری مانند Emu3 (34B) و مدلهای VLM تخصصی مانند DeepSeek-VL2-3B پیشی گرفته است. در وظایف پیشبینی تصویر از طریق بنچمارک PRICE-V0.1، مدل Orca-4B امتیاز ۵۹.۸ درصد را کسب کرد و از مولدهای سطح بالایی مانند FLUX.2 small فراتر رفت.
از همه چشمگیرتر اینکه Orca در پنج وظیفه دستورزی (manipulation)، مانند چیدن کاسهها و قاشق زدن شکر، با $\pi$0.5 — سیستمی که منحصراً بر اساس دادههای عملیاتی رباتیک ساخته شده است — برابری میکند. نکته حیاتی این است که Orca بدون دیدن حتی یک برچسب عملیاتی در طول مرحله پیشآموزش عظیم خود، به این موفقیت دست یافت. این مدل حتی بازیابی خطای برتری را نشان داد و در مواردی که مدلهای تخصصی اغلب در حلقههای تکراری گیر میکردند، تلاشهای ناموفق برای گرفتن اشیاء را دوباره امتحان میکرد.
چرا این موضوع برای آینده هوش مصنوعی اهمیت دارد
Orca یکی از مهمترین گلوگاههای رباتیک مدرن را حل میکند: کمبود مزمن دادههای عملیاتی برچسبگذاری شده. این تحقیق با اثبات اینکه یک هوش مصنوعی میتواند «فیزیک جهان» را از طریق مشاهده غیرفعال بیاموزد، راه را برای رباتهای همهمنظوره هموار میکند که میتوانند بدون نیاز به میلیونها ساعت دادههای عملیاتی دستی و برچسبگذاری شده، در محیطهای جدید مستقر شوند.
نکات کلیدی
- پایه بدون نظارت: Orca پویاییهای جهان را از طریق «یادگیری ناخودآگاه» ویدیوهای بدون برچسب میآموزد و وابستگی به مجموعهدادههای گرانقیمت با حاشیهنویسی انسانی را کاهش میدهد.
- معماری ماژولار: استفاده از هسته منجمد Qwen3.5 با آداپتورهای قابل تعویض به یک مدل اجازه میدهد تا بهطور همزمان در متن، تصویر و کنترل رباتیک برتری داشته باشد.
- برابری رباتیک: Orca-4B با وجود عدم مواجهه قبلی با برچسبهای عملیاتی در طول پیشآموزش، عملکرد سیستمهای رباتیک تخصصی را در وظایف دستورزی برابری میکند.