מודל העולם Orca הסיני משתווה לרובוטיקה ייעודית ללא תוויות פעולה

פריצת דרך של חוקרים בסין מאתגרת את ההגדרה הבסיסית של בינה מלאכותית על ידי הוכחה לכך שמודל עולם מאוחד יכול לשלוט ברובוטיקה ללא פיקוח ישיר. מודל Orca מדגים כי באמצעות צפייה פשוטה באופן שבו העולם משתנה דרך וידאו, בינה מלאכותית יכולה לפתח הבנה פנימית עמוקה המסוגלת להניע פעולות פיזיות מורכבות.

מנוע הלמידה הכפול: מצבים לא מודעים ומודעים

Orca נבדל מהמודלים הייעודיים המסורתיים על ידי שימוש בגישת אימון דו-מסלול לבניית "מצב העולם" הפנימי שלו. השיטה הראשונה, "למידה לא מודעת", כוללת עיבוד של 125,000 שעות של וידאו ללא תוויות. במהלך שלב זה, המודל חוזה פריימים עתידיים במרחב מופשט, מה שמאפשר לו לתפוס דפוסי תנועה, הסתרת אובייקטים ודינמיקה של סצנות ללא צורך בכיתוב (caption) אחד.

השיטה השנייה, "למידה מודעת", מציגה הוראות ותיאורים מילוליים. על ידי חלוקת סרטוני וידאו ותיוג שינויי המצב הנובעים מהם, Orca לומד את הקשר הסיבתי בין פעולה ספציפית לבין התוצאה הפיזית שלה. שילוב זה מאפשר למודל לגשר על הפער בין תפיסה חזותית גולמית לבין הסקה לשונית ברמה גבוהה.

ליבה קפואה עם מודולי אינטליגנציה ניתנים להחלפה

הארכיטקטורה של Orca תוכננה לוורסטיליות קיצונית. היא משתמשת במודל השפה-תמונה המאומן מראש Qwen3.5 כ"ליבה קפואה". במקום לאמן מחדש את המערכת כולה עבור כל משימה, החוקרים מחברים "ראשים" (heads) ייעודיים וקלים לבסיס יציב זה:

  • פלט טקסט: משתמש בראש השפה הקיים של Qwen3.5.
  • יצירת תמונות: משתמש במתאמים (adapters) קטנים המחוברים ל-Stable Diffusion 3.5 כדי לתרגם את מצב העולם הפנימי לתחזיות חזותיות.
  • בקרת רובוטים: משתמש במודול "Action Expert" שנבנה במיוחד ואומן ספציפית להמרת מצבי עולם לתנועות פיזיות.

מודולריות זו מבטיחה שההבנה המרכזית של העולם תישאר עקבית, בין אם המודל עונה על שאלה, יוצר וידאו או שולט בזרוע מכנית.

עוקף מודלים ייעודיים וענקים

מדדי הביצועים של Orca-4B הם משמעותיים. במבחני ביצועים (benchmarks) של וידאו מבוסס טקסט, Orca-4B השיג ממוצע של 51.8 אחוזים, תוך שהוא עוקף מודלים גדולים בהרבה כמו Emu3 (34B) ומודלי VLM ייעודיים כמו DeepSeek-VL2-3B. במשימות חיזוי תמונה באמצעות מבחן PRICE-V0.1, Orca-4B קיבל ציון של 59.8 אחוזים, ועקף מחוללי תמונות מתקדמים כמו FLUX.2 small.

המרשים מכולם הוא ש-Orca מציג שוויון בביצועים מול $\pi$0.5 — מערכת שנבנתה אך ורק על נתוני פעולה רובוטית — בחמש משימות מניפולציה, כג as ערימת קערות ואיסוף סוכר. באופן מכריע, Orca השיג זאת מבלי שראה מעולם תווית פעולה במהלך שלב האימון המוקדם (pre-training) המסיבי שלו. הוא אף הראה יכולת התאוששות משגיאות עדיפה, תוך ניסיון חוזר באחיזות שנכשלו, בעוד שמודלים ייעודיים נתקעים לעיתים קרובות בלולאות חוזרות.

למה זה חשוב לעתיד הבינה המלאכותית

Orca פותר את אחד צווארי הבקבוק המשמעותיים ביותר ברובוטיקה המודרנית: המחסור הכרוני בנתוני פעולה מתויגים. על ידי הוכחה שבינה מלאכותית יכולה ללמוד את "הפיזיקה של העולם" באמצעות תצפית פסיבית, המחקר סולל את הדרך לרובוטים רב-תכליתיים שניתן לפרוס בסביבות חדשות ללא צורך במיליוני שעות של נתוני טל-אופרציה (teleoperation) מתויגים ידנית.

נקודות מפתח

  • תשתית ללא פיקוח: Orca לומד את הדינמיקה של העולם באמצעות "למידה לא מודעת" של וידאו ללא תוויות, מה שמפחית את התלות במאגרי נתונים יקרים המתויגים על ידי בני אדם.
  • ארכיטקטורה מודולרית: השימוש בליבת Qwen3.5 קפואה עם מתאמים ניתנים להחלפה מאפשר למודל אחד להצטיין בטקסט, בתמונה ובבקרת רובוטים בו-זמנית.
  • שוויון רובוטי: Orca-4B משתווה לביצועים של מערכות רובוטיקה ייעודיות במשימות מניפולציה, למרות שלא נחשף מראש לתוויות פעולה במהלך האימון המוקדם.