מודל Fable 5 של Anthropic כבש את התג הראשון ב-1,785 תורות, תוך הוצאה של $65.40, בזמן ששיחק בגרסה בסינית של Pokémon FireRed תוך שימוש בפלט הוויזואלי של המשחק בלבד. ההרצה מוכיחה שהמודל יכול לסיים מקטע מזוהה של המשחק ללא הנחיות טקסטואליות כלל, אך צלילה עמוקה לשרשרת המחשבה (thinking chain) של המודל מראה שהוא רק דקלם ידע משוחק שנלמד בעל פה, במקום באמת "לראות" ולהסיק מסקנות מכל פיקסל.
הטענה של Anthropic תחת בדיקה
כש-Anthropic שחררה את Fable 5, החברה הדגישה דמו של "ראייה בלבד" (vision-only), שבו המודל ניווט ב-Pokémon FireRed על ידי הסתכלות על המסך בלבד. הכותרת גרמה לזה להישמע כאילו המערכת יכולה לפרש כל סביבה ויזואלית מאפס. מפתח יצא לבדוק את הטענה הזו על ידי שחזור ההגדרה המתוארת בדף ההשקה של Anthropic והרצת המודל על תרגום סיני של המשחק.
כיצד נערך הניסוי
מערכת בקרה (harness) מותאמת אישית הזינה למודל פריימים גולמיים של וידאו וקלטה את בחירות הפעולה שלו. המערכת תאמה את התיאור של Anthropic, העבירה כל פריים חדש למודל וקראה בחזרה את הקלט שנבחר בבקר. הבדיקה הריצה את לולאת המשחק המלאה עד שהמודל זכה לתג המכון (gym badge) הראשון שלו, ואז המשיכה עד לתור ה-2,000, אז האווטאר הגיע ל-Route 3.
התוצאה הכמותית הייתה ברורה:
- התג הראשון הושג לאחר 1,785 תורות
- עלות מחשוב כוללת $65.40
- עד לתור ה-2,000 האווטאר היה ב-Route 3
מה הלוגים חושפים
הלוגים הגולמיים, לעומת זאת, מספרים סיפור אחר לגבי איך המודל הגיע לשם. "שרשרת המחשבה" הפנימית של המודל רשמה שוב ושוב מידע שטרם הופיע על המסך.
- בתור 78 המודל ציין שהיריב יבחר ב-Charmander, למרות שהמשחק טרם הציג את בחירת היריב.
- 141 תורות מאוחר יותר, כשהמשחק סוף סוף מסר לשחקן את Oak’s Parcel, המודל כבר תיעד את שם הפריט בהערות שלו.
- תוך כדי מעבר ב-Route 3, המודל זיהה מאמן ספציפי על ידי ציטוט שורת דיאלוג מפורסמת שמעולם לא הופיעה בזרם הוויזואלי.
הרישומים הללו אינם תוצר של ניתוח פיקסל-אחר-פיקסל. הם סימני ההיכר של מערכת שהפנימה תסריט מפורט של המשחק — בדיוק סוג הידע שנמצא במדריכי משחק (walkthroughs), בוויקי ובווידאו של מעריצים שממלאים את האינטרנט. במילים אחרות, נראה שהמודל משתמש בראייה רק כדי לאשר מפה שהוא כבר מכיר בעל פה.
למה זה חשוב עבור מבחני ביצועים (benchmarks) של הסקה ויזואלית
הניסוי מדגיש פגם עדין אך קריטי בבדיקות הסקה ויזואלית רבות:
- קלט נקי אינו מבטיח מצב ידע נקי. גם כאשר הערוץ היחיד הוא זרם תמונות, המודל עשוי להסתמך על מאגר עצום של עובדות שנלמדו בעל פה.
- הנחיות מערכת (system prompts) אינן יכולות למחוק נתוני אימון. לא ניתן לאלץ מודל שראה מדריך משחק מלא "לשכוח" אותו ללא אימון מחדש.
- ביצועים עשויים למדוד זיכרון, לא תפיסה. כאשר עולם הבדיקה תואם למאגר נתונים מוכר, מודל יכול להצליח על ידי התאמת תבנית לתבנית במקום לפרש מידע ויזואלי חדש באמת.
אם מבחני ביצועים ימשיכו להתייחס ל-"vision-only" כמייצג (proxy) להסקה ויזואלית, הם מסתכנים בניפוח טענות לגבי יכולתו של ה-AI להבין סביבות חדשות. חברות עשויות להשוויץ במספרים מרשימים בעוד מערך המיומנויות הבסיסי שלהן נותר צר — בעיה שחשובה למשקיעים, מפתחים ולכל מי שבנה מערכות קריטיות לבטיחות שחייבות לפעול בסביבות שטרם נראו מעולם.
נקודת מבט נגדית: האם שינון הוא באמת בעיה?
יש הטוענים שאישור מפה מוכרת עדיין דורש סוג של הסקה: המודל חייב להתאים את הייצוג הפנימי שלו לרמז הוויזואלי הנוכחי. מנקודת מבט זו, הדמו מדגים יכולת שימושית — שימוש בראייה כדי לעגן (ground) בסיס ידע קיים. ההתנגדות תקפה; המשימה אכן כוללת בדיקה תפיסתית.
עם זאת, מטרת מבחן הביצועים המרכזית היא להעריך הסקה ויזואלית כללית, ולא שליפה של תסריט שמור. כאשר מודל יכול לחזות אירועים לפני שהם מופיעים, הבדיקה כבר אינה מבודדת את התפיסה. הגבול בין עיגון (grounding) שימושי לבין רמאות גלויה הופך למטושטש, והתוצאות מאבדות את ערכן האבחוני.
צעדים הבאים ותגובת הקהילה
כדי לבחון את גבולות יכולת השינון, הבוחן מריץ כעת את אותו המודל על מפה שונה עם גיאוגרפיה משתנה. כל הקוד, ה-harness המותאם אישית וקבצי הלוג המלאים פורסמו לציבור, תוך הזמנת חוקרים אחרים לשחזר את הניסוי או להחיל אותו על משחקים שונים. ערוץ דיון בפלטפורמת קהילת למידה נפתח גם הוא לצורך דיאלוג מתמשך.
שורה תחתונה
הדגמה המבוססת על ראייה בלבד (vision-only) שמצליחה משום שהמודל כבר יודע את התשובה אינה מהווה הוכחה לחשיבה חזותית אמיתית. מדדי ביצוע (Benchmarks) חייבים להפריד בין ידע שנלמד בשינון לבין תפיסה בזמן אמת, אחרת הם מסתכנים בהערכת יתר של יכולת ה-AI לנווט בעולמות חזותיים בלתי מוכרים באמת.
