OpenAI הודיעה כי מודל ה-GPT-5.6 Sol שלה הגיע לציון של 38.3 אחוזים במבחן הלוגיקה ARC-AGI-3, תוך שהוא עוקף את Claude Opus 5 של Anthropic עם 30.2 אחוזים. הטענה עוררה ויכוח טכני מיידי מכיוון שהמודל עצמו השיג רק 7.8 אחוזים כאשר הופעל באמצעות מערכת הבדיקה (test harness) הרשמית של המבחן.

למה הציון ב-ARC-AGI-3 חשוב

ARC-AGI-3 בוחן את יכולתו של מודל לפתור בעיות חדשות לחלוטין הדורשות יכולת הסקה (reasoning), במקום להסתמך על דפוסים שנלמדו בעל פה. חוקרים מציינים את הציונים כאינדיקטור (proxy) להתקדמות ב"אינטליגנציה כללית", כך שמובילות של עשרה נקודות נראית כמו צעד משמעותי לעבר פתרון בעיות דמוי אנוש. זה לבדו מסביר מדוע הכותרת עוררה הדים בקהילת ה-AI.

המנוף הנסתר: Retained Reasoning ו-Compaction

OpenAI לא העריכה את GPT-5.6 Sol באמצעות מערכת הבדיקה הציבורית. במקום זאת, היא השתמשה ב-Responses API שלה עם שתי אפשרויות קנייניות:

  • Retained Reasoning – שומר על שרשרת המחשבה (chain of thought) של המודל לאורך מספר שלבים, ובכך מונע אובדן של לוגיקה ביניים המתרחש כאשר כל שלב מטופל בנפרד.
  • Compaction – דוחס הקשר (context) מוקדם במקום לחתוך אותו, מה שמאפשר למודל להתייחס להיסטוריה ארוכה ומסוכמת יותר.

כאשר הגדרות אלו פעילות, המודל מחבר טיעונים ארוכים יותר ומשתמש מחדש בהסקות קודמות, מה שמנפח את הביצועים במשימות רב-שלביות. במערכת הבדיקה הרשמית, אשר משמיטה את ההסקה לאחר כל פעולה, הציון של אותו מודל צונח ל-7.8 אחוזים, מה שמציב אותו הרחק מתחת ל-Claude Opus 5.

OpenAI טוענת כי מבחן (benchmark) צריך למדוד את כל תהליך ההסקה (inference pipeline), ולא רק את המשקולות העצביות הגולמיות. מנקודת מבט זו, ה-"wrapper" – לוגיקת ה-API שמשמרת ודוחסת את ההקשר – שייכת למערכת הנבדקת.

ויכוח ההוגנות

François Chollet, ממייסדי ה-ARC Prize שנותן חסות למבחן, התייחס לנושא. הוא הבחין בין מערכות בדיקה מותאמות אישית שנבנו כדי "לפתור" מבחן לבין הגדרות ה-API לשימוש כללי שכל משתמש יכול להפעיל. Chollet ציין כי סביבת הבדיקה המקורית של ARC Prize השתמשה ב-completions API ישן יותר בסגנון OpenAI, שחסרו בו התכונות המתקדמות הזמינות כיום ב-Claude API של Anthropic. חוסר התאמה זה עלול היה להפלות את OpenAI בסבבים מוקדמים יותר.

הוא נמנע מהצהרה שההשוואה אינה תקפה. Chollet אמר כי טענה של ראש בראש נותרת קבילה אם ההגדרות המדויקות וכל עלות נלווית נחשפות. שקיפות, כך טען, מאפשרת לקהילה להעריך האם הפער נובע מארכיטקטורת המודל, משיטות הנדסיות, או שניהם.

מי מרוויח ומי מפסיד

אם הציון הגבוה יתקבל כפי שהוא, OpenAI תרוויח דחיפה בתפיסה הציבורית ועמדת מיקוח חזקה יותר בשיחות על רישוי ארגוני. הצוות של Claude יכול להצביע על ביצועי המודל הגולמי במערכת הבדיקה הסטנדרטית כראיה לכך שהארכיטקטורה שלהם יעילה יותר כאשר היא מופשטת משכבות הנדסיות נוספות.

חוקרים ומפתחים הנשענים על דירוגי מבחנים כדי להנחות השקעות עשויים למצוא את האירוע הזה מטריד. המקרה מראה שככל שהמודלים הופכים לגדולים יותר, התוכנה שמנהלת את ההסקה (inference) שלהם יכולה להפוך למכריעה. חברות המספקות ערימות הסקה (inference stacks) מתוחכמות בעלות עלות שולית נמוכה עשויות לשלוט בציונים בכותרות ללא מודל בסיס עדיף.

מה הלאה עבור ARC-AGI-3 ומבחנים אחרים

הוויכוח צפוי לדחוף את מארגני ARC Prize לעבר כללים הדוקים יותר לגבי קונפיגורציות הסקה מותרות. תגובות אפשריות כוללות:

  • פרסום ציון "בסיס" (baseline) המשקף ביצועים באמצעות מערכת הבדיקה הרשמית בלבד.
  • דרישה מהמשתתפים להגיש ניתוח עלויות של כל הגדרה נוספת, כך שניתן יהיה לשקול ציון גבוה אל מול עלויות מחשוב או הנדסה נוספות.
  • הוספת מסלול נפרד ברמת המערכת ("system-level") המתגמל שימוש חכם בתכונות לניהול הקשר (context-management).

מהלכים כאלה יכפו הפרדה ברורה יותר בין יכולת המודל הגולמית לבין אופטימיזציה הנדסית, מה שיקל על השוואת טענות עתידיות.

טיעון נגד: מבחנים צריכים לשקף שימוש בעולם האמיתי

צד אחד טוען כי הגישה המחמירה של "מודל גולמי בלבד" אינה מציאותית. בייצור (production), מפתחים משתמשים בשכבות של caching, סיכום הקשר (context summarisation) וטריקים אחרים על גבי מודלי שפה. אם מבחן שואף לחזות תועלת מעשית, עליו לאפשר – ואף לעודד – אופטימיזציות כאלה. מנקודת מבט זו, Retained Reasoning ו-Compaction של OpenAI הם כלים לגיטימיים שכל מתחרה יכול לאמץ, בתנאי שהם מתועדים בפומבי.

Critics counter that without a common baseline, scores become a moving target, eroding the benchmark’s role as an objective yardstick. The tension between ecological validity (mirroring real deployments) and methodological purity (isolating the model) fuels the current controversy.

Takeaway

The GPT-5.6 Sol claim spotlights a growing split in AI evaluation: raw model talent versus the engineering ecosystem that extracts it. As long as the community demands full disclosure of inference settings and their costs, the debate will sharpen rather than obscure our view of progress toward general intelligence.