OpenAI טוענת כי מודל ה-GPT-5.6 Sol שלה הגיע לשיעור הצלחה של 38.3% במבחן הביצועים (benchmark) של חשיבה לוגית ARC-AGI-3, תוך שהוא עוקף את Claude Opus 5 של Anthropic שעומד על 30.2%. היתרון מופיע רק כאשר המודל פועל תחת ה-Responses API המותאם של OpenAI, המוסיף שני "טריקים" בזמן ההסקה (inference) שסביבת הבדיקה הרשמית אינה מאפשרת.
הדרך למעלה: מרוץ חימוש של מבחני ביצועים
ARC-AGI-3 בוחן את יכולתו של מודל לפתור בעיות חדשות ורב-שלביות מבלי להסתמך על עובדות שנלמדו בעל פה. מוקדם יותר השנה, Anthropic הכריזה על קפיצה פי ארבעה במבחן זה, מה שהציב את Opus 5 בראש לוח התוצאות (leaderboard) הציבורי. התוצאה הזו קבעה נקודת ייחוס חדשה ליכולת "גולמית" של מודלים, מכיוון שסביבת הבדיקה הרשמית משמיטה כל חשיבה ביניים לאחר כל שלב, ובכך מאלצת את המודל להתחיל מחדש בכל פעם.
הטענה של OpenAI מגיעה לאותו אקלים תחרותי. באמצעות פרסום ציון גבוה יותר, החברה מאותתת כי הדור האחרון שלה יכול לא רק להשתוות לביצועים הלוגיים של יריבתה העיקרית, אלא אף לעקוף אותם. עם זאת, הכותרת מסתירה ניואנס טכני שמעצב מחדש את האופן שבו הקהילה מפרשת טבלאות של מבחני ביצועים.
מה המספרים באמת אומרים
כאשר GPT-5.6 Sol מוערך תחת אותה סביבת ARC-AGI-3 רשמית שהעניקה ל-Opus 5 את התוצאה של 30.2%, המודל צונח לשיעור הצלחה של 7.8%. התנודה הזו אינה תקלה; היא תוצאה של שתי תכונות הנדסיות ש-OpenAI מצרפת למודל:
- Retained Reasoning – במקום למחוק את שרשרת המחשבה (chain-of-thought) לאחר כל תת-משימה, המערכת שומרת על הטקסט הביניים פעיל, מה שמאפשר למודל להתייחס למסקנות קודמות ולבנות טיעון מצטבר.
- Compaction – במקום לקצץ הקשר (context) ישן כדי להישאר במסגרת מגבלות ה-tokens, ה-wrapper דוחס את השלבים הקודמים לסיכום קצר, ובכך שומר על הרצף הלוגי תוך שמירה על גודל prompt בר השליטה.
שני המנגנונים הללו קיימים בתוך ה-Responses API הקנייני. על ידי הזנת המודל בהקשר עשיר ורציף יותר, OpenAI למעשה מגדילה את ה"זיכרון" של המודל ומאפשרת לו להשתמש מחדש בחשיבה שלו. לעומת זאת, סביבת הבדיקה הרשמית אוכפת מצב "stateless" (ללא שמירת מצב) קשיח, שמסיר את היתרונות הללו.
למה למתודולוגיה יש חשיבות
האירוע הזה מדגיש פיצול גובר בהערכת בינה מלאכותית: ציוני מודל גולמיים מול ביצועים ברמת המערכת. OpenAI טוענת כי מבחן ביצועים צריך לשקף את כל ה"סטאק" (stack) שמפתחים יפעילו בפועל – המודל, צינור ההסקה (inference pipeline) וניהול הזיכרון. מנקודת מבט זו, ציון של 38.3% אומר לצוות המוצר שההצעה המשולבת יכולה לפתור יותר משימות בעולם האמיתי מאשר מודל המוערך בבידוד.
המבקרים טוענים כי הדבר מעורפל את ההתקדמות המדעית. אם כל מעבדה תוסיף wrappers מותאמים אישית, לוח התוצאות יהפוך לטלאי של טריקים הנדסיים במקום להשוואה נקייה של אינטליגנציית המודל. סביבת ה-ARC-AGI-3 הרשמית קיימת כדי ליצור שוויון הזדמנויות, ולהבטיח שמספר גבוה יותר יאותת על מודל בסיס חזק באמת, ולא על wrapper חכם יותר.
הסיכונים וההזדמנויות עבור מפתחים ומשקיעים
עבור סטארט-אפים שבונים מוצרים מבוססי AI, ההבחנה היא פרקטית. מודל שיכול לשמר חשיבה ולדחוס הקשר עשוי להזדקק לפחות prompt engineering, לשיהוי (latency) הסקה נמוך יותר ולפחות קריאות API כדי להגיע לפתרון. זה מתרגם לחשבונות מחשוב זולים יותר ולחוויית משתמש חלקה יותר. חברות שמספקות מערכת turnkey – מודל בתוספת שכבת הסקה אופטימלית – משיגות יתרון תחרותי במקומות שבהם מהירות ועלות הן קריטיות.
משקיעים עוקבים אחר עליות בלוחות המבחנים כסממן להכנסות עתידיות. יתרון שמושך כותרות יכול להעלות את שווי החברה, גם אם היכולת הגולמית של המודל הבסיסי שווה ליריביה. לכן, הוויכוח על מה המספרים מייצגים משפיע על האופן שבו ההון זורם לאורך מגזר ה-AI.
מה כדאי לעקוב אחריו בהמשך
- תגובות של קובעי התקן – מארגני מבחני הביצועים עשויים להדק את הכללים סביב "טריקים" הסקה חיצוניים או להוסיף מסלול "מערכת" נפרד שמאפשר אותם במפורש. תגובתם תעצב את הגל הבא של לוחות התוצאות הציבוריים.
- Open-source wrappers – אם הקהילה תשחרר מימושים משלה ל-retained reasoning ו-compaction, היתרון עלול להפוך לתכונת בסיס במקום ליתרון קנייני.
- סביבות בדיקה בעולם האמיתי – חברות מפרסמות יותר ויותר ביצועים על סטים של בעיות קנייניות (למשל, ערכות פנימיות ליצירת קוד). תוצאות אלו, למרות שיהיה קשה יותר להשוות ביניהן, יתחילו להיות חשובות יותר ממבחן ביצועים ציבורי בודד.
טיעון נגד: האם מדובר ב"רימה" של המבחן?
חוקרים מסוימים מגדירים את השימוש ב-APIs מותאמים אישית כ-"benchmark gaming", בטענה שהדבר מנפח ציונים מבלי לקדם את ההבנה של המודל עצמו. הם מציינים כי מודל שביצועיו צונחים למספרים חד-ספרתיים תחת אילוצים מחמירים עדיין רחוק מאוד מיעד ה-AGI. החשש הוא שהתחום עלול להתחיל לתגמל קיצורי דרך הנדסיים על פני קפיצות אמיתיות ביכולת ההסקה.
הצד של OpenAI מדגיש שהקו המפריד בין מודל למערכת הופך למלאכותי יותר ויותר. יישומי AI מודרניים כמעט אף פעם לא מריצים מודל בוואקום; הם תמיד יושבים מאחורי שכבת שירות (serving layer) שמטפלת ב-caching, בחיבור הקשר (context stitching) ובעיבוד פוסט-פרוססינג של הפלט. מנקודת מבט זו, מדידת כל ה-pipeline היא כנה יותר לגבי מה שהמשתמשים חווים בפועל.
שורה תחתונה
סיפור ה-GPT-5.6 Sol מראה שניצחונות בבנצ'מרקים של ימינו תלויים בהנדסת הסקה (inference engineering) לא פחות מאשר בגודל המודל. השאלה האם הקהילה תאמץ ציונים ברמת המערכת או תרסן עטיפות (wrappers) מותאמות אישית, תקבע כיצד נקרא את הכותרת הבאה ב-"leaderboard". עבור כל מי שבנה או מממן מוצרי AI, הלקח ברור: מספרים גולמיים חשובים, אך התוכנה הסובבת אותם יכולה להיות הגורם המכריע בביצועים בעולם האמיתי.
