למה המודל החדש מרגיש "קשה" יותר

Google פיתחה את Gemini 3.8 Flash עבור סוכנים אוטונומיים שחייבים לחשוב דרך מספר שלבים. בניגוד ל-Gemini 3.7 Flash, שבדרך כלל ענה במעבר בודד, גרסה 3.8 מפרקת בעיה לתת-שאלות, קוראת ל-APIs חיצוניים וחוזרת על הפעולה עד שהיא מרוצה. Google מזהירה שהעבודה המנטלית הנוספת הזו צורכת יותר טוקנים (tokens), במיוחד בהגדרת "מאמץ" (effort) גבוהה יותר.

ניתוח עצמאי מראה שטוקני הפלט לכל משימה עולים בכ-30% לעומת 3.7 Flash, וגם מספר סבבי האינטראקציה עולה. מכיוון שהעמלות לכל טוקן נשארות זהות, העלות האפקטיבית עולה בכ-40% בערך עבור עומסי עבודה רבים בעולם האמיתי.

מדדי ביצוע (Benchmarks) שחשובים למפתחים

הפשרה (trade-off) אינה תיאורטית בלבד. במבחני ראש בראש על מדד הנדסת התוכנה DeepSWE v1.1, Gemini 3.8 Flash ניצח באופן נחרץ את Fable 5 של Anthropic. המודל גם דורג במקום הראשון במדדי Vals Finance Agent V2 ו-Harvey’s Legal Agent, מה שמוכיח שהוא יכול להתמודד עם חישובים פיננסיים מורכבים ועם חשיבה משפטית מורכבת.

John Ennis, מנכ"ל Aigora.ai, סיכם את היתרון: המודל מספק "איכות קוד של Opus 5" תוך שהוא פועל בשבריר מהעלות ובמהירות גבוהה משמעותית. הוא מציין מקרי בוחן כמו יצירת סרטוני Remotion, שבהם הסקה (inference) מהירה ויצירת קוד מתוחכמת חוסכות שעות מתהליכי הייצור.

הכלכלה המשתנה של ה-AI

מפתחים נהגו לשפוט עלות באמצעות מחיר לטוקן. סוכנים מרובי-שלבים (multi-turn) המחוזקים בכלי עבודה הופכים את המדד הזה למחיר לכל משימה מוצלחת. עם Gemini 3.8 Flash, מחיר טוקן זול יותר כבר לא מבטיח חשבון זול יותר אם המודל צורך יותר טוקנים כדי להגיע לאותה תוצאה.

Google מציבה את המודל בין מודלי קצה (frontier models) יקרים במיוחד לבין מחוללים קלים וחד-שלביים. באמצעות המיתוג "intelligence-on-demand", החברה מאותתת שמפתחים יכולים לנצל כוח חשיבה גבוה יותר ללא השיהוי (latency) שבדרך כלל מלווה מודלים גדולים ואיטיים יותר. הפשרה ברורה: פלט מתוחכם יותר פירושו מספר טוקנים כולל גבוה יותר.

מתי כדאי להישאר עם הגרסה הישנה

צוותים הזקוקים ליכולת חיזוי עלויות הדוקה — במיוחד אלו המריצים עבודות אצווה (batch jobs) בקנה מידה גדול או פועלים בשולי רווח דקים — צריכים להיצמד ל-Gemini 3.7 Flash. המודל הישן עדיין מציע שיהוי נמוך וצריכת טוקנים יציבה, מה שמקל על חיזוי ההוצאות החודשיות.

מה כדאי לעקוב אחריו בהמשך

  • תמחור קריאות לכלים (Tool-call pricing):

שורה תחתונה

Gemini 3.8 Flash מראה שחשיבה גבוהה יותר יכולה להגיע לשיהוי ברמת "flash", אך היא שורפת יותר טוקנים לכל אינטראקציה. מפתחים שבונים סוכני AI מתוחכמים ורב-שלביים ימצאו את שיפורי הביצועים כמשכנעים, אך עליהם להתאים את התקציב כדי לכסות את עלות הטוקנים הנסתרת. עבור כל השאר, ה-3.7 Flash הישן נותר הבחירה הבטוחה והצפויה יותר.