DeepSeek שחררה את מודל ה-V4 Pro בגרסת זמינות כללית (GA). מדידות ראשוניות מראות שהוא מפחית את השימוש ב-reasoning tokens ב-18% עד 62% בהשוואה לגרסת ה-preview. זה משנה עבור כל מי שמשלם לפי טוקן: אותן הנחיות (prompts) עולות כעת פחות באופן ניכר, תוך שהן עדיין מייצרות פלט דומה.

מה הוביל להשוואה

גרסת ה-GA הגיעה ללא פוסט בבלוג או יומן שינויים (changelog), כך שמפתחים נאלצו לגלות את ההבדלים בעצמם. בדיקה קהילתית הריצה משימות זהות בשתי הגרסאות ומצאה את השינוי המשמעותי ביותר — ירידה חדה בכמות הטוקנים שהמודל מבלה ב"חשיבה" לפני המענה. בשאילתות פשוטות (trivial look-ups), מודל ה-GA השתמש ב-62% פחות reasoning tokens; בשאילתות מורכבות יותר, ההפחתה הייתה 18%.

יעילות טוקנים והשפעתה

בתהליך עבודה טיפוסי של חילוץ נתונים (extraction workflow), גרסת ה-preview צרכה 159 reasoning tokens כדי לשלוף מספר שדות מתוך prompt. המעבר לגרסת ה-GA עם ביטול תכונת ה-"thinking" צמצם את המספר הזה ל-40 טוקנים בלבד. עבור משתמשים בתוכניות תשלום לפי שימוש (metered plans), החיסכון מתרגם ישירות לחשבונות נמוכים יותר, במיוחד בקנה מידה גדול.

חילוץ JSON: המכשול הנסתר

שתי הגרסאות נתקלות בקשיים כאשר מצב ה-"thinking" מופעל: הן עוברות את בדיקת ה-JSON schema אך מכניסות ערכים מספריים שגויים. רק גרסת ה-GA מחזירה JSON תקין כאשר ה-"thinking" כבוי. צוותים הזקוקים לפלט מובנה (structured output) צריכים לבטל את דגל ה-thinking במשימות חילוץ, אחרת הם יקבלו נתונים תקינים מבחינה תחבירית אך שגויים מבחינה מספרית.

הטיפול בסירוב משנה את התמונה

מודל ה-preview יכול היה לסרב לשאלה שנראתה לו בלתי ניתנת למענה ולהשיב "אינני יודע". מודל ה-GA כבר לא עושה זאת. במקום זאת, הוא או שנגמר לו תקציב הטוקנים מבלי לענות, או שהוא ממציא תגובה. שינוי זה משפר את יעילות הטוקנים אך מסיר רשת ביטחון שמנעה מהמודל להזות בנושאים לא ידועים.

שיפור באמינות

לולאה מסוכנת בגרסת ה-preview — שנגרמה מתקציב "thinking" צנוע — הייתה עלולה לגרום למודל לחזור על אותו טקסט עד למילוי חלון ה-8,192 טוקנים. גרסת ה-GA מתקנת באג זה, ובכך מפסיקה את החזרתיות הבלתי נשלטת שבעבר סיכנה את ניצול חלון הבקשה ואף הגדילה את העלויות.

מה משתמשים צריכים לעקוב אחריו

  • השתמשו בגרסת ה-GA כדי להפחית את כמות הטוקנים. ההפחתות שנמדדו נשמרות ללא קשר למורכבות המשימה.
  • כבו את ה-"thinking" עבור כל חילוץ JSON או נתונים מובנים. זה מבטיח ערכים נכונים ושומר על שימוש מינימלי בטוקנים.
  • אל תסתמכו על סירובים מובנים. אם ה-prompt מבקש נתונים שאינם ניתנים לאימות, מודל ה-GA עשוי עדיין להפיק תשובה, ולכן אימות (validation) בשלבים הבאים נותר חיוני.
  • עקבו אחר החיוב בשעות שיא. כללי התמחור החדשים גורמים לצריכת טוקנים בתקופות עומס להשפיע על ההוצאה הכוללת בצורה חדה יותר מבעבר.

שורה תחתונה

מודל ה-V4 Pro GA של DeepSeek מספק ניצחון ברור ביעילות — עד 62% פחות reasoning tokens — ומתקן באג חזרתיות קריטי. עם זאת, אובדן תגובות הסירוב המפורשות והצורך לבטל את ה-"thinking" לצורך פלט JSON מדויק מוסיפים שיקולים חדשים. צוותים שיבצעו התאמות ב-pipelines שלהם יוכלו להפחית עלויות מבלי להקריב פונקציונליות.

מקור: https://dev.to/synthorai/deepseek-v4-pro-ga-vs-preview-measured-18-62-less-thinking-539l