OpenAI הודיעה ב-30 ביולי 2026 כי ה-API של GPT-5.6 יעלה משמעותית פחות מקודמו, תוך השקת שלושה מודלים מדורגים — Sol, Terra ו-Luna — בתוספת הנחות משמעותיות לקריאות מטמון (cached reads).

למה התמחור החדש חשוב

מאז השקת GPT-5, עלויות ה-API היוו סעיף הוצאה מרכזי עבור כל מי שבנה סוכנים שיחתיים (conversational agents), תהליכי RAG (retrieval-augmented generation) או כלי חילוץ נתונים בקנה מידה גדול. על ידי קיצוץ עמלות הקלט ל-$5, $2 ו-$0.20 למיליון טוקנים עבור Sol, Terra ו-Luna בהתאמה, OpenAI מעניקה למפתחים דרך זולה יותר לבחור את רמת ההסקה (reasoning) שהם צריכים מבלי לעצב מחדש את כל המערכת שלהם. החיסכון המשמעותי ביותר הוא ב-Terra, שפועלת כעת ב-40% מהמחיר של דגם הדגל הקודם, וב-Luna, שעומדת על 4% בלבד מהמדד הזה.

שלושת המודלים, בפירוט

מודל מחיר קלט (לכל מיליון טוקנים) מחיר פלט (לכל מיליון טוקנים) שימוש טיפוסי
Sol $5 $30 הסקה עמוקה, משימות chain-of-thought
Terra $2 $12 עומסי עבודה בסביבת ייצור, ביצועים מאוזנים
Luna $0.20 $1.20 נפח גבוה, חילוץ או סיווג פשוטים

Sol נותר היקר ביותר אך מציע את עומק ההסקה העשיר ביותר. Terra ממוקמת כברירת המחדל עבור רוב היישומים, בעוד Luna היא אפשרות ל"קנה מידה גבוה" (high-scale) שבה ניתן להקריב עומק לטובת עלות.

המטמון (Caching) מקצץ את החשבון עוד יותר

OpenAI הציגה שכבת מטמון (caching layer) המעניקה הנחה של 90% על פעולות קריאה. התעריפים עבור קלט במטמון הם:

  • Sol: $0.50 / מיליון טוקנים
  • Terra: $0.20 / מיליון טוקנים
  • Luna: $0.02 / מיליון טוקנים

כתיבה למטמון עולה פי 1.25 מתעריף הקלט המקביל, ופריט במטמון חייב להישאר לפחות 30 דקות לפני שניתן יהיה להסירו.

היטלי אורך ההקשר ששומרים עליכם מחושבים

ה-API מטיל כעת היטל כאשר בקשה חורגת מ-272K טוקנים של קלט. מחיר הבסיס מוכפל עבור הקלט ועולה פי 1.5 עבור הפלט. תעריפי העודף של Sol הם $10 לקלט ו-$45 לפלט לכל מיליון טוקנים, מה שמקל על חישוב הקנס עבור הקשרים (contexts) ארוכים באופן חריג.

מה מפתחים מפסידים

הפחתות המחירים מגיעות עם שתי השמטות בולטות. ראשית, אין מסלול חינמי קבוע, מה שאומר שכל בקשה כרוכה בתשלום ללא קשר לגודלה. שנית, OpenAI טרם הציגה הנחות עבור batch-endpoints עבור GPT-5.6, תכונה שעזרה למשתמשים בקנה מידה גדול להוריד את העלויות לכל קריאה בגרסאות קודמות.

איך לשמור על עלויות נמוכות

  • בחרו את המודל הנכון: השתמשו ב-Sol רק למשימות שבאמת זקוקות להסקה עמוקה; השתמשו ב-Terra כברירת מחדל עבור רוב עבודת הייצור; שמרו את Luna למשימות בעלות קצב גבוה (high-throughput) ומורכבות נמוכה.
  • השתמשו במטמון (caching): שמרו הנחיות (prompts) ותוצאות ביניים שמשמשות שוב ושוב לאורך קריאות; הנחת ה-90% על קריאה יכולה להשתוות להרבה יותר מהפחתת מחיר הבסיס.
  • שימו לב לאורך ההקשר (context length): פצלו קלטים ארוכים מאוד למקטעים קטנים יותר או קצצו חלקים לא חיוניים כדי להימנע מהיטל ה-2× על הקלט.
  • עקבו אחר חיי המטמון: משך המטמון המינימלי הוא 30 דקות.

מה הלאה

מפתחים צריכים לעקוב אחר דף התמחור הרשמי לכל שינוי, במיוחד סביב עמלות כתיבה למטמון או ספי קצה של אורך ההקשר.

שורה תחתונה: התמחור המדורג של GPT-5.6 והנחות המטמון האגרסיביות הופכים אותו למודל משתלם של OpenAI, אך היעדר מסלול חינמי והנחות batch אומרים שניהול עלויות חכם עדיין יהיה חיוני לכל פריסה משמעותית.