نیا ماڈل "زیادہ مشکل" کیوں محسوس ہوتا ہے
Google نے Gemini 3.8 Flash کو خود مختار ایجنٹس (autonomous agents) کے لیے بنایا ہے جنہیں کئی مراحل میں سوچنا پڑتا ہے۔ Gemini 3.7 Flash کے برعکس، جو عام طور پر ایک ہی بار میں جواب دے دیتا تھا، 3.8 ایک مسئلے کو ذیلی سوالات میں تقسیم کرتا ہے، بیرونی APIs کو کال کرتا ہے، اور تب تک عمل دہراتا ہے جب تک کہ وہ مطمئن نہ ہو جائے۔ Google نے خبردار کیا ہے کہ یہ اضافی ذہنی کام زیادہ ٹوکنز (tokens) استعمال کرتا ہے، خاص طور پر زیادہ "effort" سیٹنگ پر۔
ایک آزادانہ تجزیہ ظاہر کرتا ہے کہ 3.7 Flash کے مقابلے میں فی ٹاسک آؤٹ پٹ ٹوکنز میں تقریباً 30% اضافہ ہوتا ہے، اور بات چیت کے دور (interaction turns) بھی بڑھ جاتے ہیں۔ چونکہ فی ٹوکن فیس وہی رہتی ہے، اس لیے بہت سے حقیقی دنیا کے کاموں (workloads) کے لیے مؤثر لاگت تقریباً 40% بڑھ جاتی ہے۔
بینچ مارکس جو ڈویلپرز کے لیے اہمیت رکھتے ہیں
یہ توازن محض نظریاتی نہیں ہے۔ DeepSWE v1.1 سافٹ ویئر انجینئرنگ بینچ مارک پر آمنے سامنے کے ٹیسٹ میں، Gemini 3.8 Flash نے Anthropic کے Fable 5 کو فیصلہ کن طور پر شکست دی۔ اس ماڈل نے Vals Finance Agent V2 اور Harvey’s Legal Agent بینچ مارکس میں بھی پہلی پوزیشن حاصل کی، جس سے ثابت ہوا کہ یہ پیچیدہ مالیاتی حساب کتاب اور باریک قانونی استدلال کو سنبھال سکتا ہے۔
Aigora.ai کے CEO، John Ennis نے اس برتری کا خلاصہ یوں کیا: یہ ماڈل بہت کم لاگت اور نمایاں طور پر زیادہ رفتار کے ساتھ "Opus 5 coding quality" فراہم کرتا ہے۔ انہوں نے Remotion ویڈیوز بنانے جیسے استعمال کے کیسز کا حوالہ دیا، جہاں تیز رفتار انفرنس (inference) اور جدید کوڈ جنریشن پروڈکشن پائپ لائنز سے گھنٹوں کا وقت بچا لیتی ہے۔
AI کی بدلتی ہوئی معیشت
ڈویلپرز پہلے افورڈیبلٹی (affordability) کا اندازہ فی ٹوکن قیمت سے لگاتے تھے۔ ملٹی ٹرن (multi-turn) اور ٹول سے لیس ایجنٹس اس پیمانے کو "فی کامیاب ٹاسک قیمت" میں بدل دیتے ہیں۔ Gemini 3.8 Flash کے ساتھ، ٹوکن کی کم قیمت اب سستے بل کی ضمانت نہیں دیتی اگر ماڈل ایک ہی نتیجے تک پہنچنے کے لیے زیادہ ٹوکنز استعمال کرتا ہے۔
Google اس ماڈل کو انتہائی مہنگے فرنٹیر ماڈلز (frontier models) اور ہلکے پھلکے، سنگل ٹرن جنریٹرز کے درمیان رکھتا ہے۔ اسے "intelligence-on-demand" کا نام دے کر، کمپنی یہ اشارہ دے رہی ہے کہ ڈویلپرز بڑے اور سست ماڈلز کے ساتھ آنے والی تاخیر (latency) کے بغیر زیادہ اعلیٰ استدلال کی طاقت حاصل کر سکتے ہیں۔ توازن واضح ہے: زیادہ جدید آؤٹ پٹ کا مطلب ہے ٹوکنز کی زیادہ کل تعداد۔
پرانے ورژن کے ساتھ کب رہنا چاہیے
وہ ٹیمیں جنہیں لاگت کی سخت پیش گوئی (predictability) کی ضرورت ہے—خاص طور پر وہ جو بڑے پیمانے پر بیچ جابز (batch jobs) چلا رہی ہیں یا کم منافع پر کام کر رہی ہیں—انہیں Gemini 3.7 Flash کے ساتھ ہی رہنا چاہیے۔ پرانا ماڈل اب بھی کم لیٹنسی اور مستقل ٹوکن استعمال فراہم کرتا ہے، جس سے ماہانہ اخراجات کا اندازہ لگانا آسان ہو جاتا ہے۔
آگے کیا دیکھنا ہے
- ٹول کال پرائسنگ (Tool-call pricing):
خلاصہ
Gemini 3.8 Flash ظاہر کرتا ہے کہ اعلیٰ استدلال (reasoning) فلیش لیول کی لیٹنسی کے ساتھ حاصل کیا جا سکتا ہے، لیکن یہ فی انٹرایکشن زیادہ ٹوکنز استعمال کرتا ہے۔ جدید، کثیر مراحل والے AI ایجنٹس بنانے والے ڈویلپرز کارکردگی کے اس اضافے کو پرکشش پائیں گے، تاہم انہیں چھپے ہوئے ٹوکن اخراجات کو پورا کرنے کے لیے اپنے بجٹ میں تبدیلی کرنی ہوگی۔ باقی سب کے لیے، پرانا 3.7 Flash ایک محفوظ اور زیادہ قابلِ پیش گوئی انتخاب ہے۔
