ਨਵਾਂ ਮਾਡਲ "ਔਖਾ" ਕਿਉਂ ਮਹਿਸੂਸ ਹੁੰਦਾ ਹੈ
Google ਨੇ Gemini 3.8 Flash ਨੂੰ ਅਜਿਹੇ ਸਵੈ-ਨਿਰਧਾਰਤ (autonomous) ਏਜੰਟਾਂ ਲਈ ਬਣਾਇਆ ਹੈ ਜਿਨ੍ਹਾਂ ਨੂੰ ਕਈ ਪੜਾਵਾਂ ਵਿੱਚ ਸੋਚਣਾ ਪੈਂਦਾ ਹੈ। Gemini 3.7 Flash ਦੇ ਉਲਟ, ਜੋ ਆਮ ਤੌਰ 'ਤੇ ਇੱਕੋ ਵਾਰ ਵਿੱਚ ਜਵਾਬ ਦੇ ਦਿੰਦਾ ਸੀ, 3.8 ਇੱਕ ਸਮੱਸਿਆ ਨੂੰ ਉਪ-ਸਵਾਲਾਂ ਵਿੱਚ ਵੰਡਦਾ ਹੈ, ਬਾਹਰੀ APIs ਨੂੰ ਕਾਲ ਕਰਦਾ ਹੈ, ਅਤੇ ਉਦੋਂ ਤੱਕ ਦੁਹਰਾਉਂਦਾ ਰਹਿੰਦਾ ਹੈ ਜਦੋਂ ਤੱਕ ਇਹ ਸੰਤੁਸ਼ਟ ਨਹੀਂ ਹੋ ਜਾਂਦਾ। Google ਚੇਤਾਵਨੀ ਦਿੰਦਾ ਹੈ ਕਿ ਇਹ ਵਾਧੂ ਮਾਨਸਿਕ ਕੰਮ ਵਧੇਰੇ ਟੋਕਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ, ਖਾਸ ਕਰਕੇ ਉੱਚੀ "effort" ਸੈਟਿੰਗ 'ਤੇ।
ਇੱਕ ਸੁਤੰਤਰ ਵਿਸ਼ਲੇਸ਼ਣ ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ 3.7 Flash ਦੇ ਮੁਕਾਬਲੇ ਪ੍ਰਤੀ ਕਾਰਜ (task) ਆਊਟਪੁੱਟ ਟੋਕਨਾਂ ਵਿੱਚ ਲਗਭਗ 30 % ਦਾ ਵਾਧਾ ਹੁੰਦਾ ਹੈ, ਅਤੇ ਇੰਟਰੈਕਸ਼ਨ ਦੇ ਚੱਕਰ (turns) ਵੀ ਵਧ ਜਾਂਦੇ ਹਨ। ਕਿਉਂਕਿ ਪ੍ਰਤੀ-ਟੋਕਨ ਫੀਸ ਉਹੀ ਰਹਿੰਦੀ ਹੈ, ਇਸ ਲਈ ਕਈ ਅਸਲ-ਦੁਨੀਆ ਦੇ ਕੰਮਾਂ (workloads) ਲਈ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਲਾਗਤ ਲਗਭਗ 40 % ਵਧ ਜਾਂਦੀ ਹੈ।
ਬੈਂਚਮਾਰਕਸ ਜੋ ਡਿਵੈਲਪਰਾਂ ਲਈ ਮਹੱਤਵਪੂਰਨ ਹਨ
ਇਹ ਸਮਝੌਤਾ (trade-off) ਸਿਰਫ਼ ਕਿਤਾਬੀ ਨਹੀਂ ਹੈ। DeepSWE v1.1 ਸਾਫਟਵੇਅਰ-ਇੰਜੀਨੀਅਰਿੰਗ ਬੈਂਚਮਾਰਕ 'ਤੇ ਸਿੱਧੇ ਮੁਕਾਬਲੇ ਦੇ ਟੈਸਟਾਂ ਵਿੱਚ, Gemini 3.8 Flash ਨੇ Anthropic ਦੇ Fable 5 ਨੂੰ ਸਪੱਸ਼ਟ ਤੌਰ 'ਤੇ ਹਰਾ ਦਿੱਤਾ। ਇਸ ਮਾਡਲ ਨੇ Vals Finance Agent V2 ਅਤੇ Harvey’s Legal Agent ਬੈਂਚਮਾਰਕਸ ਵਿੱਚ ਵੀ ਸਿਖਰ ਬਣ ਕੇ ਇਹ ਸਾਬਤ ਕਰ ਦਿੱਤਾ ਕਿ ਇਹ ਗੁੰਝਲਦਾਰ ਵਿੱਤੀ ਗਣਨਾਵਾਂ ਅਤੇ ਬਾਰੀਕ ਕਾਨੂੰਨੀ ਤਰਕ ਨੂੰ ਸੰਭਾਲ ਸਕਦਾ ਹੈ।
Aigora.ai ਦੇ CEO, John Ennis ਨੇ ਇਸ ਫਾਇਦੇ ਦਾ ਸਾਰ ਦਿੱਤਾ: ਇਹ ਮਾਡਲ ਬਹੁਤ ਘੱਟ ਲਾਗਤ ਅਤੇ ਕਾਫ਼ੀ ਤੇਜ਼ ਰਫ਼ਤਾਰ ਨਾਲ “Opus 5 coding quality” ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ। ਉਹ Remotion ਵੀਡੀਓ ਬਣਾਉਣ ਵਰਗੇ ਵਰਤੋਂ ਦੇ ਮਾਮਲਿਆਂ (use cases) ਦਾ ਹਵਾਲਾ ਦਿੰਦੇ ਹਨ, ਜਿੱਥੇ ਤੇਜ਼ ਇਨਫਰੈਂਸ (inference) ਅਤੇ ਉੱਨਤ ਕੋਡ ਜਨਰੇਸ਼ਨ ਪ੍ਰੋਡਕਸ਼ਨ ਪਾਈਪਲਾਈਨਾਂ ਵਿੱਚੋਂ ਕਈ ਘੰਟੇ ਬਚਾ ਲੈਂਦੇ ਹਨ।
AI ਦੀ ਬਦਲਦੀ ਆਰਥਿਕਤਾ
ਡਿਵੈਲਪਰ ਪਹਿਲਾਂ ਪ੍ਰਤੀ-ਟੋਕਨ ਕੀਮਤ (price-per-token) ਦੇ ਆਧਾਰ 'ਤੇ ਕਿਫਾਇਤੀ ਹੋਣ ਦਾ ਫੈਸਲਾ ਕਰਦੇ ਸਨ। ਮਲਟੀ-ਟਰਨ (multi-turn), ਟੂਲ-ਅਗਮੈਂਟਡ ਏਜੰਟ ਉਸ ਮਾਪਦੰਡ ਨੂੰ 'ਪ੍ਰਤੀ-ਸਫਲ-ਕਾਰਜ ਕੀਮਤ' (price-per-successful-task) ਵਿੱਚ ਬਦਲ ਦਿੰਦੇ ਹਨ। Gemini 3.8 Flash ਦੇ ਨਾਲ, ਸਸਤੀ ਟੋਕਨ ਕੀਮਤ ਹੁਣ ਸਸਤੇ ਬਿੱਲ ਦੀ ਗਰੰਟੀ ਨਹੀਂ ਦਿੰਦੀ ਜੇਕਰ ਮਾਡਲ ਉਹੀ ਨਤੀਜਾ ਪ੍ਰਾਪਤ ਕਰਨ ਲਈ ਵਧੇਰੇ ਟੋਕਨਾਂ ਦੀ ਵਰਤੋਂ ਕਰਦਾ ਹੈ।
Google ਇਸ ਮਾਡਲ ਨੂੰ ਬਹੁਤ ਮਹਿੰਗੇ ਫਰੰਟੀਅਰ ਮਾਡਲਾਂ ਅਤੇ ਹਲਕੇ, ਸਿੰਗਲ-ਟਰਨ ਜਨਰੇਟਰਾਂ ਦੇ ਵਿਚਕਾਰ ਰੱਖਦਾ ਹੈ। ਇਸ ਨੂੰ “intelligence-on-demand” ਵਜੋਂ ਬ੍ਰਾਂਡ ਕਰਕੇ, ਕੰਪਨੀ ਸੰਕੇਤ ਦਿੰਦੀ ਹੈ ਕਿ ਡਿਵੈਲਪਰ ਵੱਡੇ ਅਤੇ ਹੌਲੀ ਮਾਡਲਾਂ ਦੇ ਨਾਲ ਆਉਣ ਵਾਲੀ ਲੇਟੈਂਸੀ (latency) ਤੋਂ ਬਿਨਾਂ ਉੱਚੀ ਤਰਕ ਸ਼ਕਤੀ ਦੀ ਵਰਤੋਂ ਕਰ ਸਕਦੇ ਹਨ। ਸਮਝੌਤਾ ਸਪੱਸ਼ਟ ਹੈ: ਵਧੇਰੇ ਉੱਨਤ ਆਊਟਪੁੱਟ ਦਾ ਮਤਲਬ ਹੈ ਵਧੇਰੇ ਕੁੱਲ ਟੋਕਨ ਗਿਣਤੀ।
ਕਦੋਂ ਪੁਰਾਣੇ ਵਰਜ਼ਨ ਨਾਲ ਜੁੜੇ ਰਹਿਣਾ ਚਾਹੀਦਾ ਹੈ
ਉਹ ਟੀਮਾਂ ਜਿਨ੍ਹਾਂ ਨੂੰ ਲਾਗਤ ਦੀ ਸਖ਼ਤ ਭਵਿੱਖਬਾਣੀ ਦੀ ਲੋੜ ਹੈ—ਖਾਸ ਕਰਕੇ ਉਹ ਜੋ ਵੱਡੇ ਪੱਧਰ 'ਤੇ ਬੈਚ ਜੌਬਸ ਚਲਾਉਂਦੀਆਂ ਹਨ ਜਾਂ ਬਹੁਤ ਘੱਟ ਮੁਨਾਫੇ (thin margins) 'ਤੇ ਕੰਮ ਕਰਦੀਆਂ ਹਨ—ਉਨ੍ਹਾਂ ਨੂੰ Gemini 3.7 Flash ਨਾਲ ਹੀ ਜੁੜੇ ਰਹਿਣਾ ਚਾਹੀਦਾ ਹੈ। ਪੁਰਾਣਾ ਮਾਡਲ ਅਜੇ ਵੀ ਘੱਟ ਲੇਟੈਂਸੀ ਅਤੇ ਇੱਕ ਸਥਿਰ ਟੋਕਨ ਫੁੱਟਪ੍ਰਿੰਟ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਮਹੀਨਾਵਾਰ ਖਰਚੇ ਦਾ ਅੰਦਾਜ਼ਾ ਲਗਾਉਣਾ ਆਸਾਨ ਹੋ ਜਾਂਦਾ ਹੈ।
ਅੱਗੇ ਕੀ ਦੇਖਣਾ ਹੈ
- ਟੂਲ-ਕਾਲ ਕੀਮਤ (Tool-call pricing):
ਨਿਚੋੜ
Gemini 3.8 Flash ਦਿਖਾਉਂਦਾ ਹੈ ਕਿ ਉੱਚੀ ਤਰਕ ਸ਼ਕਤੀ ਫਲੈਸ਼-ਪੱਧਰ ਦੀ ਲੇਟੈਂਸੀ ਪ੍ਰਾਪਤ ਕਰ ਸਕਦੀ ਹੈ, ਪਰ ਇਹ ਪ੍ਰਤੀ ਇੰਟਰੈਕਸ਼ਨ ਵਧੇਰੇ ਟੋਕਨ ਖਰਚ ਕਰਦਾ ਹੈ। ਉੱਨਤ, ਬਹੁ-ਪੜਾਵੀ AI ਏਜੰਟ ਬਣਾਉਣ ਵਾਲੇ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਪ੍ਰਦਰਸ਼ਨ ਵਿੱਚ ਵਾਧਾ ਪ੍ਰਭਾਵਸ਼ਾਲੀ ਲੱਗੇਗਾ, ਫਿਰ ਵੀ ਉਨ੍ਹਾਂ ਨੂੰ ਲੁਕੀ ਹੋਈ ਟੋਕਨ ਲਾਗਤ ਨੂੰ ਕਵਰ ਕਰਨ ਲਈ ਬਜਟ ਨੂੰ ਐਡਜਸਟ ਕਰਨਾ ਪਵੇਗਾ। ਬਾਕੀ ਸਭ ਲਈ, ਪੁਰਾਣਾ 3.7 Flash ਇੱਕ ਸੁਰੱਖਿਅਤ ਅਤੇ ਵਧੇਰੇ ਭਵਿੱਖਬਾਣੀਯੋਗ ਚੋਣ ਬਣਿਆ ਹੋਇਆ ਹੈ।
