Google ਨੇ ਐਲਾਨ ਕੀਤਾ ਹੈ ਕਿ ਉਸਦੇ Gemini ਪਰਿਵਾਰ ਹੁਣ ਇੱਕ “agentic” ਵੀਡੀਓ-ਵਿਸ਼ਲੇਸ਼ਣ ਮੋਡ ਦਾ ਸਮਰਥਨ ਕਰਦੇ ਹਨ ਜੋ ਮਿਆਰੀ ਬੈਂਚਮਾਰਕਸ 'ਤੇ ਟੋਕਨ ਦੀ ਵਰਤੋਂ ਨੂੰ 88% ਤੱਕ ਘਟਾ ਸਕਦਾ ਹੈ, ਇੱਕ ਅਜਿਹਾ ਬਦਲਾਅ ਜੋ ਲੰਬੇ-ਰੂਪ ਵਾਲੀ ਵੀਡੀਓ AI ਨੂੰ ਡਿਵੈਲਪਰਾਂ ਲਈ ਕਾਫ਼ੀ ਸਸਤਾ ਬਣਾ ਸਕਦਾ ਹੈ।

ਨਵਾਂ ਮੋਡ ਪੁਰਾਣੇ ਫਰੇਮ-ਦਰ-ਫਰੇਮ ਤਰੀਕੇ—ਜੋ ਆਮ ਤੌਰ 'ਤੇ ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਇੱਕ ਫਰੇਮ ਦਾ ਫਿਕਸਡ ਸੈਂਪਲ ਹੁੰਦਾ ਹੈ—ਨੂੰ ਇੱਕ ਮਾਡਲ-ਡਰਾਈਵਨ ਲੂਪ ਨਾਲ ਬਦਲ ਦਿੰਦਾ ਹੈ ਜੋ ਇਹ ਫੈਸਲਾ ਕਰਦਾ ਹੈ ਕਿ ਵੀਡੀਓ ਦੇ ਕਿਹੜੇ ਹਿੱਸਿਆਂ ਦੀ ਜਾਂਚ ਕਰਨੀ ਹੈ, ਕਿਸ ਰਫ਼ਤਾਰ ਨਾਲ, ਅਤੇ ਕਿਸ ਮਾਡੈਲਟੀ (ਫਰੇਮ, ਆਡੀਓ, ਜਾਂ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ) ਰਾਹੀਂ ਕਰਨੀ ਹੈ। ਕਿਸੇ ਖਾਸ ਕੁਐਰੀ ਲਈ ਲੋੜੀਂਦੇ ਸਿਗਨਲਾਂ ਨੂੰ ਹੀ ਲੈ ਕੇ, ਸਿਸਟਮ ਭਾਸ਼ਾ ਮਾਡਲ ਨੂੰ ਭੇਜੇ ਜਾਣ ਵਾਲੇ ਡੇਟਾ ਨੂੰ ਘਟਾ ਦਿੰਦਾ ਹੈ ਅਤੇ ਫਿਰ ਵੀ ਉਹਨਾਂ ਸਬ-ਸੈਕਿੰਡ ਘਟਨਾਵਾਂ ਨੂੰ ਫੜ ਲੈਂਦਾ ਹੈ ਜੋ ਇੱਕ ਮੋਟੇ ਸੈਂਪਲ ਤੋਂ ਰਹਿ ਸਕਦੀਆਂ ਸਨ।

ਫਿਕਸਡ ਸੈਂਪਲਿੰਗ ਤੋਂ ਖੁਦਮੁਖਤਿਆਰ ਵਿਜ਼ਨ ਤੱਕ

Gemini ਦੀਆਂ ਪੁਰਾਣੀਆਂ ਵੀਡੀਓ ਸਮਰੱਥਾਵਾਂ ਡਿਵੈਲਪਰਾਂ ਨੂੰ ਪਹਿਲਾਂ ਹੀ ਸੈਂਪਲਿੰਗ ਰੇਟ ਚੁਣਨ ਲਈ ਮਜਬੂਰ ਕਰਦੀਆਂ ਸਨ। ਉੱਚੇ ਰੇਟ ਦਾ ਮਤਲਬ ਸੀ ਵਧੇਰੇ ਟੋਕਨ ਅਤੇ ਉੱਚੇ ਬਿੱਲ; ਘੱਟ ਰੇਟ ਦਾ ਮਤਲਬ ਸੀ ਤੇਜ਼ ਕੱਟਾਂ (quick cuts) ਨੂੰ ਮਿਸ ਹੋਣ ਦਾ ਖਤਰਾ। ਨਵਾਂ agentic ਵੇਰੀਐਂਟ, ਜੋ ਕਿ ਵਰਤਮਾਨ ਵਿੱਚ Gemini 3.7 Flash, 3.6 Flash ਅਤੇ 3.5 Flash-Lite ਲਈ ਉਪਲਬਧ ਹੈ, ਸਿੱਧਾ API ਵਿੱਚ ਇੱਕ “think-act-observe” ਚੱਕਰ ਨੂੰ ਸ਼ਾਮਲ ਕਰਦਾ ਹੈ। ਪਹਿਲਾਂ, ਮਾਡਲ ਕੰਮ ਬਾਰੇ ਵਿਚਾਰ ਕਰਦਾ ਹੈ। ਅਗਲੇ, ਇਹ ਜਾਂਚ ਕਰਨ ਲਈ ਇੱਕ ਸੈਗਮੈਂਟ ਚੁਣਦਾ ਹੈ। ਅੰਤ ਵਿੱਚ, ਇਹ ਚੁਣੇ ਹੋਏ ਫਰੇਮਾਂ, ਆਡੀਓ ਕਲਿੱਪਾਂ, ਜਾਂ ਟ੍ਰਾਂਸਕ੍ਰਿਪਟ ਦੇ ਹਿੱਸਿਆਂ ਦਾ ਨਿਰੀਖਣ ਕਰਦਾ ਹੈ। ਜੇਕਰ ਕੋਈ ਸੈਗਮੈਂਟ ਉਮੀਦਜਨਕ ਲੱਗਦਾ ਹੈ, ਤਾਂ ਮਾਡਲ ਉਸਨੂੰ ਤੁਰੰਤ ਵਧੇਰੇ ਬਾਰੀਕੀ ਨਾਲ ਦੁਬਾਰਾ ਸੈਂਪਲ ਕਰਦਾ ਹੈ।

ਇਹ ਡਾਇਨਾਮਿਕ ਸੈਂਪਲਿੰਗ ਮਾਡਲ ਨੂੰ ਲੱਖਾਂ ਟੋਕਨ ਖਰਚ ਕੀਤੇ ਬਿਨਾਂ ਘੰਟਿਆਂ ਦੀ ਫੁਟੇਜ—ਜਿਵੇਂ ਕਿ ਇੱਕ ਪੂਰਾ ਲੈਕਚਰ ਜਾਂ ਕਈ ਘੰਟਿਆਂ ਦੀ ਰਿਕਾਰਡਿੰਗ—ਵਿੱਚ ਘੁੰਮਣ ਦੀ ਇਜਾਜ਼ਤ ਦਿੰਦੀ ਹੈ। ਬੈਂਚਮਾਰਕਸ ਜੋ ਅਸਲ ਦੁਨੀਆ ਦੇ ਵੀਡੀਓ-ਪ੍ਰਸ਼ਨ-ਉੱਤਰ (1H-VideoQA) ਅਤੇ ਵਿਆਪਕ ਵੀਡੀਓ-ਅੰਡਰਸਟੈਂਡਿੰਗ ਕੰਮਾਂ (LVBench) ਦੀ ਨਕਲ ਕਰਦੇ ਹਨ, ਦਿਖਾਉਂਦੇ ਹਨ ਕਿ ਉਹੀ ਕੁਐਰੀਆਂ ਲਗਭਗ ਇੱਕ-ਦਸਵੇਂ ਹਿੱਸੇ ਦੇ ਟੋਕਨ ਬਜਟ ਨਾਲ ਪੂਰੀਆਂ ਹੁੰਦੀਆਂ ਹਨ ਅਤੇ ਉੱਚੀ ਸ਼ੁੱਧਤਾ ਪ੍ਰਦਾਨ ਕਰਦੀਆਂ ਹਨ।

ਟੋਕਨ ਦੀ ਬਚਤ ਕਿਉਂ ਮਹੱਤਵਪੂਰਨ ਹੈ

ਟੋਕਨ ਦੀ ਗਿਣਤੀ ਸਿੱਧੇ ਤੌਰ 'ਤੇ API ਬਿੱਲਾਂ ਵਿੱਚ ਬਦਲ ਜਾਂਦੀ ਹੈ। ਇੱਕ ਆਟੋਮੇਟਡ ਵੀਡੀਓ-ਐਡੀਟਿੰਗ ਟੂਲ ਬਣਾ ਰਹੇ ਡਿਵੈਲਪਰ ਲਈ, ਪ੍ਰਤੀ ਸੈਕਿੰਡ ਇੱਕ ਫਰੇਮ ਦੀ ਰਫ਼ਤਾਰ ਨਾਲ ਪ੍ਰੋਸੈਸ ਕੀਤੀ ਗਈ 90 ਮਿੰਟ ਦੀ ਵੀਡੀਓ ਦਸ ਲੱਖਾਂ ਟੋਕਨ ਪੈਦਾ ਕਰ ਸਕਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਲਾਗਤ ਸਮੱਗਰੀ ਦੇ ਪ੍ਰਤੀ ਘੰਟੇ ਸੈਂਕੜੇ ਡਾਲਰਾਂ ਤੱਕ ਪਹੁੰਚ ਸਕਦੀ ਹੈ। 88% ਦੀ ਕਮੀ ਉਸ ਅੰਕੜੇ ਨੂੰ ਕੁਝ ਦਸ ਡਾਲਰਾਂ ਤੱਕ ਗਿਰਾ ਦਿੰਦੀ ਹੈ, ਜਿਸ ਨਾਲ ਸਟਾਰਟਅੱਪਸ ਅਤੇ ਛੋਟੀਆਂ ਟੀਮਾਂ ਲਈ ਵੱਡੇ ਪੱਧਰ 'ਤੇ ਵੀਡੀਓ ਵਿਸ਼ਲੇਸ਼ਣ ਦੇ ਰਾਹ ਖੁੱਲ੍ਹ ਜਾਂਦੇ ਹਨ ਜੋ ਪਹਿਲਾਂ ਬਹੁਤ ਜ਼ਿਆਦਾ ਬਿੱਲਾਂ ਦਾ ਸਾਹਮਣਾ ਕਰਦੇ ਸਨ।

ਲਾਗਤ ਦਾ ਫਾਇਦਾ ਪ੍ਰਯੋਗ ਕਰਨ ਦੀ ਰੁਕਾਵਟ ਨੂੰ ਵੀ ਘਟਾਉਂਦਾ ਹੈ। ਪਹਿਲਾਂ, ਇੰਜੀਨੀਅਰਾਂ ਨੇ ਮੁੱਖ ਪਲਾਂ ਦਾ ਪਤਾ ਲਗਾਉਣ, ਪ੍ਰਸੰਗਿਕ ਕਲਿੱਪਾਂ ਕੱਢਣ ਅਤੇ ਉਹਨਾਂ ਨੂੰ ਮਾਡਲ ਵਿੱਚ ਵਾਪਸ ਭੇਜਣ ਲਈ ਕਸਟਮ ਕੋਡ ਲਿਖਿਆ ਸੀ। Gemini API ਵਿੱਚ agentic ਵਿਜ਼ਨ ਦੇ ਸ਼ਾਮਲ ਹੋਣ ਨਾਲ, ਡਿਵੈਲਪਰ Google AI Studio ਜਾਂ Gemini Enterprise Agent Platform ਵਿੱਚ ਪ੍ਰੋਸੈਸਿੰਗ ਕੌਂਫਿਗਰੇਸ਼ਨ ਨੂੰ “agentic” 'ਤੇ ਟੌਗਲ ਕਰਕੇ ਇਸ ਫੀਚਰ ਨੂੰ ਚਾਲੂ ਕਰ ਸਕਦੇ ਹਨ। Google ਮਿਆਰੀ Gemini ਟੋਕਨ ਰੇਟ ਨੂੰ ਬਰਕਰਾਰ ਰੱਖਦਾ ਹੈ; ਸਮਾਰਟ ਸੈਂਪਲਿੰਗ ਲਈ ਕੋਈ ਵਾਧੂ ਸਰਚਾਰਜ ਨਹੀਂ ਹੈ।

ਅੰਦਾਜ਼ੇ ਤੋਂ ਬਿਨਾਂ ਸ਼ੁੱਧਤਾ

ਕਿਉਂਕਿ ਮਾਡਲ ਫੈਸਲਾ ਕਰਦਾ ਹੈ ਕਿ ਕਿੱਥੇ ਦੇਖਣਾ ਹੈ, ਇਹ ਇੱਕ ਸੈਕਿੰਡ ਤੋਂ ਘੱਟ ਸਮੇਂ ਦੀਆਂ ਘਟਨਾਵਾਂ ਨੂੰ ਪਛਾਣ ਸਕਦਾ ਹੈ—ਕੁਝ ਅਜਿਹਾ ਜੋ ਇੱਕ ਸਟੈਟਿਕ 1 FPS ਸੈਂਪਲ ਲਾਜ਼ਮੀ ਤੌਰ 'ਤੇ ਮਿਸ ਕਰ ਦੇਵੇਗਾ। ਕਸਰਤ ਵਾਲੀ ਵੀਡੀਓ ਵਿੱਚ ਦੁਹਰਾਓ ਦੀ ਗਿਣਤੀ ਕਰਨ, ਭੀੜ ਵਾਲੇ ਸੀਨ ਵਿੱਚ ਕਿਸੇ ਵਸਤੂ ਨੂੰ ਟਰੈਕ ਕਰਨ, ਜਾਂ ਸੁਰੱਖਿਆ ਫੁਟੇਜ ਵਿੱਚ ਅਚਾਨਕ ਅਸਧਾਰਨ ਘਟਨਾਵਾਂ ਨੂੰ ਫੜਨ ਲਈ ਇਹ ਸ਼ੁੱਧਤਾ ਮਹੱਤਵਪੂਰਨ ਹੈ। ਜਦੋਂ ਮਾਡਲ ਇੱਕ ਉਮੀਦਜਨਕ ਵਿੰਡੋ ਨੂੰ ਫਲੈਗ ਕਰਦਾ ਹੈ, ਤਾਂ ਇਹ ਉਸ ਹਿੱਸੇ ਲਈ ਫਰੇਮ-ਰੇਟ ਨੂੰ ਆਪਣੇ ਆਪ ਵਧਾ ਦਿੰਦਾ ਹੈ, ਅਤੇ ਸਿਰਫ਼ ਉੱਥੇ ਹੀ ਉੱਚ-ਗੁਣਵੱਤਾ ਵਾਲਾ ਡੇਟਾ ਪ੍ਰਦਾਨ ਕਰਦਾ ਹੈ ਜਿੱਥੇ ਇਸਦੀ ਲੋੜ ਹੁੰਦੀ ਹੈ।

ਇਹੀ ਮਕੈਨਿਜ਼ਮ “Ask YouTube” ਵਰਗੇ ਉਪਭੋਗਤਾਵਾਂ ਲਈ ਫੀਚਰਾਂ ਨੂੰ ਚਲਾਉਂਦਾ ਹੈ, ਜਿੱਥੇ ਉਪਭੋਗਤਾ ਵੀਡੀਓ ਚੱਲਣ ਦੌਰਾਨ ਵਿਜ਼ੂਅਲ ਸਵਾਲ ਪੁੱਛਦੇ ਹਨ ਅਤੇ ਅਸਲ ਵਿਜ਼ੂਅਲ ਸਮੱਗਰੀ ਦੇ ਅਧਾਰ 'ਤੇ ਉੱਤਰ ਪ੍ਰਾਪਤ ਕਰਦੇ ਹਨ। ਮਾਡਲ ਨੂੰ ਭੇਜੀ ਗਈ ਵੀਡੀਓ ਦੀ ਮਾਤਰਾ ਨੂੰ ਸੀਮਤ ਕਰਕੇ, ਇਹ ਫੀਚਰ ਤੇਜ਼ੀ ਨਾਲ ਅਤੇ ਘੱਟ ਲਾਗਤ 'ਤੇ ਜਵਾਬ ਦਿੰਦਾ ਹੈ, ਜਿਸ ਨਾਲ ਡੂੰਘਾਈ ਨੂੰ ਕੁਰਬਾਨ ਕੀਤੇ ਬਿਨਾਂ ਉਪਭੋਗਤਾ ਅਨੁਭਵ ਵਿੱਚ ਸੁਧਾਰ ਹੁੰਦਾ ਹੈ।

ਸੰਭਾਵੀ ਸੀਮਾਵਾਂ ਅਤੇ ਸਮਝੌਤੇ

Agentic ਪਹੁੰਚ ਕੋਈ ਜਾਦੂਈ ਹੱਲ ਨਹੀਂ ਹੈ। ਟੋਕਨ ਦੀ ਵਰਤੋਂ ਡਰਾਮੇਟਿਕ ਤੌਰ 'ਤੇ ਘਟਦੀ ਹੈ, ਪਰ ਮ

  • Adoption patterns: Early reports from developers using the agentic mode will reveal whether the cost savings hold up across education, entertainment, surveillance, and other domains.
  • Pricing adjustments: Google may tweak token pricing or add tiered plans if demand for high-volume video analysis spikes.
  • Feature extensions: Embedding the same reasoning loop into more consumer products could surface new use cases and drive broader awareness of token-efficient video AI.
  • Benchmark evolution: As more teams test on real-world datasets, the community will refine the 1H-VideoQA and LVBench scores, potentially uncovering edge cases where static sampling still outperforms the agentic method.

Bottom line

Google’s agentic video analysis lets developers cut token consumption by up to 88 % while gaining finer temporal insight. The trade-off is a modest increase in processing complexity and variable token counts, but for many long-form video applications the cost savings and ease of integration outweigh those concerns. Teams building video-centric AI should evaluate the new mode quickly; the economics of scaling video understanding may have just shifted.