Google mengumumkan bahawa keluarga Gemini kini menyokong mod analisis video “agentic” yang boleh mengurangkan penggunaan token sebanyak 88% pada penanda aras standard, satu peralihan yang boleh menjadikan AI video berdurasi panjang jauh lebih murah untuk pembangun.
Mod baharu ini menggantikan pendekatan bingkai-demi-bingkai yang lama—biasanya pensampelan tetap satu bingkai sesaat—dengan gelung dipacu model yang memutuskan bahagian video mana yang perlu diperiksa, pada kelajuan berapa, dan melalui modaliti mana (bingkai, audio, atau transkrip). Dengan hanya menarik isyarat yang diperlukan untuk pertanyaan khusus, sistem ini mengurangkan data yang dihantar ke model bahasa sambil tetap dapat menangkap peristiwa bawah sesaat yang mungkin terlepas jika menggunakan pensampelan kasar.
Daripada Pensampelan Tetap kepada Visi Autonomi
Keupayaan video Gemini sebelum ini memaksa pembangun untuk memilih kadar pensampelan terlebih dahulu. Kadar yang lebih tinggi bermaksud lebih banyak token dan bil yang lebih tinggi; kadar yang lebih rendah pula berisiko terlepas potongan pantas. Varian agentic baharu, yang kini tersedia untuk Gemini 3.7 Flash, 3.6 Flash dan 3.5 Flash-Lite, menyematkan kitaran “fikir-bertindak-perhati” secara terus ke dalam API. Pertama, model akan menaakul tentang tugasan tersebut. Seterusnya, ia memilih segmen untuk diperiksa. Akhir sekali, ia memerhati bingkai, klip audio, atau petikan transkrip yang dipilih. Jika sesuatu segmen kelihatan menjanjikan, model akan melakukan pensampelan semula dengan ketelitian yang lebih halus secara langsung.
Pensampelan dinamik ini membolehkan model menelusuri rakaman berjam-jam lamanya—bayangkan kuliah berdurasi penuh atau rakaman berbilang jam—tanpa membazirkan jutaan token. Penanda aras yang meniru sistem soal-jawab video dunia sebenar (1H-VideoQA) dan tugasan pemahaman video yang lebih luas (LVBench) menunjukkan pertanyaan yang sama dapat diselesaikan dengan bajet token kira-kira satu persepuluh daripada sebelumnya, sambil memberikan ketepatan yang lebih tinggi.
Mengapa Penjimatan Token Itu Penting
Bilangan token diterjemahkan secara langsung kepada bil API. Bagi pembangun yang membina alat penyuntingan video automatik, video berdurasi 90 minit yang diproses pada kadar satu bingkai sesaat boleh menjana puluhan juta token, menyebabkan kos melonjak sehingga ratusan dolar bagi setiap jam kandungan. Pengurangan sebanyak 88% menurunkan angka tersebut kepada hanya beberapa puluh dolar, sekali gus membuka peluang analisis video berskala besar kepada syarikat pemula (startup) dan pasukan kecil yang sebelum ini menghadapi bil yang terlalu tinggi.
Kelebihan kos ini juga merendahkan halangan untuk eksperimen. Sebelum ini, jurutera perlu menulis kod tersuai untuk mengesan detik penting, mengekstrak klip yang relevan, dan memasukkannya semula ke dalam model. Dengan visi agentic yang telah disepadukan ke dalam API Gemini, pembangun boleh mengaktifkan ciri ini dengan menukar konfigurasi pemprosesan kepada “agentic” dalam Google AI Studio atau Gemini Enterprise Agent Platform. Google mengekalkan kadar token Gemini standard; tiada caj tambahan untuk pensampelan yang lebih pintar ini.
Ketepatan Tanpa Tekaan
Oleh kerana model tersebut memutuskan di mana untuk melihat, ia dapat mengesan peristiwa yang lebih pendek daripada sesaat—sesuatu yang pasti akan terlepas jika menggunakan pensampelan statik 1 FPS. Ketepatan ini penting untuk mengira ulangan dalam video senaman, menjejaki objek merentasi babak yang sesak, atau menandakan anomali mengejut dalam rakaman keselamatan. Apabila model menandakan tetingkap yang menjanjikan, ia secara automatik meningkatkan kadar bingkai untuk bahagian tersebut, memberikan data berketepatan tinggi hanya pada bahagian yang diperlukan.
Mekanisme yang sama turut memacu ciri-ciri berorientasikan pengguna seperti “Ask YouTube,” di mana pengguna boleh mengajukan soalan visual semasa video dimainkan dan menerima jawapan yang berasaskan kandungan visual sebenar. Dengan mengehadkan jumlah video yang dihantar ke model, ciri ini bertindak balas dengan lebih pantas dan pada kos yang lebih rendah, sekali gus menambah baik pengalaman pengguna tanpa mengorbankan kedalaman maklumat.
Potensi Had dan Imbangan
Pendekatan agentic bukanlah penyelesaian ajaib. Penggunaan token menurun secara drastik, tetapi model masih menjalankan gelung dalamannya, yang boleh menambah kependaman (latency) berbanding proses terus ke atas bingkai yang telah disampel terlebih dahulu. Pembangun yang memfokuskan kepada aplikasi masa nyata mungkin perlu mengimbangi kos token yang lebih rendah dengan masa pemprosesan tambahan.
Kebolehramalan juga merupakan satu kebimbangan. Oleh kerana model memutuskan segmen mana yang perlu disampel, jumlah token yang tepat bagi sesuatu video boleh berbeza bagi setiap pelaksanaan. Pasukan yang memerlukan belanjawan yang ketat mungkin perlu membina pemantauan terhadap penggunaan token, terutamanya semasa fasa integrasi awal.
Akhir sekali, pelancaran ini terhad kepada varian Flash bagi Gemini. Projek yang bergantung kepada model lama atau bukan Flash tidak akan mendapat manfaat sehingga mereka melakukan migrasi, yang mungkin melibatkan usaha pembangunan tambahan.
Apa yang Perlu Diperhatikan Seterusnya
- Corak penggunaan: Laporan awal daripada pembangun yang menggunakan mod agentic akan mendedahkan sama ada penjimatan kos tersebut kekal berkesan merentasi bidang pendidikan, hiburan, pengawasan, dan domain lain.
- Pelarasan harga: Google mungkin mengubah suai harga token atau menambah pelan bertingkat jika permintaan untuk analisis video volum tinggi melonjak.
- Pelanjutan ciri: Menyematkan gelung penaakulan yang sama ke dalam lebih banyak produk pengguna boleh memunculkan kes penggunaan baharu dan memacu kesedaran yang lebih luas tentang AI video yang cekap token.
- Evolusi penanda aras: Apabila lebih banyak pasukan menguji pada set data dunia nyata, komuniti akan memperhalusi skor 1H-VideoQA dan LVBench, yang berpotensi mendedahkan kes pinggir (edge cases) di mana pensampelan statik masih mengatasi kaedah agentic.
Kesimpulan
Analisis video agentic Google membolehkan pembangun mengurangkan penggunaan token sehingga 88% sambil memperoleh wawasan temporal yang lebih terperinci. Imbalannya adalah peningkatan kecil dalam kompleksiti pemprosesan dan jumlah token yang berubah-ubah, tetapi bagi banyak aplikasi video berdurasi panjang, penjimatan kos dan kemudahan integrasi mengatasi kebimbangan tersebut. Pasukan yang membina AI berpusatkan video harus menilai mod baharu ini dengan segera; ekonomi dalam menskalakan pemahaman video mungkin baru sahaja berubah.
