Google mengumumkan bahwa keluarga Gemini kini mendukung mode analisis video “agentic” yang dapat memangkas penggunaan token hingga 88% pada tolok ukur standar, sebuah pergeseran yang dapat membuat AI video berdurasi panjang menjadi jauh lebih murah bagi pengembang.
Mode baru ini menggantikan pendekatan frame-per-frame lama—yang biasanya berupa sampel satu frame per detik yang tetap—dengan loop berbasis model yang memutuskan bagian video mana yang harus diperiksa, pada kecepatan berapa, dan melalui modalitas apa (frame, audio, atau transkrip). Dengan hanya mengambil sinyal yang diperlukan untuk kueri tertentu, sistem ini memangkas data yang dikirim ke model bahasa sambil tetap menangkap peristiwa di bawah satu detik yang mungkin terlewatkan oleh sampel kasar.
Dari Sampling Tetap ke Visi Otonom
Kemampuan video Gemini sebelumnya memaksa pengembang untuk memilih tingkat sampling di awal. Tingkat yang lebih tinggi berarti lebih banyak token dan tagihan yang lebih tinggi; tingkat yang lebih rendah berisiko melewatkan potongan cepat. Varian agentic baru, yang saat ini tersedia untuk Gemini 3.7 Flash, 3.6 Flash, dan 3.5 Flash-Lite, menanamkan siklus “think-act-observe” secara langsung ke dalam API. Pertama, model melakukan penalaran tentang tugas tersebut. Selanjutnya, ia memilih segmen untuk diperiksa. Terakhir, ia mengamati frame, klip audio, atau kutipan transkrip yang dipilih. Jika sebuah segmen terlihat menjanjikan, model akan melakukan sampling ulang dengan granularitas yang lebih halus secara langsung.
Sampling dinamis ini memungkinkan model untuk menelusuri rekaman berjam-jam—seperti kuliah berdurasi penuh atau rekaman berjam-jam—tanpa menghabiskan jutaan token. Tolok ukur yang meniru tanya-jawab video dunia nyata (1H-VideoQA) dan tugas pemahaman video yang lebih luas (LVBench) menunjukkan kueri yang sama dapat diselesaikan dengan anggaran token sekitar sepersepuluh kali lipat sambil memberikan akurasi yang lebih tinggi.
Mengapa Penghematan Token Itu Penting
Jumlah token berkorelasi langsung dengan tagihan API. Bagi pengembang yang membangun alat pengeditan video otomatis, video berdurasi 90 menit yang diproses pada satu frame per detik dapat menghasilkan puluhan juta token, mendorong biaya hingga ratusan dolar per jam konten. Pengurangan sebesar 88% menurunkan angka tersebut menjadi hanya beberapa puluh dolar, membuka analisis video skala besar bagi startup dan tim kecil yang sebelumnya menghadapi tagihan yang sangat mahal.
Keunggulan biaya ini juga menurunkan hambatan untuk eksperimen. Sebelumnya, para insinyur harus menulis kode khusus untuk mendeteksi momen kunci, mengekstrak klip yang relevan, dan memasukkannya kembali ke dalam model. Dengan visi agentic yang sudah terintegrasi ke dalam API Gemini, pengembang dapat mengaktifkan fitur ini dengan mengubah konfigurasi pemrosesan menjadi “agentic” di Google AI Studio atau Gemini Enterprise Agent Platform. Google tetap mempertahankan tarif token Gemini standar; tidak ada biaya tambahan untuk sampling yang lebih cerdas ini.
Presisi Tanpa Tebak-tebakan
Karena model memutuskan ke mana harus melihat, ia dapat mendeteksi peristiwa yang durasinya kurang dari satu detik—sesuatu yang pasti akan terlewatkan oleh sampel 1 FPS statis. Presisi ini penting untuk menghitung repetisi dalam video olahraga, melacak objek di tengah pemandangan yang ramai, atau menandai anomali mendadak dalam rekaman keamanan. Ketika model menandai jendela waktu yang menjanjikan, ia secara otomatis meningkatkan frame rate untuk bagian tersebut, memberikan data fidelitas tinggi hanya pada bagian yang penting.
Mekanisme yang sama juga menggerakkan fitur yang menghadap konsumen seperti “Ask YouTube,” di mana pengguna mengajukan pertanyaan visual saat video diputar dan menerima jawaban yang didasarkan pada konten visual yang sebenarnya. Dengan membatasi jumlah video yang dikirim ke model, fitur ini merespons lebih cepat dan dengan biaya lebih rendah, meningkatkan pengalaman pengguna tanpa mengorbankan kedalaman informasi.
Potensi Batasan dan Trade-off
Pendekatan agentic bukanlah solusi ajaib. Penggunaan token turun drastis, tetapi model tetap menjalankan loop internalnya, yang dapat menambah latensi dibandingkan dengan pemrosesan langsung pada frame yang telah disampling sebelumnya. Pengembang yang berfokus pada aplikasi real-time mungkin perlu menyeimbangkan biaya token yang lebih rendah dengan waktu pemrosesan tambahan.
Prediktabilitas adalah kekhawatiran lainnya. Karena model memutuskan segmen mana yang akan disampling, jumlah token yang tepat untuk video tertentu dapat bervariasi dari satu sesi ke sesi lainnya. Tim yang memerlukan penganggaran ketat mungkin perlu membangun pemantauan terhadap konsumsi token, terutama selama integrasi awal.
Terakhir, peluncuran ini terbatas pada varian Flash dari Gemini. Proyek yang mengandalkan model lama atau non-Flash tidak akan mendapatkan manfaat sampai mereka melakukan migrasi, yang mungkin memerlukan upaya pengembangan tambahan.
Apa yang Perlu Diperhatikan Selanjutnya
- Pola adopsi: Laporan awal dari para pengembang yang menggunakan mode agentic akan mengungkapkan apakah penghematan biaya tetap bertahan di berbagai domain seperti pendidikan, hiburan, pengawasan, dan domain lainnya.
- Penyesuaian harga: Google mungkin akan menyesuaikan harga token atau menambahkan paket bertingkat jika permintaan untuk analisis video bervolume tinggi melonjak.
- Perluasan fitur: Menanamkan loop penalaran yang sama ke dalam lebih banyak produk konsumen dapat memunculkan kasus penggunaan baru dan mendorong kesadaran yang lebih luas tentang AI video yang efisien token.
- Evolusi tolok ukur: Seiring dengan semakin banyaknya tim yang melakukan pengujian pada dataset dunia nyata, komunitas akan menyempurnakan skor 1H-VideoQA dan LVBench, yang berpotensi mengungkap kasus-kasus ekstrem (edge cases) di mana pengambilan sampel statis masih mengungguli metode agentic.
Intinya
Analisis video agentic milik Google memungkinkan pengembang memangkas konsumsi token hingga 88% sambil mendapatkan wawasan temporal yang lebih mendalam. Kompensasinya adalah sedikit peningkatan dalam kompleksitas pemrosesan dan jumlah token yang bervariasi, namun bagi banyak aplikasi video berdurasi panjang, penghematan biaya dan kemudahan integrasi jauh lebih penting daripada kekhawatiran tersebut. Tim yang membangun AI berpusat pada video harus segera mengevaluasi mode baru ini; ekonomi dari penskalaan pemahaman video mungkin saja baru saja berubah.
