Google thông báo rằng dòng Gemini của họ hiện đã hỗ trợ chế độ phân tích video "agentic" (có tính tác nhân), có thể cắt giảm mức sử dụng token lên tới 88% trên các bài kiểm tra tiêu chuẩn, một sự thay đổi có thể giúp AI video thời lượng dài trở nên rẻ hơn đáng kể cho các nhà phát triển.
Chế độ mới này thay thế cách tiếp cận từng khung hình cũ—thường là lấy mẫu cố định một khung hình mỗi giây—bằng một vòng lặp do mô hình điều khiển để quyết định phần nào của video cần kiểm tra, tốc độ như thế nào và thông qua phương thức nào (khung hình, âm thanh hoặc bản ghi văn bản). Bằng cách chỉ trích xuất những tín hiệu cần thiết cho một truy vấn cụ thể, hệ thống sẽ cắt giảm lượng dữ liệu gửi đến mô hình ngôn ngữ trong khi vẫn bắt được các sự kiện diễn ra trong chưa đầy một giây mà phương pháp lấy mẫu thô có thể bỏ lỡ.
Từ Lấy mẫu Cố định đến Thị giác Tự trị
Các khả năng video trước đây của Gemini buộc các nhà phát triển phải chọn trước tỷ lệ lấy mẫu. Tỷ lệ cao hơn đồng nghĩa với việc tốn nhiều token hơn và hóa đơn cao hơn; tỷ lệ thấp hơn lại có nguy cơ bỏ lỡ các cảnh cắt nhanh. Biến thể agentic mới, hiện khả dụng cho Gemini 3.7 Flash, 3.6 Flash và 3.5 Flash-Lite, tích hợp trực tiếp chu trình "suy nghĩ-hành động-quan sát" vào API. Đầu tiên, mô hình suy luận về nhiệm vụ. Tiếp theo, nó chọn một phân đoạn để kiểm tra. Cuối cùng, nó quan sát các khung hình, đoạn âm thanh hoặc các đoạn trích bản ghi văn bản đã chọn. Nếu một phân đoạn có vẻ tiềm năng, mô hình sẽ lấy mẫu lại phân đoạn đó với độ chi tiết cao hơn ngay lập tức.
Việc lấy mẫu linh hoạt này cho phép mô hình duyệt qua hàng giờ phim—chẳng hạn như một bài giảng dài hoặc một bản ghi âm kéo dài nhiều giờ—mà không tiêu tốn hàng triệu token. Các bài kiểm tra mô phỏng việc trả lời câu hỏi về video trong thế giới thực (1H-VideoQA) và các tác vụ hiểu video rộng hơn (LVBench) cho thấy cùng một truy vấn có thể hoàn thành với ngân sách token chỉ bằng khoảng một phần mười trong khi vẫn mang lại độ chính xác cao hơn.
Tại sao việc Tiết kiệm Token lại Quan trọng
Số lượng token chuyển đổi trực tiếp thành hóa đơn API. Đối với một nhà phát triển đang xây dựng công cụ chỉnh sửa video tự động, một video dài 90 phút được xử lý ở mức một khung hình mỗi giây có thể tạo ra hàng chục triệu token, đẩy chi phí lên tới hàng trăm đô la cho mỗi giờ nội dung. Việc giảm 88% sẽ đưa con số đó xuống còn vài chục đô la, mở ra cơ hội phân tích video quy mô lớn cho các startup và các nhóm nhỏ hơn, những đối tượng trước đây phải đối mặt với hóa đơn đắt đỏ.
Lợi thế về chi phí cũng làm giảm rào cản thử nghiệm. Trước đây, các kỹ sư phải viết mã tùy chỉnh để phát hiện các khoảnh khắc quan trọng, trích xuất các clip liên quan và đưa chúng trở lại mô hình. Với thị giác agentic được tích hợp sẵn vào Gemini API, các nhà phát triển có thể kích hoạt tính năng này bằng cách chuyển cấu hình xử lý sang "agentic" trong Google AI Studio hoặc Gemini Enterprise Agent Platform. Google vẫn giữ nguyên mức giá token Gemini tiêu chuẩn; không có phụ phí bổ sung cho việc lấy mẫu thông minh hơn này.
Độ chính xác mà không cần Phỏng đoán
Vì mô hình tự quyết định nơi cần nhìn, nó có thể phát hiện các sự kiện ngắn hơn một giây—điều mà một mẫu 1 FPS tĩnh chắc chắn sẽ bỏ lỡ. Độ chính xác này rất quan trọng để đếm số lần lặp lại trong một video tập thể dục, theo dõi một vật thể qua một cảnh quay đông đúc hoặc gắn cờ các điểm bất thường đột ngột trong cảnh quay an ninh. Khi mô hình đánh dấu một khung hình tiềm năng, nó sẽ tự động tăng cường tốc độ khung hình cho phân đoạn đó, cung cấp dữ liệu độ trung thực cao chỉ ở những nơi thực sự cần thiết.
Cơ chế tương tự cũng cung cấp sức mạnh cho các tính năng dành cho người dùng như "Ask YouTube", nơi người dùng đặt các câu hỏi về hình ảnh trong khi video đang phát và nhận được câu trả lời dựa trên nội dung hình ảnh thực tế. Bằng cách giới hạn lượng video gửi đến mô hình, tính năng này phản hồi nhanh hơn và với chi phí thấp hơn, cải thiện trải nghiệm người dùng mà không làm giảm độ sâu của thông tin.
Các Giới hạn và Sự đánh đổi Tiềm ẩn
Cách tiếp cận agentic không phải là một giải pháp vạn năng. Mức sử dụng token giảm mạnh, nhưng mô hình vẫn phải chạy vòng lặp nội bộ, điều này có thể làm tăng độ trễ so với việc quét trực tiếp qua các khung hình đã được lấy mẫu trước. Các nhà phát triển tập trung vào các ứng dụng thời gian thực có thể cần cân bằng giữa chi phí token thấp hơn và thời gian xử lý bổ sung.
Tính dự đoán được là một mối quan tâm khác. Vì mô hình quyết định phân đoạn nào sẽ được lấy mẫu, số lượng token chính xác cho một video nhất định có thể thay đổi giữa các lần chạy. Các nhóm yêu cầu ngân sách nghiêm ngặt có thể cần xây dựng hệ thống giám sát mức tiêu thụ token, đặc biệt là trong giai đoạn đầu tích hợp.
Cuối cùng, việc triển khai hiện chỉ giới hạn ở các biến thể Flash của Gemini. Các dự án dựa trên các mô hình cũ hơn hoặc không phải Flash sẽ không được hưởng lợi cho đến khi họ thực hiện chuyển đổi, điều này có thể đòi hỏi thêm nỗ lực phát triển.
Những điều cần theo dõi tiếp theo
- Mô hình áp dụng: Các báo cáo sớm từ các nhà phát triển sử dụng chế độ agentic sẽ cho thấy liệu mức tiết kiệm chi phí có duy trì được trong các lĩnh vực giáo dục, giải trí, giám sát và các lĩnh vực khác hay không.
- Điều chỉnh giá: Google có thể điều chỉnh giá token hoặc thêm các gói dịch vụ phân cấp nếu nhu cầu phân tích video khối lượng lớn tăng đột biến.
- Mở rộng tính năng: Việc tích hợp cùng một vòng lặp suy luận vào nhiều sản phẩm tiêu dùng hơn có thể làm nảy sinh các trường hợp sử dụng mới và thúc đẩy nhận thức rộng rãi hơn về AI video tiết kiệm token.
- Sự tiến hóa của benchmark: Khi có thêm nhiều đội ngũ thử nghiệm trên các tập dữ liệu thực tế, cộng đồng sẽ tinh chỉnh các điểm số 1H-VideoQA và LVBench, có khả năng phát hiện ra các trường hợp biên mà phương pháp lấy mẫu tĩnh vẫn vượt trội hơn phương pháp agentic.
Điểm mấu chốt
Khả năng phân tích video agentic của Google cho phép các nhà phát triển cắt giảm mức tiêu thụ token lên đến 88% trong khi vẫn đạt được những hiểu biết sâu sắc hơn về mặt thời gian. Sự đánh đổi là sự gia tăng khiêm tốn về độ phức tạp xử lý và số lượng token biến đổi, nhưng đối với nhiều ứng dụng video thời lượng dài, việc tiết kiệm chi phí và sự dễ dàng khi tích hợp sẽ vượt xa những lo ngại đó. Các đội ngũ đang xây dựng AI tập trung vào video nên nhanh chóng đánh giá chế độ mới này; bài toán kinh tế của việc mở rộng quy mô hiểu video có thể vừa có sự thay đổi.
