Google ประกาศว่าตระกูล Gemini ของตนรองรับโหมดการวิเคราะห์วิดีโอแบบ “agentic” ซึ่งสามารถลดการใช้โทเคน (token) ได้มากถึง 88% ในการทดสอบมาตรฐาน (benchmarks) ซึ่งเป็นการเปลี่ยนแปลงที่อาจทำให้ AI สำหรับวิดีโอขนาดยาวมีราคาถูกลงอย่างมากสำหรับนักพัฒนา

โหมดใหม่นี้จะเข้ามาแทนที่วิธีการแบบเฟรมต่อเฟรมแบบเดิม ซึ่งโดยปกติจะเป็นการสุ่มตัวอย่างแบบคงที่หนึ่งเฟรมต่อวินาที ด้วยลูปที่ขับเคลื่อนโดยโมเดล (model-driven loop) ซึ่งจะตัดสินใจว่าควรตรวจสอบส่วนใดของวิดีโอ ด้วยความเร็วเท่าใด และผ่านรูปแบบใด (เฟรม, เสียง หรือคำบรรยาย) การดึงมาเฉพาะสัญญาณที่จำเป็นสำหรับคำถามเฉพาะเจาะจงจะช่วยลดปริมาณข้อมูลที่ส่งไปยังโมเดลภาษา ในขณะที่ยังสามารถตรวจจับเหตุการณ์ที่เกิดขึ้นในเสี้ยววินาทีซึ่งการสุ่มตัวอย่างแบบหยาบๆ อาจพลาดไปได้

จากการสุ่มตัวอย่างแบบคงที่ สู่การมองเห็นแบบอัตโนมัติ (Autonomous Vision)

ความสามารถด้านวิดีโอในยุคแรกของ Gemini บังคับให้นักพัฒนาต้องเลือกอัตราการสุ่มตัวอย่าง (sampling rate) ไว้ล่วงหน้า อัตราที่สูงขึ้นหมายถึงโทเคนมากขึ้นและค่าใช้จ่ายที่สูงขึ้น ส่วนอัตราที่ต่ำลงก็เสี่ยงที่จะพลาดการตัดต่อที่รวดเร็ว ส่วนรูปแบบ agentic ใหม่ ซึ่งปัจจุบันมีให้ใช้งานสำหรับ Gemini 3.7 Flash, 3.6 Flash และ 3.5 Flash-Lite ได้ฝังวงจร “think-act-observe” (คิด-ทำ-สังเกต) ลงใน API โดยตรง ขั้นแรก โมเดลจะใช้เหตุผลเกี่ยวกับงาน จากนั้นจะเลือกส่วนที่จะตรวจสอบ และสุดท้ายจะสังเกตเฟรม คลิปเสียง หรือข้อความที่เลือก หากส่วนนั้นดูมีความสำคัญ โมเดลจะทำการสุ่มตัวอย่างใหม่ด้วยความละเอียดที่สูงขึ้นในทันที

การสุ่มตัวอย่างแบบไดนามิกนี้ช่วยให้โมเดลสามารถสำรวจฟุตเทจที่มีความยาวหลายชั่วโมงได้ เช่น การบรรยายเต็มรูปแบบหรือการบันทึกวิดีโอหลายชั่วโมง โดยไม่ต้องใช้โทเคนจำนวนมหาศาล ผลการทดสอบที่เลียนแบบการตอบคำถามจากวิดีโอในโลกความเป็นจริง (1H-VideoQA) และงานด้านความเข้าใจวิดีโอในวงกว้าง (LVBench) แสดงให้เห็นว่าการใช้คำถามแบบเดียวกันสามารถทำได้โดยใช้โทเคนเพียงประมาณหนึ่งในสิบของงบประมาณเดิม ในขณะที่ให้ความแม่นยำที่สูงกว่า

ทำไมการประหยัดโทเคนจึงสำคัญ

จำนวนโทเคนส่งผลโดยตรงต่อค่าใช้จ่าย API สำหรับนักพัฒนาที่สร้างเครื่องมือตัดต่อวิดีโออัตโนมัติ วิดีโอความยาว 90 นาทีที่ประมวลผลด้วยอัตราหนึ่งเฟรมต่อวินาทีอาจสร้างโทเคนได้หลายสิบล้านโทเคน ซึ่งจะผลักดันค่าใช้จ่ายให้สูงถึงหลายร้อยดอลลาร์ต่อชั่วโมงของเนื้อหา การลดลง 88% จะทำให้ตัวเลขนั้นลดลงเหลือเพียงไม่กี่สิบดอลลาร์ ซึ่งช่วยเปิดโอกาสให้สตาร์ทอัพและทีมขนาดเล็กที่เคยเผชิญกับค่าใช้จ่ายที่สูงเกินเอื้อมสามารถเข้าถึงการวิเคราะห์วิดีโอขนาดใหญ่ได้

ความได้เปรียบด้านต้นทุนยังช่วยลดอุปสรรคในการทดลองใช้งาน ก่อนหน้านี้ วิศวกรต้องเขียนโค้ดแบบกำหนดเองเพื่อตรวจจับช่วงเวลาสำคัญ ดึงคลิปที่เกี่ยวข้อง และส่งกลับไปยังโมเดล แต่ด้วยการมองเห็นแบบ agentic ที่รวมอยู่ใน Gemini API นักพัฒนาสามารถเปิดใช้งานฟีเจอร์นี้ได้เพียงแค่เปลี่ยนการตั้งค่าการประมวลผลเป็น “agentic” ใน Google AI Studio หรือ Gemini Enterprise Agent Platform ทั้งนี้ Google ยังคงอัตราโทเคนมาตรฐานของ Gemini ไว้ โดยไม่มีการเก็บค่าธรรมเนียมเพิ่มเติมสำหรับการสุ่มตัวอย่างที่ชาญฉลาดขึ้นนี้

ความแม่นยำโดยไม่ต้องคาดเดา

เนื่องจากโมเดลเป็นผู้ตัดสินใจว่าจะดูที่จุดใด มันจึงสามารถตรวจจับเหตุการณ์ที่สั้นกว่าหนึ่งวินาทีได้ ซึ่งเป็นสิ่งที่การสุ่มตัวอย่างแบบ 1 FPS คงที่ย่อมพลาดไปอย่างหลีกเลี่ยงไม่ได้ ความแม่นยำนี้มีความสำคัญสำหรับการนับจำนวนครั้งในการออกกำลังกาย การติดตามวัตถุผ่านฉากที่วุ่นวาย หรือการแจ้งเตือนความผิดปกติที่เกิดขึ้นอย่างกะทันหันในฟุตเทจรักษาความปลอดภัย เมื่อโมเดลตรวจพบช่วงเวลาที่น่าสนใจ มันจะเพิ่มอัตราเฟรม (frame-rate) สำหรับช่วงนั้นโดยอัตโนมัติ เพื่อให้ได้ข้อมูลที่มีความละเอียดสูงเฉพาะในจุดที่สำคัญเท่านั้น

กลไกเดียวกันนี้ยังขับเคลื่อนฟีเจอร์สำหรับผู้บริโภค เช่น “Ask YouTube” ที่ผู้ใช้สามารถตั้งคำถามเชิงภาพในขณะที่วิดีโอกำลังเล่น และได้รับคำตอบที่อ้างอิงจากเนื้อหาภาพจริง การจำกัดปริมาณวิดีโอที่ส่งไปยังโมเดลช่วยให้ฟีเจอร์นี้ตอบสนองได้เร็วขึ้นและมีต้นทุนที่ต่ำลง ซึ่งช่วยปรับปรุงประสบการณ์ของผู้ใช้โดยไม่สูญเสียความลึกของข้อมูล

ข้อจำกัดและสิ่งที่ต้องแลกที่อาจเกิดขึ้น

แนวทางแบบ agentic ไม่ใช่คำตอบสำหรับทุกปัญหา แม้การใช้โทเคนจะลดลงอย่างมาก แต่โมเดลยังคงต้องรันลูปภายในของมันเอง ซึ่งอาจเพิ่มความหน่วง (latency) เมื่อเทียบกับการประมวลผลผ่านเฟรมที่สุ่มตัวอย่างไว้ล่วงหน้าโดยตรง นักพัฒนาที่เน้นแอปพลิเคชันแบบเรียลไทม์อาจต้องสร้างสมดุลระหว่างต้นทุนโทเคนที่ต่ำลงกับเวลาในการประมวลผลที่เพิ่มขึ้น

ความสามารถในการคาดการณ์เป็นอีกหนึ่งข้อกังวล เนื่องจากโมเดลเป็นผู้ตัดสินใจว่าจะสุ่มตัวอย่างส่วนใด จำนวนโทเคนสำหรับวิดีโอหนึ่งๆ จึงอาจแตกต่างกันไปในแต่ละครั้งที่รัน ทีมที่ต้องการควบคุมงบประมาณอย่างเข้มงวดอาจจำเป็นต้องสร้างระบบตรวจสอบการใช้โทเคน โดยเฉพาะในช่วงเริ่มต้นของการรวมระบบ (integration)

สุดท้ายนี้ การเปิดตัวนี้จำกัดอยู่เพียงโมเดลตระกูล Flash ของ Gemini เท่านั้น โปรเจกต์ที่พึ่งพาโมเดลรุ่นเก่าหรือรุ่นที่ไม่ใช่ Flash จะไม่ได้รับประโยชน์จนกว่าจะมีการย้ายระบบ (migrate) ซึ่งอาจต้องใช้ความพยายามในการพัฒนาเพิ่มเติม

สิ่งที่ต้องจับตามองต่อไป

  • รูปแบบการนำไปใช้งาน: รายงานเบื้องต้นจากนักพัฒนาที่ใช้งานโหมด agentic จะเผยให้เห็นว่าการประหยัดต้นทุนนั้นยังคงได้ผลในด้านการศึกษา ความบันเทิง การเฝ้าระวัง และโดเมนอื่นๆ หรือไม่
  • การปรับเปลี่ยนราคา: Google อาจปรับเปลี่ยนราคาโทเคนหรือเพิ่มแผนการใช้งานแบบแบ่งระดับ (tiered plans) หากความต้องการในการวิเคราะห์วิดีโอปริมาณมากพุ่งสูงขึ้น
  • การขยายฟีเจอร์: การนำ reasoning loop แบบเดียวกันนี้ไปใส่ไว้ในผลิตภัณฑ์สำหรับผู้บริโภคมากขึ้น อาจทำให้เกิดกรณีการใช้งานใหม่ๆ และสร้างการรับรู้ที่กว้างขวางขึ้นเกี่ยวกับ AI วิดีโอที่ประหยัดโทเคน
  • วิวัฒนาการของเกณฑ์มาตรฐาน (Benchmark): เมื่อมีทีมทดสอบกับชุดข้อมูลในโลกแห่งความเป็นจริงมากขึ้น ชุมชนจะทำการปรับปรุงคะแนน 1H-VideoQA และ LVBench ซึ่งอาจนำไปสู่การค้นพบ edge cases ที่การสุ่มตัวอย่างแบบคงที่ (static sampling) ยังคงให้ผลลัพธ์ที่ดีกว่าวิธีการแบบ agentic

บทสรุป

การวิเคราะห์วิดีโอแบบ agentic ของ Google ช่วยให้นักพัฒนาสามารถลดการใช้โทเคนลงได้ถึง 88% ในขณะที่ได้รับข้อมูลเชิงลึกด้านเวลาที่ละเอียดขึ้น สิ่งที่ต้องแลกมาคือความซับซ้อนในการประมวลผลที่เพิ่มขึ้นเล็กน้อยและจำนวนโทเคนที่ผันผวน แต่สำหรับแอปพลิเคชันวิดีโอขนาดยาวจำนวนมาก การประหยัดต้นทุนและความง่ายในการรวมระบบนั้นคุ้มค่ากว่าข้อกังวลเหล่านั้น ทีมที่สร้าง AI ที่เน้นวิดีโอเป็นหลักควรประเมินโหมดใหม่นี้อย่างรวดเร็ว เพราะเศรษฐศาสตร์ของการขยายขอบเขตความเข้าใจวิดีโออาจเพิ่งมีการเปลี่ยนแปลง