ยุคสมัยของ AI ที่มีเพียงแค่รูปแบบดิจิทัลกำลังวิวัฒนาการไปอีกขั้น เมื่อเหล่าสตาร์ทอัพพยายามที่จะเชื่อมช่องว่างระหว่างความฉลาดของซอฟต์แวร์และการลงมือปฏิบัติจริงในโลกกายภาพ Perceptron สตาร์ทอัพน้องใหม่ที่ก่อตั้งโดยอดีตนักวิจัยจาก Meta AI กำลังเป็นผู้นำในการขับเคลื่อนเรื่องนี้ ด้วยการพัฒนาโมเดลการมองเห็น (vision models) ระดับแนวหน้า ที่ออกแบบมาเพื่อช่วยให้เครื่องจักรสามารถนำทางและโต้ตอบกับโลกแห่งความเป็นจริงได้
ก้าวข้ามความต่างแบบขั้วตรงข้าม: โมเดลแบบทั่วไป (Generalist) เทียบกับโมเดลเฉพาะทาง (Narrow Models)
เป็นเวลาหลายปีที่ระบบอัตโนมัติในอุตสาหกรรมต้องติดอยู่ในทางตันทางเทคนิค โดยปกติแล้วเหล่านักพัฒนาจะต้องเลือกระหว่างโมเดลพื้นฐาน (foundation models) ขนาดใหญ่ที่เป็นแบบทั่วไป ซึ่งต้องใช้ GPU บนคลาวด์เฉพาะทางที่มีราคาแพงสำหรับทุกๆ การใช้งาน หรือไม่ก็ต้องเลือกโมเดลเฉพาะทางขนาดเล็กที่สามารถจัดการเรื่องการรับรู้ (perception) หรือการควบคุม (control) ได้อย่างใดอย่างหนึ่ง แต่ขาดความสามารถในการทำทั้งสองอย่างพร้อมกัน
ผู้ร่วมก่อตั้ง Perceptron อย่าง Armen Aghajanyan และ Akshat Shrivastava ซึ่งทั้งคู่เป็นศิษย์เก่าจากแผนก Fundamental AI Research (FAIR) ของ Meta กำลังพยายามแก้ปัญหานี้ผ่านโมเดลใหม่ที่ชื่อว่า Isaac 0.5 ซึ่งแตกต่างจากซอฟต์แวร์ที่มีอยู่ในปัจจุบันที่ออกแบบมาเพื่อทำงานซ้ำๆ เพียงอย่างเดียว Isaac 0.5 เป็นโมเดลอเนกประสงค์ที่ช่วยให้หุ่นยนต์มีความสามารถในการ "รับรู้ ให้เหตุผล และลงมือทำ" (perceive, reason, and act) ทำให้พวกมันสามารถปรับตัวเข้ากับสภาพแวดล้อมต่างๆ ได้ แทนที่จะถูกเขียนโปรแกรมมาตายตัวสำหรับการเคลื่อนไหวเพียงรูปแบบเดียว
กลไกของความฉลาดทางกายภาพ
เพื่อที่จะเข้าใจความซับซ้อนของแนวทางที่ Perceptron ใช้ เราต้องดูตัวอย่างงานมาตรฐานในคลังสินค้า เช่น การคัดแยกพัสดุ หุ่นยนต์ไม่สามารถแค่ "หยิบกล่อง" ขึ้นมาได้เฉยๆ แต่มันต้องอ่านฉลากก่อน ทำการวิเคราะห์เชิงพื้นที่เพื่อสร้างแผนที่สภาพแวดล้อมรอบตัว ตัดสินใจลำดับการหยิบที่เหมาะสมที่สุด และวางแผนเส้นทางการเคลื่อนที่ทางกายภาพของมัน
Isaac 0.5 ถูกออกแบบมาเพื่อจัดการกับกระบวนการทางปัญญาที่มีหลายขั้นตอนเหล่านี้ โมเดลนี้ได้รับการฝึกฝนในสเกลที่มหาศาล โดยการประมวลผลข้อมูลวิดีโอทั่วไปถึงหนึ่งล้านชั่วโมงเพื่อให้สามารถจดจำสภาพแวดล้อมและสถานการณ์ที่หลากหลายได้ และเพื่อให้เชี่ยวชาญด้านความคล่องแคล่วทางกายภาพ บริษัทได้ใช้ "ego video" (มุมมองบุคคลที่หนึ่งจากกล้องที่สวมใส่) และวิดีโอ UMI (การบันทึกการกระทำซ้ำๆ ของมนุษย์) เพื่อสอนให้ AI เรียนรู้ว่าการเคลื่อนไหวเปลี่ยนเป็นการทำงานให้สำเร็จได้อย่างไร Shrivastava ระบุว่าบริษัทได้สร้างชุดข้อมูลขนาดระดับเพตาไบต์ (petabyte-scale) ซึ่งครอบคลุมทั้งภาพ ข้อความ วิดีโอ และเส้นทางการเคลื่อนที่ของหุ่นยนต์ เพื่อบรรลุระดับของ "การเล่นแร่แปรธาตุทางอัลกอริทึม" (algorithmic alchemy) นี้
กลยุทธ์ Open-Weight และการขยายตลาด
เพื่อเป็นการส่งเสริมความโปร่งใสและการนำไปใช้งานโดยเหล่านักพัฒนา Perceptron กำลังปล่อย Isaac 0.5 ในรูปแบบโมเดลแบบ open-weight ซึ่งช่วยให้นักวิจัยและวิศวกรสามารถตรวจสอบพารามิเตอร์และข้อมูลที่ใช้ในการฝึกฝนได้ ซึ่งเป็นขั้นตอนสำคัญในการรวม AI เข้ากับสภาพแวดล้อมทางอุตสาหกรรมที่มีความเสี่ยงสูง ซึ่งความสามารถในการคาดการณ์ผลลัพธ์ได้เป็นสิ่งสำคัญที่สุด
ด้วยการสนับสนุนจากการระดมทุนรอบ 21 ล้านดอลลาร์ นำโดย Bessemer Venture Partners ทำให้ Perceptron วางตำแหน่งตัวเองเป็นชั้นความฉลาด (intelligence layer) สำหรับภาคส่วนต่างๆ ที่หลากหลาย แม้ว่าจุดมุ่งหมายหลักจะอยู่ที่โลจิสติกส์และการผลิต แต่บริษัทก็เล็งเห็นถึงการประยุกต์ใช้ในทันทีในด้านความปลอดภัย การเคลื่อนที่ (mobility) และแม้แต่สื่อและความบันเทิง การจัดหาชั้นความฉลาดที่ยืดหยุ่นนี้ทำให้ Perceptron ตั้งเป้าที่จะเปลี่ยนแปลงวิธีการทำงานของหุ่นยนต์ที่นำทางด้วยการมองเห็น (vision-guided robots) ทั่วทั้งภูมิทัศน์อุตสาหกรรมโลก
สรุปประเด็นสำคัญ
- การเชื่อมช่องว่าง: Isaac 0.5 มุ่งเป้าที่จะขจัดทางเลือกระหว่างโมเดลแบบทั่วไปที่ใช้ทรัพยากรสูงกับโมเดลเฉพาะทางที่มีข้อจำกัด โดยการนำเสนอโครงสร้างการทำงานแบบอเนกประสงค์ที่ "รับรู้ ให้เหตุผล และลงมือทำ"
- สเกลการฝึกฝนที่มหาศาล: โมเดลนี้ใช้ประโยชน์จากข้อมูลวิดีโอหนึ่งล้านชั่วโมง รวมถึงวิดีโอแบบ ego-centric และ UMI เพื่อสอนหุ่นยนต์ให้ทำงานที่ซับซ้อนทั้งในเชิงพื้นที่และเชิงปฏิบัติการ
- การเข้าถึงแบบ Open-Weight: การปล่อย Isaac 0.5 แบบ open-weight ช่วยให้ Perceptron เปิดโอกาสให้มีการตรวจสอบที่ลึกซึ้งยิ่งขึ้น และช่วยให้การรวม AI ด้านการมองเห็นระดับแนวหน้าเข้ากับกระบวนการทำงานในอุตสาหกรรมทำได้รวดเร็วยิ่งขึ้น
Perceptron ได้เปิดตัว Isaac 0.5 ซึ่งเป็นโมเดลการมองเห็นแบบ open-weight ที่สัญญาว่าจะมอบ "สมอง" แบบ "รับรู้-ให้เหตุผล-ลงมือทำ" ที่เป็นหนึ่งเดียวให้กับหุ่นยนต์ สตาร์ทอัพแห่งนี้ระดมทุนได้ 21 ล้านดอลลาร์ นำโดย Bessemer Venture Partners และวางตำแหน่งโมเดลนี้ให้เป็นชั้นความฉลาดแบบพร้อมใช้งาน (drop-in intelligence layer) สำหรับตลาดโลจิสติกส์ การผลิต และตลาดระบบอัตโนมัติทางกายภาพอื่นๆ
ทำไมการเปิดตัวครั้งนี้จึงสำคัญ
หุ่นยนต์อุตสาหกรรมต้องเผชิญกับการต้องแลกเปลี่ยน (trade-off) มาเป็นเวลานาน หากคุณเลือกใช้โมเดลพื้นฐานขนาดใหญ่ที่เป็นแบบอเนกประสงค์ คุณก็ต้องจ่ายค่าเข้าถึง GPU บนคลาวด์อย่างต่อเนื่อง แต่หากคุณยึดติดกับระบบการมองเห็นเฉพาะทางที่จำกัด คุณก็จะสูญเสียความยืดหยุ่นเมื่อสภาพแวดล้อมเปลี่ยนไป Isaac 0.5 จึงถูกนำเสนอในฐานะทางสายกลาง—โมเดลเดียวที่สามารถจัดการทั้งการรับรู้ การวางแผน และการควบคุม โดยไม่จำเป็นต้องใช้การประมวลผลบนคลาวด์แยกในแต่ละกรณี
ปัญหาของสมองหุ่นยนต์ในปัจจุบัน
หุ่นยนต์คลังสินค้าทั่วไปทำได้มากกว่าแค่การหยิบกล่อง มันต้องอ่านฉลาก, ระบุตำแหน่งสิ่งของท่ามกลางสิ่งของที่วางระเกะระกะ, ตัดสินใจลำดับการหยิบที่ดีที่สุด และคำนวณเส้นทางการเคลื่อนที่ของแขนกลโดยไม่ให้เกิดการชน ทั้งหมดนี้ต้องทำแบบเรียลไทม์ โซลูชันที่มีอยู่ในปัจจุบันมักจะแยกขั้นตอนเหล่านี้ออกเป็นส่วนประกอบซอฟต์แวร์ที่ต่างกัน ได้แก่ ตัวตรวจจับฉลากแบบน้ำหนักเบา, ตัววางแผนการเคลื่อนที่แบบกำหนดเงื่อนไขเอง (handcrafted planner) และตัวควบคุมการทำงานตามกฎ (rule-based controller) การแยกส่วนเช่นนี้ทำให้เกิดภาระในการรวมระบบ (integration overhead) และจำกัดความสามารถของหุ่นยนต์ในการปรับตัวเมื่อมีผลิตภัณฑ์ รูปแบบบรรจุภัณฑ์ หรือการจัดวางแบบใหม่ปรากฏขึ้น
วิธีที่ Isaac 0.5 พยายามจะปิดช่องว่างนี้
ผู้ร่วมก่อตั้ง Perceptron คือ Armen Aghajanyan และ Akshat Shrivastava ซึ่งทั้งคู่เป็นอดีตนักวิจัยจาก Meta FAIR ได้สร้าง Isaac 0.5 ให้เป็นเครือข่ายแบบ end-to-end เพียงหนึ่งเดียว โมเดลนี้ได้รับการฝึกฝนด้วยข้อมูลวิดีโอทั่วไปประมาณหนึ่งล้านชั่วโมง ซึ่งครอบคลุมฉากทั้งภายในและภายนอกอาคารที่หลากหลาย สิ่งสำคัญคือ ชุดข้อมูลการฝึกฝนยังรวมถึง “ego video” ซึ่งเป็นฟุตเทจมุมมองบุคคลที่หนึ่งที่บันทึกจากกล้องแบบสวมใส่ และ “UMI video” ซึ่งเป็นการบันทึกการกระทำซ้ำๆ ของมนุษย์ ด้วยการป้อนข้อมูลสตรีมภาพคู่กับข้อมูลเส้นทางการเคลื่อนที่ของหุ่นยนต์เข้าสู่เครือข่าย Perceptron อ้างว่าโมเดลสามารถเรียนรู้วิธีที่สัญญาณภาพเปลี่ยนไปเป็นการเคลื่อนไหวทางกายภาพได้
บริษัทระบุว่าชุดข้อมูลของตนครอบคลุมภาพ ข้อความ วิดีโอ และเส้นทางการเคลื่อนที่ของหุ่นยนต์จำนวนหลายเพตาไบต์ ความหลากหลายนี้มีจุดประสงค์เพื่อให้ Isaac 0.5 มีความสามารถในการจดจำวัตถุใหม่, อนุมานคุณลักษณะการใช้งาน (affordances - เช่น จะหยิบจับได้อย่างไร) และสร้างแผนการเคลื่อนที่ได้ทั้งหมดโดยไม่ต้องมีโมดูลควบคุมแยกต่างหาก
โมเดลแบบ Open-weight: เมื่อความโปร่งใสมาบรรจบกับความใช้งานได้จริง
ต่างจากบริการ AI เชิงพาณิชย์ส่วนใหญ่ที่ให้บริการเพียงแค่ API แต่ Perceptron กำลังปล่อย Isaac 0.5 ในรูปแบบ open weights วิศวกรสามารถตรวจสอบพารามิเตอร์, ปรับจูนเครือข่าย (fine-tune) ด้วยข้อมูลเฉพาะของตนเอง หรือฝังโมเดลลงในฮาร์ดแวร์ระดับ Edge ได้โดยตรง
