Mô hình Thế giới Orca của Trung Quốc đạt hiệu suất ngang ngửa robot chuyên dụng mà không cần nhãn hành động

Một bước đột phá từ các nhà nghiên cứu tại Trung Quốc đang thách thức định nghĩa cơ bản về trí tuệ AI bằng cách chứng minh rằng một mô hình thế giới thống nhất có thể làm chủ lĩnh vực robot mà không cần sự giám sát trực tiếp. Mô hình Orca cho thấy chỉ bằng cách quan sát cách thế giới thay đổi qua video, AI có thể phát triển một sự hiểu biết nội tại sâu sắc, có khả năng điều khiển các hành động vật lý phức tạp.

Công cụ Học tập Kép: Chế độ Vô thức và Có ý thức

Orca khác biệt với các mô hình chuyên dụng truyền thống bằng cách sử dụng phương pháp tiếp cận huấn luyện hai hướng để xây dựng "trạng thái thế giới" nội tại. Phương pháp đầu tiên, "học vô thức" (unconscious learning), bao gồm việc xử lý 125.000 giờ video không có nhãn. Trong giai đoạn này, mô hình dự đoán các khung hình tương lai trong một không gian trừu tượng, cho phép nó nắm bắt các quy luật chuyển động, sự che khuất vật thể và động lực học của cảnh quay mà không cần bất kỳ chú thích nào.

Phương pháp thứ hai, "học có ý thức" (conscious learning), đưa vào các hướng dẫn và mô tả bằng lời nói. Bằng cách phân đoạn video và dán nhãn các thay đổi trạng thái kết quả, Orca học được mối quan hệ nhân quả giữa một hành động cụ thể và kết quả vật lý của nó. Sự kết hợp này cho phép mô hình thu hẹp khoảng cách giữa nhận thức thị giác thô và lập luận ngôn ngữ cấp cao.

Lõi đóng băng với các Mô-đun Trí tuệ có thể hoán đổi

Kiến trúc của Orca được thiết kế để đạt được sự linh hoạt cực cao. Nó sử dụng mô hình ngôn ngữ-hình ảnh Qwen3.5 đã được huấn luyện trước làm "lõi đóng băng" (frozen core). Thay vì huấn luyện lại toàn bộ hệ thống cho mọi tác vụ, các nhà nghiên cứu gắn các "đầu" (heads) chuyên dụng, trọng lượng nhẹ vào nền tảng ổn định này:

  • Đầu ra văn bản: Sử dụng đầu ngôn ngữ Qwen3.5 hiện có.
  • Tạo hình ảnh: Sử dụng các bộ điều hợp (adapters) nhỏ được kết nối với Stable Diffusion 3.5 để chuyển đổi trạng thái thế giới nội tại thành các dự đoán hình ảnh.
  • Điều khiển robot: Sử dụng mô-đun "Action Expert" được xây dựng tùy chỉnh, được huấn luyện đặc biệt để chuyển đổi các trạng thái thế giới thành các chuyển động vật lý.

Tính mô-đun này đảm bảo rằng sự hiểu biết trung tâm về thế giới vẫn nhất quán, cho dù mô hình đang trả lời một câu hỏi, tạo video hay điều khiển một cánh tay máy.

Vượt xa các Mô hình Chuyên dụng và các "Gã khổng lồ"

Các chỉ số hiệu suất của Orca-4B rất đáng kể. Trên các bài kiểm tra video dựa trên văn bản, Orca-4B đạt trung bình 51,8%, vượt qua các mô hình lớn hơn nhiều như Emu3 (34B) và các VLM chuyên dụng như DeepSeek-VL2-3B. Trong các tác vụ dự đoán hình ảnh thông qua bài kiểm tra PRICE-V0.1, Orca-4B đạt 59,8%, vượt qua các trình tạo cao cấp như FLUX.2 small.

Ấn tượng nhất là Orca cho thấy sự tương đương với $\pi$0.5—một hệ thống được xây dựng hoàn toàn dựa trên dữ liệu hành động robot—xuyên suốt năm tác vụ thao tác, chẳng hạn như xếp chồng bát và múc đường. Quan trọng là, Orca đạt được điều này mà không cần nhìn thấy bất kỳ nhãn hành động nào trong giai đoạn tiền huấn luyện khổng lồ của mình. Nó thậm chí còn cho thấy khả năng phục hồi lỗi vượt trội, thử lại các lần cầm nắm thất bại trong khi các mô hình chuyên dụng thường bị kẹt trong các vòng lặp lặp đi lặp lại.

Tại sao điều này lại quan trọng đối với tương lai của AI

Orca giải quyết một trong những nút thắt quan trọng nhất trong robot hiện đại: sự thiếu hụt trầm trọng dữ liệu hành động có nhãn. Bằng cách chứng minh rằng AI có thể học "vật lý của thế giới" thông qua quan sát thụ động, nghiên cứu này mở đường cho các robot đa năng có thể được triển khai trong các môi trường mới mà không cần hàng triệu giờ dữ liệu điều khiển từ xa được dán nhãn thủ công.

Các điểm chính cần lưu ý

  • Nền tảng không giám sát: Orca học các động lực thế giới thông qua "học vô thức" từ video không có nhãn, giúp giảm sự phụ thuộc vào các bộ dữ liệu được con người chú thích tốn kém.
  • Kiến trúc mô-đun: Việc sử dụng lõi Qwen3.5 đóng băng với các bộ điều hợp có thể hoán đổi cho phép một mô hình xuất sắc đồng thời ở các mảng văn bản, hình ảnh và điều khiển robot.
  • Sự tương đương về robot: Orca-4B đạt hiệu suất ngang ngửa với các hệ thống robot chuyên dụng trong các tác vụ thao tác mặc dù không hề tiếp xúc với các nhãn hành động trong quá trình tiền huấn luyện.