World Labs vừa trình làng Atlas, một mô hình omni có khả năng biến một vài bức ảnh thông thường thành một thế giới 3D có thể điều hướng hoàn toàn và kết xuất (render) video 1440p dài tới một phút. Công ty cho biết công nghệ này tạo ra một quy trình “real-to-sim” (từ thực tế sang mô phỏng).

Tại sao sự chuyển dịch từ các chuỗi phẳng lại quan trọng

Hầu hết các hệ thống AI đa phương thức hiện nay đều xử lý đầu vào dưới dạng các luồng một hoặc hai chiều—như chuỗi văn bản, lưới hình ảnh hoặc các khung hình video. Thiết kế đó buộc mô hình phải suy luận các mối quan hệ không gian từ dữ liệu thiếu hình học rõ ràng, làm hạn chế độ trung thực của video được tạo ra và các bản tái tạo 3D. Atlas loại bỏ cách tiếp cận đó. Mỗi token mà mô hình xử lý đều gắn liền với một điểm cụ thể trong không gian ba chiều, một kỹ thuật mà công ty gọi là neo không gian (spatial anchoring). Bằng cách huấn luyện từ đầu trên dữ liệu văn bản, hình ảnh, video và 3D với một kiến trúc nhận biết được cấu trúc 3D—hoặc thậm chí là 4D (thời gian)—Atlas có thể hiểu và thao tác trực tiếp trên các hình khối hình học.

Từ video kiểu “máy đánh bạc” đến việc tạo video được điều khiển bởi camera

Các công cụ tạo video hiện nay dựa vào các câu lệnh (prompt) văn bản mơ hồ để di chuyển camera ảo, thường dẫn đến kết quả không thể dự đoán trước. Atlas thay thế câu lệnh bằng một đầu vào hình học: người dùng chỉ định một tư thế camera hoặc một lộ trình, và mô hình sẽ kết xuất cảnh quay từ chính góc nhìn đó. Trong các bản demo, hệ thống đã tạo ra video độ phân giải cao, mượt mà và duy trì được sự nhất quán khi camera di chuyển—một bước tiến tới khả năng kiểm soát ở cấp độ chuyên nghiệp.

Tái tạo thế giới với hình ảnh tối thiểu

Atlas có thể xây dựng lại các môi trường phức tạp chỉ từ một hình ảnh duy nhất cho đến vài chục hình ảnh, mà không cần bất kỳ phần cứng thu hình chuyên dụng nào. Trong một bản demo công khai, mô hình đã lấy một tập hợp nhỏ các bức ảnh chụp ở ngang tầm mặt đất của một sân trường đại học và tổng hợp được các góc nhìn từ trên cao khớp với bố cục dự kiến. Các mô hình đối thủ như VGGT và InfiniteVGGT thường tạo ra các kết cấu bị mờ hoặc lỗi hình học khi camera di chuyển; trong khi đó, Atlas vẫn duy trì được tính toàn vẹn về cấu trúc trong suốt quá trình.

Ngoài video, mô hình còn xuất ra các định dạng 3D gốc—như đám mây điểm (point clouds) và 3D Gaussian splats. Đám mây điểm là tập hợp các điểm trong không gian mã hóa hình dạng bề mặt; Gaussian splats lưu trữ mỗi điểm dưới dạng một khối (blob) nhỏ biến đổi mượt mà, cho phép kết xuất hiệu quả các chi tiết tinh xảo. Bằng cách cung cấp độ sâu cùng với màu sắc RGB, Atlas biến vài bức ảnh chụp từ điện thoại thông minh thành một bản sao kỹ thuật số (digital twin) có thể khám phá từ mọi góc độ.

Real-to-sim dành cho robot

Các nhà phát triển robot từ lâu đã phải vật lộn với khoảng cách giữa dữ liệu thế giới thực và môi trường huấn luyện mô phỏng. Atlas hứa hẹn sẽ lấp đầy khoảng cách đó bằng cách tạo ra luồng dữ liệu cảm biến chính xác mà một robot sẽ nhìn thấy trong một căn phòng được tái tạo. Sau đó, các nhà phát triển có thể thay đổi vật thể, ánh sáng hoặc bối cảnh trong bản sao kỹ thuật số, tạo ra hàng nghìn kịch bản biến thể từ một lần thu hình thực tế duy nhất. World Labs đã trình diễn quy trình làm việc này bằng cách sử dụng công nghệ mua lại từ một startup chuyên về tổng hợp cảnh (scene synthesis); quy trình này đã tạo ra đủ các biến thể để duy trì năm nền tảng robot khác nhau hoạt động tự động trong một giờ mà không cần sự can thiệp của con người.

Các điểm chuẩn và tuyên bố về hiệu suất

Trong các bài kiểm tra đối đầu, những người đánh giá là con người đã ưu tiên các video được điều khiển bởi camera của Atlas hơn một đối thủ hàng đầu trong 94% các so sánh cặp, và hơn một mô hình lớn khác trong 81% các trường hợp. Về khả năng tái tạo, Atlas đạt được sai số trung vị là 25,3, vượt qua các đối thủ có điểm sai số cao hơn. Mô hình này kết hợp lợi thế về tốc độ của các mô hình ngôn ngữ lớn—sử dụng bộ nhớ đệm key-value (KV) để tái sử dụng các tính toán trung gian—với đầu ra chất lượng cao của các mô hình khuếch tán (diffusion models), vốn tinh chỉnh hình ảnh theo từng bước lặp.

Những hạn chế tiềm ẩn và các câu hỏi còn bỏ ngỏ

Những thông báo của World Labs được hỗ trợ bởi các bản demo ấn tượng, nhưng công nghệ này vẫn còn ở giai đoạn sơ khai. Việc huấn luyện và vận hành một mô hình xử lý văn bản, hình ảnh, video và dữ liệu 3D ở độ phân giải cao đòi hỏi năng lực tính toán đáng kể, và công ty vẫn chưa tiết lộ thông số phần cứng hay chi phí suy luận (inference). Các điểm chuẩn hiện dựa trên sở thích của con người và các chỉ số sai số trung vị; chúng vẫn chưa cho thấy Atlas hoạt động như thế nào trong các tác vụ hạ nguồn (downstream tasks) như tỷ lệ thành công khi thao tác của robot so với dữ liệu thực thuần túy. Các nhà phê bình cũng có thể lưu ý rằng mặc dù mô hình có thể tạo ra hình học hợp lý từ ít hình ảnh, nhưng nó không thể thay thế độ chính xác của các bản quét lidar hoặc thu hình bằng ánh sáng cấu trúc (structured-light) khi cần các phép đo chính xác.

Điều cần theo dõi tiếp theo

  • Sự áp dụng bởi các nền tảng robot – Nếu các đội ngũ robot tích hợp các thế giới do Atlas tạo ra vào vòng lặp huấn luyện của họ và báo cáo những cải thiện có thể đo lường được, thì khẳng định về việc mô phỏng rẻ hơn và đa dạng hơn sẽ trở nên đáng tin cậy hơn.
  • Quy trình tạo nội dung – Các studio và nhà phát triển trò chơi đang thử nghiệm Atlas để tạo nguyên mẫu nhanh có thể tiết lộ liệu đầu ra 3D gốc của mô hình có phù hợp với các quy trình tài nguyên (asset pipelines) hiện có hay không.
  • Đánh giá từ mã nguồn mở hoặc bên thứ ba – Các nhà nghiên cứu độc lập khi tái lập các con số benchmark sẽ giúp xác nhận lợi thế của mô hình so với các tiêu chuẩn hiện tại.
  • Công bố về phần cứng và chi phí – Việc hiểu rõ ngân sách tính toán cho quá trình suy luận sẽ quyết định liệu Atlas có thể chạy trên các thiết bị biên hay vẫn chỉ là một dịch vụ thuần đám mây.

Điểm mấu chốt

Atlas cho thấy việc neo giữ các token AI vào không gian vật lý cho phép một mô hình duy nhất có thể tạo ra, tái cấu trúc và mô phỏng toàn bộ môi trường chỉ từ đầu vào hình ảnh tối thiểu. Nếu hiệu suất như đã hứa có thể mở rộng sang các triển khai thực tế mà không tốn chi phí tính toán quá lớn, mô hình này có thể định hình lại cách robot học hỏi và cách nội dung nhập vai được xây dựng, biến vài bức ảnh thành một thế giới kỹ thuật số tương tác hoàn chỉnh.