Mô hình Fable 5 của Anthropic đã giành được huy hiệu nhà thi đấu đầu tiên sau 1.785 lượt chơi, tiêu tốn 65,40 USD, trong khi chơi phiên bản tiếng Trung của Pokémon FireRed chỉ bằng cách sử dụng đầu ra hình ảnh của trò chơi. Quá trình này chứng minh rằng mô hình có thể hoàn thành một phân đoạn có thể nhận diện được của trò chơi mà không cần bất kỳ gợi ý văn bản nào, nhưng khi đi sâu vào chuỗi tư duy (thinking chain) của mô hình, kết quả cho thấy nó đang đọc lại những kiến thức trò chơi đã được ghi nhớ thay vì thực sự "nhìn" và suy luận về từng pixel.

Kiểm chứng tuyên bố của Anthropic

Khi Anthropic phát hành Fable 5, công ty đã làm nổi bật một bản demo "chỉ dùng thị giác" (vision-only), trong đó mô hình điều hướng Pokémon FireRed chỉ bằng cách quan sát màn hình. Tiêu đề khiến người ta có cảm giác như hệ thống có thể diễn giải bất kỳ môi trường hình ảnh nào từ con số không. Một nhà phát triển đã quyết định xác minh tuyên bố đó bằng cách tái lập thiết lập được mô tả trên trang ra mắt của Anthropic và chạy mô hình trên phiên bản dịch tiếng Trung của trò chơi.

Cách thức thực hiện thí nghiệm

Một bộ khung điều khiển (harness) tùy chỉnh đã cung cấp các khung hình video thô cho mô hình và ghi lại các lựa chọn hành động của nó. Bộ khung này khớp với mô tả của Anthropic, chuyển từng khung hình mới cho mô hình và đọc lại các đầu vào điều khiển đã chọn. Bài kiểm tra đã chạy toàn bộ vòng lặp trò chơi cho đến khi mô hình giành được huy hiệu nhà thi đấu đầu tiên, sau đó tiếp tục cho đến lượt thứ 2.000, khi nhân vật đạt đến Route 3.

Kết quả định lượng rất rõ ràng:

  • Huy hiệu nhà thi đấu đầu tiên giành được sau 1.785 lượt
  • Tổng chi phí tính toán 65,40 USD
  • Đến lượt thứ 2.000, nhân vật đã ở Route 3

Những gì nhật ký (logs) tiết lộ

Tuy nhiên, các nhật ký thô lại kể một câu chuyện khác về cách thức mô hình đạt được kết quả đó. "Chuỗi tư duy" nội bộ của mô hình liên tục ghi lại những thông tin thậm chí còn chưa xuất hiện trên màn hình.

  • Ở lượt thứ 78, mô hình lưu ý rằng đối thủ sẽ chọn Charmander, mặc dù trò chơi vẫn chưa hiển thị lựa chọn của đối thủ.
  • 141 lượt sau đó, khi trò chơi cuối cùng cũng đưa cho người chơi Oak’s Parcel, mô hình đã ghi lại tên vật phẩm này trong ghi chú của mình.
  • Trong khi di chuyển qua Route 3, mô hình đã nhận diện một huấn luyện viên cụ thể bằng cách trích dẫn một câu thoại nổi tiếng vốn chưa bao giờ xuất hiện trong luồng hình ảnh.

Những mục nhập này không phải là sản phẩm của việc phân tích từng pixel. Chúng là dấu hiệu của một hệ thống đã nội hóa một kịch bản chi tiết của trò chơi—chính xác là loại kiến thức thường thấy trong các bài hướng dẫn (walkthroughs), wiki và video của người hâm mộ trên internet. Nói cách khác, mô hình dường như chỉ sử dụng thị giác để xác nhận một bản đồ mà nó đã thuộc lòng.

Tại sao điều này lại quan trọng đối với các tiêu chuẩn đánh giá suy luận thị giác

Thí nghiệm này nhấn mạnh một thiếu sót tinh vi nhưng cực kỳ quan trọng trong nhiều bài kiểm tra suy luận thị giác:

  • Đầu vào sạch không đảm bảo trạng thái kiến thức sạch. Ngay cả khi kênh duy nhất là luồng hình ảnh, mô hình vẫn có thể khai thác một kho tàng khổng lồ các dữ kiện đã được ghi nhớ.
  • System prompt không thể xóa bỏ dữ liệu huấn luyện. Một mô hình đã xem qua một bản hướng dẫn hoàn chỉnh không thể bị buộc phải "quên" nó nếu không được huấn luyện lại.
  • Hiệu suất có thể là thước đo của trí nhớ, không phải nhận thức. Khi thế giới thử nghiệm trùng khớp với một tập dữ liệu đã biết, mô hình có thể thành công bằng cách khớp các khuôn mẫu (pattern) với nhau thay vì thực sự diễn giải thông tin hình ảnh mới.

Nếu các tiêu chuẩn đánh giá tiếp tục coi "chỉ dùng thị giác" là đại diện cho suy luận thị giác, chúng có nguy cơ thổi phồng các tuyên bố về khả năng hiểu các môi trường mới của AI. Các công ty có thể quảng bá những con số ấn tượng trong khi bộ kỹ năng cốt lõi vẫn còn hạn hẹp—một vấn đề quan trọng đối với các nhà đầu tư, nhà phát triển và bất kỳ ai đang xây dựng các hệ thống quan trọng về an toàn, vốn phải hoạt động trong các bối cảnh thực sự chưa từng thấy.

Quan điểm ngược lại: liệu việc ghi nhớ có thực sự là một vấn đề?

Một số người lập luận rằng việc xác nhận một bản đồ đã biết vẫn đòi hỏi một hình thức suy luận: mô hình phải điều chỉnh biểu diễn nội bộ của nó phù hợp với tín hiệu thị giác hiện tại. Từ góc độ đó, bản demo cho thấy một khả năng hữu ích—sử dụng thị giác để làm nền tảng cho một cơ sở kiến thức đã có sẵn. Sự phản đối này là có cơ sở; nhiệm vụ này thực sự có bao gồm một bước kiểm tra nhận thức.

Tuy nhiên, mục tiêu cốt lõi của các tiêu chuẩn đánh giá là để đánh giá khả năng suy luận thị giác tổng quát, chứ không phải việc truy xuất một kịch bản đã lưu trữ. Khi một mô hình có thể dự đoán các sự kiện trước khi chúng xuất hiện, bài kiểm tra không còn cô lập được khả năng nhận thức nữa. Ranh giới giữa việc làm nền tảng hữu ích và việc gian lận trắng trợn trở nên mờ nhạt, và kết quả sẽ mất đi giá trị chẩn đoán.

Các bước tiếp theo và phản ứng của cộng đồng

Để kiểm tra giới hạn của khả năng ghi nhớ, người kiểm thử hiện đang chạy cùng một mô hình trên một bản đồ đã được sửa đổi với địa hình thay đổi. Toàn bộ mã nguồn, bộ khung tùy chỉnh và các tệp nhật ký đầy đủ đã được công khai, nhằm mời gọi các nhà nghiên cứu khác tái lập thí nghiệm hoặc áp dụng nó vào các trò chơi khác nhau. Một kênh thảo luận trên nền tảng cộng đồng học tập cũng đã được mở để duy trì đối thoại liên tục.

Bài học rút ra

Một bản demo chỉ sử dụng thị giác thành công vì mô hình đã biết trước câu trả lời không phải là minh chứng cho khả năng suy luận thị giác thực thụ. Các benchmark phải phân tách giữa kiến thức đã ghi nhớ và khả năng nhận thức tức thời, nếu không, chúng có nguy cơ thổi phồng khả năng điều hướng các thế giới thị giác hoàn toàn mới lạ của AI.