Anthropic의 Fable 5 모델은 게임의 시각적 출력만을 사용하여 중국어 버전의 포켓몬스터 파이어레드를 플레이하며, 1,785턴 만에 첫 번째 체육관 배지를 획득하고 65.40달러를 지출했습니다. 이 과정은 모델이 텍스트 프롬프트 없이도 게임의 인지 가능한 구간을 완료할 수 있음을 증명하지만, 모델의 사고 체인(thinking chain)을 심층 분석해 보면 각 픽셀을 실제로 '보고' 추론하기보다는 암기된 게임 지식을 읊고 있었다는 사실이 드러납니다.
Anthropic의 주장에 대한 검증
Anthropic이 Fable 5를 출시했을 때, 회사는 모델이 화면만 보고 포켓몬스터 파이어레드를 탐색하는 "비전 전용(vision-only)" 데모를 강조했습니다. 헤드라인은 마치 시스템이 어떤 시각적 환경이라도 처음부터 해석할 수 있는 것처럼 들리게 했습니다. 한 개발자가 Anthropic의 출시 페이지에 설명된 설정을 재현하고 게임의 중국어 번역 버전을 모델에 실행함으로써 그 주장을 검증하기로 했습니다.
실험 진행 방식
커스텀 하네스(harness)가 모델에 가공되지 않은 비디오 프레임을 제공하고 모델의 행동 선택을 캡처했습니다. 이 하네스는 Anthropic의 설명과 일치하게, 각 새로운 프레임을 모델에 전달하고 선택된 컨트롤러 입력을 다시 읽어 들였습니다. 테스트는 모델이 첫 번째 체육관 배지를 얻을 때까지 전체 게임 루프를 실행한 후, 아바타가 3번 도로에 도달하는 2,000턴까지 계속되었습니다.
정량적 결과는 명확했습니다:
- 첫 번째 체육관 배지 획득: 1,785턴 후
- 총 컴퓨팅 비용: 65.40달러
- 2,000턴째에 아바타는 3번 도로에 위치함
로그가 밝혀낸 사실
하지만 원본 로그는 모델이 그곳에 어떻게 도달했는지에 대해 전혀 다른 이야기를 들려줍니다. 모델의 내부 "사고 체인"은 아직 화면에 나타나지 않은 정보를 반복적으로 기록했습니다.
- 78턴에서 모델은 게임이 라이벌의 선택을 표시하지 않았음에도 불구하고 라이벌이 파이리를 선택할 것이라고 언급했습니다.
- 141턴 후, 게임이 마침내 플레이어에게 '오박사의 꾸러미'를 전달했을 때, 모델은 이미 노트에 아이템 이름을 기록해 두었습니다.
- 3번 도로를 이동하는 동안, 모델은 시각적 피드에 전혀 나타나지 않은 유명한 대사를 인용하여 특정 트레이너를 식별했습니다.
이러한 기록은 픽셀 단위 분석의 결과가 아닙니다. 이는 인터넷에 퍼져 있는 공략집, 위키, 팬 영상 등에서 볼 수 있는 상세한 게임 스크립트를 모델이 내재화했음을 보여주는 특징입니다. 즉, 모델은 시각 정보를 단지 자신이 이미 암기하고 있는 지도를 확인하는 용도로만 사용하는 것으로 보입니다.
시각적 추론 벤치마크에서 이것이 중요한 이유
이 실험은 많은 시각적 추론 테스트에 존재하는 미묘하지만 결정적인 결함을 강조합니다:
- 깨끗한 입력이 깨끗한 지식 상태를 보장하지는 않습니다. 유일한 채널이 이미지 스트림일지라도, 모델은 암기된 방대한 사실의 저장소에서 정보를 끌어올 수 있습니다.
- 시스템 프롬프트로 학습 데이터를 지울 수는 없습니다. 전체 공략을 본 모델은 재학습 없이는 이를 "잊도록" 강제할 수 없습니다.
- 성능이 인지력이 아닌 기억력을 측정할 수 있습니다. 테스트 환경이 알려진 데이터셋과 일치할 경우, 모델은 새로운 시각 정보를 실제로 해석하는 대신 패턴과 패턴을 매칭함으로써 성공할 수 있습니다.
만약 벤치마크가 "비전 전용"을 시각적 추론의 대리 지표로 계속 취급한다면, 새로운 환경을 이해하는 AI의 능력에 대한 주장이 부풀려질 위험이 있습니다. 기업들은 근본적인 기술 역량은 좁은 상태로 유지하면서도 인상적인 수치를 내세울 수 있습니다. 이는 투자자, 개발자, 그리고 진정으로 보지 못한 환경에서 작동해야 하는 안전 필수 시스템을 구축하는 모든 이들에게 중요한 문제입니다.
반론: 암기가 정말 문제인가?
일부에서는 알려진 지도를 확인하는 것조차 일종의 추론이 필요하다고 주장합니다. 모델이 자신의 내부 표현을 현재의 시각적 단서와 일치시켜야 하기 때문입니다. 그런 관점에서 보면, 이 데모는 시각을 사용하여 기존 지식 베이스를 그라운딩(grounding)하는 유용한 능력을 보여줍니다. 이 반론은 타당하며, 해당 작업에는 지각적 확인이 포함됩니다.
하지만 핵심적인 벤치마크 목표는 저장된 스크립트의 검색이 아니라 일반적인 시각적 추론을 평가하는 것입니다. 모델이 사건이 나타나기 전에 이를 예측할 수 있다면, 그 테스트는 더 이상 지각력을 분리하여 측정할 수 없습니다. 유용한 그라운딩과 명백한 부정행위 사이의 경계가 모호해지며, 결과의 진단적 가치가 상실됩니다.
다음 단계 및 커뮤니티 반응
암기 능력의 한계를 시험하기 위해, 테스터는 현재 지형이 변경된 수정된 지도 위에서 동일한 모델을 실행하고 있습니다. 모든 코드와 커스텀 하네스, 그리고 전체 로그 파일이 공개되어, 다른 연구자들이 이 실험을 재현하거나 다른 게임에 적용해 볼 수 있도록 했습니다. 지속적인 논의를 위해 학습 커뮤니티 플랫폼에 토론 채널도 개설되었습니다.
시사점
모델이 이미 정답을 알고 있기 때문에 성공하는 시각 전용(vision-only) 데모는 진정한 시각적 추론의 증거가 될 수 없습니다. 벤치마크는 암기된 지식과 즉각적인 인지 능력을 반드시 구분해야 하며, 그렇지 않으면 AI가 진정으로 미지의 시각적 세계를 탐색하는 능력을 과장할 위험이 있습니다.
