AnthropicのFable 5モデルは、ゲームの視覚出力のみを使用して中国語版のPokémon FireRedをプレイし、1,785ターン、65.40ドルを費やして最初のジムバッジを獲得した。この試行は、テキストによるプロンプトなしでゲームの認識可能なセグメントを完了できることを証明しているが、モデルの思考チェーン(thinking chain)を深く掘り下げると、各ピクセルを真に「見て」推論しているのではなく、記憶されたゲーム知識を暗唱していたことが判明した。

Anthropicの主張を検証する

AnthropicがFable 5をリリースした際、同社はモデルが画面を見るだけでPokémon FireRedを操作する「ビジョンのみ(vision-only)」のデモを強調した。その見出しは、あたかもシステムが未知の視覚環境をゼロから解釈できるかのような印象を与えた。ある開発者が、Anthropicのローンチページに記載されているセットアップを再現し、ゲームの中国語翻訳版でモデルを実行することで、その主張を検証することを試みた。

実験の手法

カスタムハーネスを使用してモデルに生のビデオフレームを入力し、モデルのアクション選択を記録した。このハーネスはAnthropicの説明に沿ったもので、新しいフレームを順次モデルに渡し、選択されたコントローラー入力を読み取る仕組みとなっている。テストでは、モデルが最初のジムバッジを獲得するまでゲームのループを全行程実行し、その後、アバターがRoute 3に到達する2,000ターン目まで継続された。

定量的な結果は以下の通りである:

  • 最初のジムバッジ獲得まで 1,785ターン
  • 合計計算コスト 65.40ドル
  • 2,000ターン目までにアバターは Route 3 に到達

ログが明らかにしたこと

しかし、生のログは、モデルが「どのように」そこに到達したかについて、異なる物語を語っている。モデルの内部的な「思考チェーン(thinking chain)」には、画面上にまだ現れていない情報が繰り返し書き込まれていた。

  • 78ターン目において、ゲーム内でライバルの選択が表示されていないにもかかわらず、モデルはライバルがヒトカゲ(Charmander)を選択することを記していた。
  • その141ターン後、ゲームがようやくプレイヤーに「オキシダンの小包(Oak’s Parcel)」を手渡したとき、モデルはすでにそのアイテム名をノートに記録していた。
  • Route 3を移動中、モデルは視覚フィードには一度も表示されない有名な台詞を引用することで、特定のトレーナーを特定した。

これらの記述は、ピクセル単位の分析による産物ではない。これらは、ゲームの詳細なスクリプトを内面化したシステムの典型的な特徴である。つまり、インターネット上に溢れている攻略サイト、Wiki、ファンによる動画などで見られる知識そのものである。言い換えれば、モデルは視覚を、すでに暗記しているマップを確認するためだけに利用しているように見える。

視覚的推論ベンチマークにおける重要性

この実験は、多くの視覚的推論テストにおける、微細ながらも決定的な欠陥を浮き彫りにしている:

  • クリーンな入力が、クリーンな知識状態を保証するわけではない。 入力チャネルが画像ストリームのみであっても、モデルは記憶された膨大な事実の蓄積を利用する可能性がある。
  • システムプロンプトで学習データを消去することはできない。 完全な攻略情報を学習済みのモデルに対し、再学習なしにそれを「忘れさせる」ことは不可能である。
  • パフォーマンスが測定しているのは、知覚ではなく記憶である可能性がある。 テスト環境が既知のデータセットと一致する場合、モデルは新しい視覚情報を実際に解釈するのではなく、パターンとパターンを照合することで成功してしまう。

もしベンチマークが「ビジョンのみ」を視覚的推論の代用として扱い続ければ、未知の環境を理解するAIの能力に関する主張を過大評価してしまうリスクがある。企業は、基礎となるスキルセットが限定的なままでありながら、印象的な数字を誇示する可能性がある。これは、投資家や開発者、そして真に未知の設定で動作しなければならない安全性が極めて重要なシステムを構築するすべての人にとって、重要な問題である。

反論:暗記は本当に問題なのか?

既知のマップを確認することでも、ある種の推論は必要であると主張する者もいる。モデルは自身の内部表現を現在の視覚的な手がかりと一致させなければならないからだ。その観点から見れば、このデモは「視覚を用いて既存の知識ベースを接地(ground)させる」という有用な能力を示していると言える。この異論は妥当であり、タスクには確かに知覚的なチェックが含まれている。

しかし、ベンチマークの核心的な目的は、保存されたスクリプトの検索ではなく、汎用的な視覚的推論を評価することにある。モデルが事象が発生する前にそれを予測できてしまう場合、そのテストはもはや知覚を単独で分離して評価できていない。有用な接地と明白な「ズル」の境界線が曖昧になり、結果の診断的価値が失われてしまうのである。

次のステップとコミュニティの反応

暗記の限界を検証するため、テスターは現在、地理を変更した修正マップ上で同じモデルを実行しています。すべてのコード、カスタムハーネス、および完全なログファイルが公開されており、他の研究者が実験を再現したり、異なるゲームに適用したりできるようになっています。継続的な対話のために、学習コミュニティプラットフォーム上にディスカッションチャネルも開設されました。

要点

モデルがすでに答えを知っているために成功するビジョンのみのデモは、真の視覚的推論の証拠にはなりません。ベンチマークは、暗記された知識と即時的な知覚を区別しなければなりません。さもなければ、真に未知の視覚的世界をナビゲートするAIの能力を過大評価してしまうリスクがあります。