Model Fable 5 milik Anthropic berhasil mengalahkan gym badge pertama dalam 1.785 giliran, dengan biaya $65,40, saat memainkan versi bahasa Mandarin dari Pokémon FireRed hanya menggunakan output visual game tersebut. Pencapaian ini membuktikan bahwa model tersebut dapat menyelesaikan segmen game yang dapat dikenali tanpa petunjuk tekstual apa pun, namun analisis mendalam terhadap rantai pemikiran (thinking chain) model menunjukkan bahwa ia hanya mengulang pengetahuan game yang telah dihafal, alih-alih benar-benar "melihat" dan menalar setiap piksel.
Klaim Anthropic diuji
Saat Anthropic merilis Fable 5, perusahaan tersebut menonjolkan demo "hanya visi" (vision-only) di mana model tersebut menavigasi Pokémon FireRed hanya dengan melihat layar. Judul beritanya membuat seolah-olah sistem tersebut dapat menafsirkan lingkungan visual apa pun dari nol. Seorang pengembang mencoba memverifikasi klaim tersebut dengan mereproduksi pengaturan yang dijelaskan pada halaman peluncuran Anthropic dan menjalankan model tersebut pada versi terjemahan bahasa Mandarin dari game tersebut.
Bagaimana eksperimen dijalankan
Sebuah harness khusus menyuapi model dengan bingkai video mentah (raw video frames) dan menangkap pilihan tindakannya. Harness tersebut sesuai dengan deskripsi Anthropic, yaitu meneruskan setiap bingkai baru ke model dan membaca kembali input kontroler yang dipilih. Pengujian menjalankan seluruh siklus game hingga model mendapatkan gym badge pertamanya, lalu berlanjut hingga giliran ke-2.000, saat avatar mencapai Route 3.
Hasil kuantitatifnya jelas:
- Gym badge pertama didapatkan setelah 1.785 giliran
- Total biaya komputasi $65,40
- Pada giliran ke-2.000, avatar berada di Route 3
Apa yang diungkapkan oleh log
Namun, log mentah menceritakan kisah yang berbeda tentang bagaimana model tersebut sampai di sana. "Rantai pemikiran" (thinking chain) internal model tersebut berulang kali menuliskan informasi yang belum muncul di layar.
- Pada giliran ke-78, model mencatat bahwa rival akan memilih Charmander, meskipun game belum menampilkan pilihan rival tersebut.
- 141 giliran kemudian, ketika game akhirnya memberikan Oak’s Parcel kepada pemain, model sudah mencatat nama item tersebut dalam catatannya.
- Saat melintasi Route 3, model mengidentifikasi pelatih tertentu dengan mengutip dialog terkenal yang tidak pernah muncul dalam umpan visual.
Entri-entri ini bukanlah hasil dari analisis piksel demi piksel. Ini adalah ciri khas dari sistem yang telah menginternalisasi skrip game yang mendetail—jenis pengetahuan yang persis ditemukan dalam walkthrough, wiki, dan video penggemar yang banyak beredar di internet. Dengan kata lain, model tersebut tampaknya hanya menggunakan visi untuk mengonfirmasi peta yang sudah ia hafal di luar kepala.
Mengapa ini penting bagi tolok ukur penalaran visual
Eksperimen ini menggarisbawahi cacat halus namun kritis dalam banyak tes penalaran visual:
- Input yang bersih tidak menjamin status pengetahuan yang bersih. Bahkan ketika satu-satunya saluran adalah aliran gambar, model mungkin menggunakan cadangan fakta yang telah dihafal secara masif.
- Prompt sistem tidak dapat menghapus data pelatihan. Model yang telah melihat walkthrough lengkap tidak dapat dipaksa untuk "melupakannya" tanpa pelatihan ulang.
- Performa mungkin mengukur memori, bukan persepsi. Ketika dunia pengujian cocok dengan dataset yang sudah dikenal, model dapat berhasil dengan mencocokkan pola ke pola, alih-alih benar-benar menafsirkan informasi visual baru.
Jika tolok ukur (benchmark) terus memperlakukan "hanya visi" sebagai proksi untuk penalaran visual, mereka berisiko menggelembungkan klaim tentang kemampuan AI untuk memahami lingkungan baru. Perusahaan dapat membanggakan angka-angka yang mengesankan sementara keahlian dasarnya tetap sempit—sebuah masalah yang penting bagi investor, pengembang, dan siapa pun yang membangun sistem kritis keselamatan yang harus beroperasi di lingkungan yang benar-benar belum pernah dilihat sebelumnya.
Argumen tandingan: apakah menghafal benar-benar sebuah masalah?
Beberapa orang berpendapat bahwa mengonfirmasi peta yang sudah dikenal tetap memerlukan bentuk penalaran: model harus menyelaraskan representasi internalnya dengan petunjuk visual saat ini. Dari perspektif tersebut, demo ini menunjukkan kemampuan yang berguna—menggunakan visi untuk mendasarkan basis pengetahuan yang sudah ada. Keberatan tersebut valid; tugas tersebut memang melibatkan pemeriksaan perseptual.
Namun, tujuan utama tolok ukur adalah untuk menilai inferensi visual secara umum, bukan pengambilan skrip yang tersimpan. Ketika sebuah model dapat memprediksi peristiwa sebelum peristiwa itu muncul, pengujian tersebut tidak lagi mengisolasi persepsi. Batas antara pendasaran (grounding) yang berguna dan kecurangan terang-terangan menjadi kabur, dan hasilnya kehilangan nilai diagnostik.
Langkah selanjutnya dan respons komunitas
Untuk menguji batas kemampuan menghafal, penguji kini menjalankan model yang sama pada peta yang telah dimodifikasi dengan geografi yang diubah. Semua kode, harness khusus, dan file log lengkap telah dipublikasikan, mengundang peneliti lain untuk mereplikasi eksperimen tersebut atau menerapkannya pada permainan yang berbeda. Sebuah saluran diskusi di platform komunitas pembelajaran juga telah dibuka untuk dialog berkelanjutan.
Kesimpulan Utama
Demo berbasis visi saja yang berhasil karena model tersebut sudah mengetahui jawabannya bukanlah bukti penalaran visual yang sejati. Benchmark harus memisahkan pengetahuan yang dihafal dari persepsi langsung, jika tidak, mereka berisiko melebih-lebihkan kemampuan AI dalam menavigasi dunia visual yang benar-benar tidak dikenal.
