Model Fable 5 milik Anthropic berjaya menewaskan lencana gim pertama dalam 1,785 giliran, dengan perbelanjaan sebanyak $65.40, semasa bermain versi bahasa Cina Pokémon FireRed dengan hanya menggunakan output visual permainan tersebut. Percubaan ini membuktikan model tersebut boleh menyelesaikan segmen permainan yang boleh dikenali tanpa sebarang prom teks, tetapi penelitian mendalam terhadap rantaian pemikiran (thinking chain) model menunjukkan ia sekadar menyebut semula pengetahuan permainan yang telah dihafal dan bukannya benar-benar "melihat" serta menaakul setiap piksel.
Dakwaan Anthropic diuji
Apabila Anthropic melancarkan Fable 5, syarikat tersebut menonjolkan demo "hanya penglihatan" (vision-only) di mana model tersebut mengemudi Pokémon FireRed dengan hanya melihat skrin. Tajuk utamanya membuatkan sistem itu seolah-olah boleh mentafsir sebarang persekitaran visual dari awal. Seorang pembangun telah berusaha untuk mengesahkan dakwaan tersebut dengan menghasilkan semula tetapan yang diterangkan pada halaman pelancaran Anthropic dan menjalankan model tersebut pada terjemahan bahasa Cina permainan itu.
Bagaimana eksperimen dijalankan
Sebuah harness tersuai membekalkan bingkai video mentah kepada model dan merakam pilihan tindakannya. Harness tersebut menepati deskripsi Anthropic, dengan menghantar setiap bingkai baharu kepada model dan membaca semula input pengawal yang dipilih. Ujian tersebut menjalankan kitaran permainan penuh sehingga model memperoleh lencana gim pertamanya, kemudian diteruskan sehingga giliran ke-2,000, apabila avatar tersebut sampai ke Route 3.
Hasil kuantitatifnya adalah jelas:
- Lencana gim pertama diperoleh selepas 1,785 giliran
- Jumlah kos pengkomputeran $65.40
- Menjelang giliran ke-2,000, avatar tersebut berada di Route 3
Apa yang didedahkan oleh log
Walau bagaimanapun, log mentah menceritakan kisah yang berbeza tentang bagaimana model itu sampai ke tahap tersebut. "Rantaian pemikiran" dalaman model tersebut berulang kali menulis maklumat yang belum lagi muncul di skrin.
- Pada giliran ke-78, model tersebut mencatatkan bahawa pencabar akan memilih Charmander, walaupun permainan belum memaparkan pilihan pencabar tersebut.
- 141 giliran kemudian, apabila permainan akhirnya menyerahkan Oak's Parcel kepada pemain, model tersebut telah pun merekodkan nama item tersebut dalam catatannya.
- Semasa merentasi Route 3, model tersebut mengenal pasti seorang jurulatih tertentu dengan memetik baris dialog terkenal yang tidak pernah muncul dalam suapan visual.
Entri-entri ini bukanlah hasil daripada analisis piksel demi piksel. Ia adalah ciri khas sistem yang telah menghadam skrip terperinci permainan tersebut—jenis pengetahuan yang sama seperti yang terdapat dalam panduan permainan (walkthroughs), wiki, dan video peminat yang memenuhi internet. Dengan kata lain, model tersebut kelihatan menggunakan penglihatan hanya untuk mengesahkan peta yang sudah dihafalnya.
Mengapa ia penting untuk penanda aras penaakulan visual
Eksperimen ini menekankan satu kecacatan halus tetapi kritikal dalam banyak ujian penaakulan visual:
- Input yang bersih tidak menjamin keadaan pengetahuan yang bersih. Walaupun satu-satunya saluran adalah aliran imej, model mungkin menggunakan simpanan fakta yang telah dihafal secara besar-besaran.
- Prom sistem tidak boleh memadamkan data latihan. Model yang telah melihat panduan permainan yang lengkap tidak boleh dipaksa untuk "melupakannya" tanpa latihan semula.
- Prestasi mungkin mengukur ingatan, bukan persepsi. Apabila dunia ujian sepadan dengan set data yang diketahui, model boleh berjaya dengan memadankan corak demi corak dan bukannya mentafsir maklumat visual baharu secara sebenar.
Jika penanda aras terus menganggap "hanya penglihatan" sebagai proksi untuk penaakulan visual, ia berisiko melambungkan dakwaan tentang keupayaan AI untuk memahami persekitaran baharu. Syarikat boleh menonjolkan angka yang mengagumkan sedangkan set kemahiran asasnya kekal sempit—satu isu yang penting bagi pelabur, pembangun, dan sesiapa sahaja yang membina sistem kritikal keselamatan yang mesti beroperasi dalam persekitaran yang benar-benar tidak pernah dilihat.
Hujah balas: adakah penghafalan benar-benar satu masalah?
Sesetengah pihak berpendapat bahawa mengesahkan peta yang diketahui masih memerlukan satu bentuk penaakulan: model tersebut mesti menyelaraskan representasi dalamannya dengan petunjuk visual semasa. Dari perspektif itu, demo tersebut menunjukkan keupayaan yang berguna—menggunakan penglihatan untuk mengukuhkan asas pengetahuan yang sedia ada. Bantahan tersebut adalah sah; tugas itu memang melibatkan semakan persepsi.
Walau bagaimanapun, matlamat utama penanda aras adalah untuk menilai inferens visual secara umum, bukannya pengambilan skrip yang tersimpan. Apabila model boleh meramalkan peristiwa sebelum ia muncul, ujian tersebut tidak lagi mengasingkan persepsi. Garis antara pengukuhan yang berguna dan penipuan terang-terangan menjadi kabur, dan keputusan tersebut kehilangan nilai diagnostik.
Langkah seterusnya dan tindak balas komuniti
Untuk menguji had penghafalan, penguji kini menjalankan model yang sama pada peta yang telah diubah suai dengan geografi yang berbeza. Semua kod, harness tersuai, dan fail log lengkap telah didedahkan kepada umum, sekali gus menjemput penyelidik lain untuk mengulangi eksperimen tersebut atau mengaplikasikannya kepada permainan yang berbeza. Saluran perbincangan di platform komuniti pembelajaran juga telah dibuka untuk dialog yang berterusan.
Rumusan
Demo berasaskan penglihatan sahaja yang berjaya kerana model tersebut sudah mengetahui jawapannya bukanlah bukti penaakulan visual yang tulen. Penanda aras mesti membezakan antara pengetahuan yang dihafal dengan persepsi secara langsung, jika tidak, ia berisiko menyatakan secara berlebihan keupayaan AI untuk mengemudi dunia visual yang benar-benar tidak diketahui.
