Anthropic-এর Fable 5 মডেলটি শুধুমাত্র গেমের ভিজ্যুয়াল আউটপুট ব্যবহার করে Pokémon FireRed-এর একটি চীনা ভাষার সংস্করণ খেলার সময় ১,৭৮৫টি টার্নে প্রথম জিম ব্যাজ অর্জন করেছে এবং এতে খরচ হয়েছে $৬৫.৪০। এই পরীক্ষাটি প্রমাণ করে যে মডেলটি কোনো টেক্সট প্রম্পট ছাড়াই গেমের একটি পরিচিত অংশ শেষ করতে পারে, তবে মডেলটির 'thinking chain'-এর গভীরে বিশ্লেষণ করলে দেখা যায় যে এটি প্রতিটি পিক্সেল দেখে বা তা নিয়ে যুক্তি প্রদান করার পরিবর্তে মুখস্থ করা গেমের তথ্যগুলো আওড়াচ্ছিল।
Anthropic-এর দাবিকে পরীক্ষার মুখে আনা হলো
Anthropic যখন Fable 5 রিলিজ করে, তখন কোম্পানিটি একটি “vision-only” ডেমোর কথা তুলে ধরেছিল যেখানে মডেলটি শুধুমাত্র স্ক্রিনের দিকে তাকিয়ে Pokémon FireRed পরিচালনা করেছিল। শিরোনামটি এমনভাবে উপস্থাপন করা হয়েছিল যেন সিস্টেমটি যেকোনো ভিজ্যুয়াল পরিবেশ একদম শুরু থেকে ব্যাখ্যা করতে সক্ষম। একজন ডেভেলপার Anthropic-এর লঞ্চ পেজে বর্ণিত সেটআপটি পুনরায় তৈরি করে এবং গেমটির একটি চীনা অনুবাদের ওপর মডেলটি চালিয়ে সেই দাবিটি যাচাই করার উদ্যোগ নেন।
পরীক্ষাটি কীভাবে চালানো হয়েছিল
একটি কাস্টম হারনেস (harness) মডেলটিকে র (raw) ভিডিও ফ্রেম সরবরাহ করেছিল এবং এর কাজের পছন্দগুলো (action choices) রেকর্ড করেছিল। হারনেসটি Anthropic-এর বর্ণনার সাথে সামঞ্জস্যপূর্ণ ছিল, যা প্রতিটি নতুন ফ্রেম মডেলের কাছে পাঠাত এবং নির্বাচিত কন্ট্রোলার ইনপুটগুলো পড়ে নিত। পরীক্ষাটি পুরো গেম লুপটি ততক্ষণ চালিয়েছিল যতক্ষণ না মডেলটি তার প্রথম জিম ব্যাজ অর্জন করে, এরপর এটি ২,০০০তম টার্ন পর্যন্ত চলেছিল, যখন অবতারটি Route 3-এ পৌঁছেছিল।
পরিমাণগত ফলাফলটি ছিল স্পষ্ট:
- ১,৭৮৫টি টার্নের পর প্রথম জিম ব্যাজ অর্জন করা হয়েছে
- মোট কম্পিউট খরচ $৬৫.৪০
- ২,০০০তম টার্নের মধ্যে অবতারটি Route 3-এ ছিল
লগগুলো কী প্রকাশ করে
তবে র (raw) লগগুলো মডেলটি কীভাবে সেখানে পৌঁছাল সে সম্পর্কে ভিন্ন একটি গল্প বলে। মডেলটির অভ্যন্তরীণ “thinking chain” বারবার এমন সব তথ্য লিখেছিল যা তখনও স্ক্রিনে প্রদর্শিত হয়নি।
- ৭৮তম টার্নে মডেলটি উল্লেখ করেছিল যে প্রতিদ্বন্দ্বী Charmander বেছে নেবে, যদিও গেমটি তখনও প্রতিদ্বন্দ্বীর পছন্দ প্রদর্শন করেনি।
- ১৪১ টার্ন পরে, যখন গেমটি অবশেষে খেলোয়াড়কে Oak’s Parcel প্রদান করে, মডেলটি ইতিমধ্যে তার নোটে আইটেমটির নাম লিখে রেখেছিল।
- Route 3 অতিক্রম করার সময়, মডেলটি একটি বিখ্যাত সংলাপ উদ্ধৃত করে একজন নির্দিষ্ট ট্রেইনারকে শনাক্ত করেছিল যা ভিজ্যুয়াল ফিডে কখনোই দেখা যায়নি।
এই এন্ট্রিগুলো পিক্সেল-বাই-পিক্সেল বিশ্লেষণের ফল নয়। এগুলো এমন একটি সিস্টেমের বৈশিষ্ট্য যা গেমটির একটি বিস্তারিত স্ক্রিপ্ট আয়ত্ত করে ফেলেছে—ঠিক সেই ধরনের জ্ঞান যা ইন্টারনেটে থাকা ওয়াকথ্রু (walkthrough), উইকি এবং ফ্যান ভিডিওগুলোতে পাওয়া যায়। অন্য কথায়, মডেলটি দৃশ্যমানতা বা ভিশন ব্যবহার করছে কেবল একটি মানচিত্র নিশ্চিত করার জন্য যা এটি আগে থেকেই মুখস্থ জানে।
ভিজ্যুয়াল-রিজনিং বেঞ্চমার্কের জন্য এটি কেন গুরুত্বপূর্ণ
পরীক্ষাটি অনেক ভিজ্যুয়াল-রিজনিং টেস্টের একটি সূক্ষ্ম কিন্তু গুরুত্বপূর্ণ ত্রুটিকে চিহ্নিত করে:
- পরিচ্ছন্ন ইনপুট একটি পরিচ্ছন্ন জ্ঞান অবস্থার নিশ্চয়তা দেয় না। এমনকি যখন একমাত্র মাধ্যম একটি ইমেজ স্ট্রিমও হয়, মডেলটি মুখস্থ করা তথ্যের একটি বিশাল ভাণ্ডার থেকে তথ্য নিতে পারে।
- সিস্টেম প্রম্পট ট্রেনিং ডেটা মুছে ফেলতে পারে না। যে মডেল একটি সম্পূর্ণ ওয়াকথ্রু দেখেছে, তাকে রিট্রেনিং ছাড়া সেটি “ভুলে যেতে” বাধ্য করা যায় না।
- পারফরম্যান্স মেমরি পরিমাপ করতে পারে, পারসেপশন নয়। যখন টেস্ট ওয়ার্ল্ড বা পরীক্ষার জগতটি একটি পরিচিত ডেটাসেটের সাথে মিলে যায়, তখন একটি মডেল নতুন ভিজ্যুয়াল তথ্য ব্যাখ্যা করার পরিবর্তে প্যাটার্নের সাথে প্যাটার্ন মিলিয়ে সফল হতে পারে।
বেঞ্চমার্কগুলো যদি “vision-only”-কে ভিজ্যুয়াল রিজনিংয়ের প্রক্সি হিসেবে গণ্য করা অব্যাহত রাখে, তবে নতুন পরিবেশ বোঝার ক্ষেত্রে এআই-এর সক্ষমতা সম্পর্কে অতিরঞ্জিত দাবি করার ঝুঁকি তৈরি হবে। কোম্পানিগুলো চিত্তাকর্ষক সংখ্যা প্রদর্শন করতে পারে অথচ এর অন্তর্নিহিত দক্ষতা সীমিত থাকতে পারে—এটি এমন একটি বিষয় যা বিনিয়োগকারী, ডেভেলপার এবং যারা নিরাপত্তা-সংবেদনশীল সিস্টেম তৈরি করছেন তাদের জন্য অত্যন্ত গুরুত্বপূর্ণ, কারণ সেই সিস্টেমগুলোকে সত্যিকারের অজানা পরিবেশে কাজ করতে হয়।
পাল্টা যুক্তি: মুখস্থ করা কি সত্যিই একটি সমস্যা?
কেউ কেউ যুক্তি দেন যে একটি পরিচিত মানচিত্র নিশ্চিত করার জন্যও এক ধরনের রিজনিং বা যুক্তির প্রয়োজন: মডেলটিকে তার অভ্যন্তরীণ উপস্থাপনাকে (internal representation) বর্তমান ভিজ্যুয়াল সংকেতের সাথে সামঞ্জস্যপূর্ণ করতে হয়। সেই দৃষ্টিকোণ থেকে, ডেমোটি একটি দরকারী সক্ষমতা প্রদর্শন করে—একটি পূর্ববিদ্যমান জ্ঞানভাণ্ডারকে ভিত্তি হিসেবে ব্যবহার করতে ভিশন বা দৃশ্যমানতা ব্যবহার করা। এই আপত্তিটি বৈধ; টাস্কটিতে একটি পারসেপচুয়াল চেক বা উপলব্ধিমূলক যাচাইয়ের বিষয় রয়েছে।
তবে মূল বেঞ্চমার্কের লক্ষ্য হলো সাধারণ ভিজ্যুয়াল ইনফারেন্স বা অনুমান ক্ষমতা যাচাই করা, কোনো সংরক্ষিত স্ক্রিপ্ট পুনরুদ্ধার করা নয়। যখন একটি মডেল কোনো ঘটনা ঘটার আগেই তা অনুমান করতে পারে, তখন পরীক্ষাটি আর পারসেপশন বা উপলব্ধিকে আলাদাভাবে যাচাই করতে পারে না। দরকারী গ্রাউন্ডিং এবং সরাসরি চিটিংয়ের মধ্যে পার্থক্য অস্পষ্ট হয়ে যায় এবং ফলাফলগুলো তাদের ডায়াগনস্টিক মান হারিয়ে ফেলে।
পরবর্তী পদক্ষেপ এবং কমিউনিটির প্রতিক্রিয়া
মুখস্থ করার ক্ষমতার সীমা পরীক্ষা করার জন্য, পরীক্ষক এখন পরিবর্তিত ভূপ্রকৃতিসহ একটি পরিবর্তিত ম্যাপে একই মডেলটি চালাচ্ছেন। সমস্ত কোড, কাস্টম হারনেস এবং সম্পূর্ণ লগ ফাইলগুলো জনসমক্ষে আনা হয়েছে, যাতে অন্যান্য গবেষকরা এই পরীক্ষাটি পুনরায় করতে পারেন বা এটি বিভিন্ন গেমে প্রয়োগ করতে পারেন। চলমান আলোচনার জন্য একটি লার্নিং কমিউনিটি প্ল্যাটফর্মে একটি আলোচনা চ্যানেলও খোলা হয়েছে।
মূল শিক্ষা
একটি ভিশন-অনলি ডেমো যা সফল হয় কারণ মডেলটি ইতিমধ্যে উত্তরটি জানে, তা প্রকৃত ভিজ্যুয়াল রিজনিং বা চাক্ষুষ যুক্তির প্রমাণ নয়। বেঞ্চমার্কগুলোকে অবশ্যই মুখস্থ করা জ্ঞান এবং তাৎক্ষণিক উপলব্ধি থেকে আলাদা করতে হবে, অন্যথায় সম্পূর্ণ অজানা দৃশ্যমান জগত নেভিগেট করার ক্ষেত্রে এআই-এর ক্ষমতাকে অতিরঞ্জিত করার ঝুঁকি থেকে যায়।
