OpenAI জানিয়েছে যে তাদের GPT-5.6 Sol মডেলটি ARC-AGI-3 লজিক্যাল-রিজনিং (logical-reasoning) বেঞ্চমার্কে ৩৮.৩% সাফল্যের হার অর্জন করেছে, যা Anthropic-এর Claude Opus 5-এর ৩০.২% সাফল্যের হারকে ছাড়িয়ে গেছে। এই ব্যবধানটি কেবল তখনই দেখা যায় যখন মডেলটি OpenAI-এর কাস্টম Responses API-এর মাধ্যমে চলে, যা ইনফারেন্স-টাইম (inference-time) দুটি বিশেষ কৌশল যোগ করে যা অফিসিয়াল টেস্ট হারনেস (test harness) অনুমতি দেয় না।
প্রেক্ষাপট: একটি বেঞ্চমার্কের অস্ত্র প্রতিযোগিতা
ARC-AGI-3 কোনো মুখস্থ তথ্যের ওপর নির্ভর না করে নতুন এবং বহু-ধাপ বিশিষ্ট সমস্যা সমাধানের মডেলের ক্ষমতা যাচাই করে। এই বছরের শুরুর দিকে Anthropic এই বেঞ্চমার্কে চারগুণ উন্নতির ঘোষণা করেছিল, যা Opus 5-কে পাবলিক লিডারবোর্ডের শীর্ষে নিয়ে এসেছিল। সেই ফলাফলটি মডেলের "র" (raw) সক্ষমতার জন্য একটি নতুন মানদণ্ড স্থাপন করেছিল, কারণ অফিসিয়াল হারনেস প্রতিটি ধাপের পর মধ্যবর্তী যুক্তি বা রিজনিং (reasoning) মুছে ফেলে, যার ফলে মডেলটিকে প্রতিবার নতুন করে শুরু করতে হয়।
OpenAI-এর এই দাবিটি একই প্রতিযোগিতামূলক পরিবেশে এসেছে। একটি উচ্চতর স্কোর প্রকাশ করার মাধ্যমে কোম্পানিটি ইঙ্গিত দিচ্ছে যে তাদের সর্বশেষ প্রজন্মের মডেলটি কেবল তাদের প্রধান প্রতিদ্বন্দ্বীর লজিক্যাল পারফরম্যান্সের সাথে পাল্লা দিতেই পারে না, বরং তা ছাড়িয়েও যেতে পারে। তবে, এই শিরোনামটি একটি প্রযুক্তিগত সূক্ষ্মতাকে আড়াল করে রেখেছে যা বেঞ্চমার্ক টেবিল পড়ার ক্ষেত্রে কমিউনিটির দৃষ্টিভঙ্গি বদলে দিচ্ছে।
সংখ্যাগুলোর প্রকৃত অর্থ কী
যখন GPT-5.6 Sol-কে সেই একই অফিসিয়াল ARC-AGI-3 হারনেসের অধীনে মূল্যায়ন করা হয় যা Opus 5-কে ৩০.২% ফলাফল দিয়েছিল, তখন মডেলটির সাফল্যের হার কমে মাত্র ৭.৮%-এ নেমে আসে। এই বিশাল পরিবর্তনটি কোনো ত্রুটি নয়; এটি OpenAI-এর মডেলের সাথে যুক্ত দুটি ইঞ্জিনিয়ার্ড ফিচারের ফলাফল:
- Retained Reasoning – প্রতিটি সাব-টাস্ক বা উপ-কাজের পর চেইন-অফ-থট (chain-of-thought) মুছে ফেলার পরিবর্তে, সিস্টেমটি মধ্যবর্তী টেক্সটগুলো সচল রাখে, যা মডেলটিকে পূর্ববর্তী সিদ্ধান্তগুলোর দিকে ফিরে যেতে এবং একটি ক্রমবর্ধমান যুক্তি তৈরি করতে সাহায্য করে।
- Compaction – টোকেন লিমিটের মধ্যে থাকার জন্য পুরনো কনটেক্সট বা প্রেক্ষাপট ছোট করে ফেলার পরিবর্তে, এই র্যাপার (wrapper) পূর্ববর্তী ধাপগুলোকে একটি সংক্ষিপ্ত সারসংক্ষেপে সংকুচিত করে ফেলে, যা প্রম্পটের আকার নিয়ন্ত্রণে রেখে লজিক্যাল থ্রেড বা যুক্তির ধারা বজায় রাখে।
এই দুটি মেকানিজমই প্রোপাইটারি (proprietary) Responses API-তে বিদ্যমান। মডেলটিকে একটি সমৃদ্ধ এবং নিরবচ্ছিন্ন কনটেক্সট প্রদানের মাধ্যমে, OpenAI কার্যকরভাবে মডেলের "মেমরি" বা স্মৃতিশক্তি বৃদ্ধি করে এবং এটিকে নিজস্ব যুক্তি পুনরায় ব্যবহার করতে দেয়। এর বিপরীতে, অফিসিয়াল হারনেস একটি কঠোর "স্টেটলেস" (stateless) মোড প্রয়োগ করে যা এই সুবিধাগুলোকে কেড়ে নেয়।
কেন এই পদ্ধতিটি গুরুত্বপূর্ণ
এই ঘটনাটি AI মূল্যায়নে একটি ক্রমবর্ধমান বিভাজনকে তুলে ধরে: র (raw) মডেল স্কোর বনাম সিস্টেম-লেভেল পারফরম্যান্স। OpenAI যুক্তি দিচ্ছে যে, একটি বেঞ্চমার্কের উচিত সেই পুরো স্ট্যাককে প্রতিফলিত করা যা ডেভেলপাররা বাস্তবে ব্যবহার করবেন – অর্থাৎ মডেল, ইনফারেন্স পাইপলাইন এবং মেমরি ম্যানেজমেন্ট। সেই দৃষ্টিকোণ থেকে, ৩৮.৩% স্কোর একটি প্রোডাক্ট টিমকে জানায় যে, বিচ্ছিন্নভাবে মূল্যায়ন করা কোনো মডেলের তুলনায় এই সম্মিলিত অফারটি বাস্তব জগতের আরও বেশি কাজ সমাধান করতে পারে।
সমালোচকরা বলছেন এটি বৈজ্ঞানিক অগ্রগতিকে অস্পষ্ট করে তোলে। যদি প্রতিটি ল্যাব নিজস্ব কাস্টম র্যাপার যোগ করে, তবে লিডারবোর্ডটি মডেলের বুদ্ধিমত্তার একটি স্বচ্ছ তুলনার পরিবর্তে ইঞ্জিনিয়ারিং ট্রিকসের একটি মিশ্রণে পরিণত হবে। অফিসিয়াল ARC-AGI-3 হারনেসের অস্তিত্ব রয়েছে খেলার মাঠকে সমান করার জন্য, যাতে একটি উচ্চতর সংখ্যা একটি প্রকৃত শক্তিশালী অন্তর্নিহিত মডেলকে নির্দেশ করে, কোনো স্মার্ট র্যাপারকে নয়।
ডেভেলপার এবং বিনিয়োগকারীদের জন্য গুরুত্ব
AI-চালিত প্রোডাক্ট তৈরি করা স্টার্টআপগুলোর জন্য এই পার্থক্যটি অত্যন্ত ব্যবহারিক। যে মডেল যুক্তি ধরে রাখতে পারে এবং কনটেক্সট সংকুচিত করতে পারে, তার সমাধান পেতে কম প্রম্পট ইঞ্জিনিয়ারিং, কম ইনফারেন্স ল্যাটেন্সি এবং কম API কলের প্রয়োজন হতে পারে। এর ফলে কম্পিউটিং খরচ কমে এবং ব্যবহারকারীর অভিজ্ঞতা আরও মসৃণ হয়। যে কোম্পানিগুলো একটি টার্নকি (turnkey) সিস্টেম – মডেল এবং অপ্টিমাইজড ইনফারেন্স লেয়ারসহ – সরবরাহ করে, তারা গতি এবং খরচের ক্ষেত্রে প্রতিযোগিতামূলক সুবিধা পায়।
বিনিয়োগকারীরা ভবিষ্যতের রাজস্বের সূচক হিসেবে বেঞ্চমার্কে উন্নতির দিকে নজর রাখেন। একটি শিরোনাম আকর্ষক লিড বা ব্যবধান একটি ফার্মের ভ্যালুয়েশন বাড়িয়ে দিতে পারে, এমনকি যদি অন্তর্নিহিত মডেলের র (raw) সক্ষমতা প্রতিদ্বন্দ্বীদের সমানও হয়। তাই সংখ্যাগুলো আসলে কী নির্দেশ করে, তা নিয়ে বিতর্ক AI সেক্টরে মূলধনের প্রবাহকে প্রভাবিত করে।
পরবর্তীতে যা লক্ষ্য রাখতে হবে
- Standard-setter-দের প্রতিক্রিয়া – বেঞ্চমার্ক আয়োজকরা "এক্সটার্নাল" ইনফারেন্স ট্রিকস সংক্রান্ত নিয়ম আরও কঠোর করতে পারেন অথবা একটি আলাদা "সিস্টেম" ট্র্যাক যোগ করতে পারেন যা স্পষ্টভাবে এগুলোকে অনুমতি দেয়। তাদের প্রতিক্রিয়া পরবর্তী পাবলিক লিডারবোর্ডের ধারা নির্ধারণ করবে।
- ওপেন-সোর্স র্যাপার – যদি কমিউনিটি retained reasoning এবং compaction-এর নিজস্ব ইমপ্লিমেন্টেশন প্রকাশ করে, তবে এই সুবিধাটি একটি প্রোপাইটারি সুবিধার পরিবর্তে একটি বেসলাইন ফিচারে পরিণত হতে পারে।
- বাস্তব জগতের টেস্টবেড – কোম্পানিগুলো ক্রমবর্ধমানভাবে তাদের নিজস্ব প্রোপাইটারি প্রবলেম সেটের (যেমন: অভ্যন্তরীণ কোড-জেনারেশন স্যুট) ওপর পারফরম্যান্স প্রকাশ করছে। সেই ফলাফলগুলো তুলনামূলকভাবে কম হলেও, একটি একক পাবলিক বেঞ্চমার্কের চেয়ে সেগুলো আরও বেশি গুরুত্বপূর্ণ হয়ে উঠবে।
পাল্টা যুক্তি: এটি কি বেঞ্চমার্ককে "গেমিং" করা?
কিছু গবেষক কাস্টম API-এর ব্যবহারকে “benchmark gaming” হিসেবে অভিহিত করেন এবং যুক্তি দেন যে এটি মূল মডেলের বোধগম্যতা বৃদ্ধি না করেই স্কোর বাড়িয়ে দেয়। তারা উল্লেখ করেন যে, কঠোর সীমাবদ্ধতার অধীনে একটি মডেলের পারফরম্যান্স যদি এক অংকের (single-digit) পর্যায়ে নেমে আসে, তবে তা AGI লক্ষ্যের চেয়ে অনেক দূরে। উদ্বেগের বিষয় হলো, এই ক্ষেত্রটি হয়তো যুক্তিবোধের (reasoning ability) প্রকৃত উন্নতির পরিবর্তে ইঞ্জিনিয়ারিংয়ের শর্টকাটগুলোকে পুরস্কৃত করতে শুরু করতে পারে।
OpenAI-এর পক্ষ থেকে জোর দিয়ে বলা হচ্ছে যে, মডেল এবং সিস্টেমের মধ্যকার সীমারেখা দিন দিন কৃত্রিম হয়ে উঠছে। আধুনিক AI অ্যাপ্লিকেশনগুলো খুব কমই কোনো মডেলকে বিচ্ছিন্নভাবে চালায়; এগুলো সবসময় একটি সার্ভিং লেয়ারের (serving layer) মাধ্যমে পরিচালিত হয় যা ক্যাশিং (caching), কনটেক্সট স্টিচিং (context stitching) এবং আউটপুট পোস্ট-প্রসেসিং নিয়ন্ত্রণ করে। সেই দৃষ্টিকোণ থেকে দেখলে, পুরো পাইপলাইনটি পরিমাপ করা ব্যবহারকারীরা আসলে যা অনুভব করেন তার প্রতি আরও বেশি স্বচ্ছ।
সারসংক্ষেপ
GPT-5.6 Sol-এর ঘটনাটি দেখায় যে, আজকের বেঞ্চমার্ক বিজয়গুলো মডেলের আকারের পাশাপাশি ইনফারেন্স ইঞ্জিনিয়ারিংয়ের (inference engineering) ওপরও সমানভাবে নির্ভরশীল। কমিউনিটি সিস্টেম-লেভেল স্কোর গ্রহণ করবে নাকি কাস্টম র্যাপারগুলোর (custom wrappers) ওপর নিয়ন্ত্রণ আনবে, তার ওপর ভিত্তি করেই পরবর্তী “leaderboard”-এর শিরোনাম আমরা কীভাবে পড়ব তা নির্ধারিত হবে। যারা AI পণ্য তৈরি করছেন বা অর্থায়ন করছেন, তাদের জন্য শিক্ষাটি স্পষ্ট: কাঁচা সংখ্যা বা র (raw) নম্বর গুরুত্বপূর্ণ, তবে আশেপাশের সফটওয়্যার বাস্তব জগতের পারফরম্যান্সে নির্ণায়ক ভূমিকা পালন করতে পারে।
