Anthropic ১ সেপ্টেম্বর Claude Fable 5.1 এবং Claude Mythos 5.1 রিলিজ করেছে। উভয় মডেল এখন ১ মিলিয়ন টোকেন পর্যন্ত কনটেক্সট গ্রহণ করতে পারে, ১২৮k টোকেন পর্যন্ত আউটপুট দিতে পারে এবং প্রয়োজন অনুযায়ী তাদের রিজনিং ডেপথ (reasoning depth) পরিবর্তন করতে পারে—আর তা করছে প্রতি কলের খরচ কমিয়ে। এই আপগ্রেডগুলোর লক্ষ্য কেবল দ্রুত বেঞ্চমার্ক স্কোর অর্জন করা নয়, বরং আরও সস্তা এবং নির্ভরযোগ্য AI-সহায়তা সম্পন্ন কোডিং এবং উচ্চ-ঝুঁকিপূর্ণ গবেষণাকে লক্ষ্য করা।

কেন এই নতুন সংস্করণগুলো গুরুত্বপূর্ণ

আগের Claude জেনারেশনের কনটেক্সট উইন্ডো ছিল মাত্র কয়েক হাজার টোকেনের মধ্যে সীমাবদ্ধ, যার ফলে ডেভেলপারদের কোড বা ডেটা হাতে ভাগ করে নিতে হতো। ব্যবহারকারীদের ম্যানুয়ালি রিজনিং ডেপথ সেট করতে হতো, যা একটি সাধারণ প্রম্পটকেও পরীক্ষা-নিরীক্ষার খেলায় পরিণত করত। ক্যাশ-রিড (Cache-read) চার্জের কারণে দীর্ঘ সেশন এবং বারবার টুল কল করা ব্যয়বহুল হয়ে উঠত, এবং সিকিউরিটি টিমগুলো প্রচুর পরিমাণে 'ফলস-পজিটিভ' (false-positive) ওয়ার্নিংয়ের অভিযোগ তুলত যা কোড রিভিউ প্রক্রিয়াকে ধীর করে দিত।

Claude Fable 5.1 এবং Claude Mythos 5.1 সরাসরি এই সমস্যাগুলো সমাধান করে। তাদের মূল মস্তিষ্ক (core brain) একই, তবে Anthropic প্রতিটি মডেলের লক্ষ্যযুক্ত দর্শকদের জন্য আলাদা আলাদা গার্ডরেল (guardrails) প্রয়োগ করেছে।

এই পরিবর্তনগুলো আসলে কী করে

  • খরচ কমানো – Anthropic ক্যাশ রিড-এর দাম কমিয়েছে, ফলে দীর্ঘ এবং পুনরাবৃত্তিমূলক কোডিং সেশন এবং বারবার টুল কল করার খরচ এখন উল্লেখযোগ্যভাবে কম—যা স্টার্টআপ এবং ইন-হাউস ডেভ টিমের জন্য একটি নির্ণায়ক বিষয়।
  • অ্যাডাপ্টিভ থিংকিং – মডেলটি নিজেই সিদ্ধান্ত নেয় যে একটি কাজের জন্য কতটা রিজনিং প্রয়োজন। ব্যবহারকারীদের আর “effort levels” পরিবর্তন করতে হয় না বা কতটুকু chain-of-thought প্রম্পটিং প্রয়োজন তা নিয়ে আন্দাজ করতে হয় না।
  • Turn-scoped messages – সিস্টেম-লেভেল নির্দেশাবলী কেবল একটি মাত্র বিনিময়ের (exchange) জন্য প্রযোজ্য হয়, যা পুরনো নির্দেশাবলী পরবর্তী ধাপগুলোতে প্রভাব ফেলা রোধ করে।
  • নিরাপত্তা উন্নতি – Claude Code ব্যবহারকারীরা প্রায় ৬০% কম সাইবার সিকিউরিটি ফলস-পজিটিভ রিপোর্ট করেছেন, যা ভুতুড়ে ওয়ার্নিংগুলোর পেছনে ব্যয় করা সময় কমিয়ে দেয়।
  • ভালনারেবিলিটি ডিটেকশন – Fable 5.1 সফটওয়্যারের ত্রুটি শনাক্ত করতে পারে কিন্তু এক্সপ্লয়েট কোড (exploit code) তৈরি করতে পারে না, যা অডিটরদের উৎপাদনশীলতা বজায় রাখে এবং ক্ষতিকারকদের জন্য পথ খুলে দেয় না।
  • উচ্চ-ঝুঁকিপূর্ণ গবেষণায় ফোকাস – Mythos 5.1 সাইবার সিকিউরিটি এবং লাইফ সায়েন্সেস-এর বিশ্বস্ত প্রোগ্রামগুলোতে ব্যবহৃত হয়। Anthropic এটিকে সাইফার ডিজাইনের মতো কাজগুলোতে স্ট্রেস-টেস্ট করে, তারপর সেই জ্ঞানগুলো সাধারণ উদ্দেশ্যে ব্যবহৃত Fable মডেলে ফিরিয়ে দেয়।

কারা লাভবান হবে এবং কারা বাদ পড়তে পারে

IDE অ্যাসিস্ট্যান্ট, CI পাইপলাইন বা কাস্টম বট তৈরি করা ডেভেলপাররা অর্থ সাশ্রয় করবেন এবং সিকিউরিটি সংক্রান্ত বিভ্রান্তি কম দেখতে পাবেন। সিকিউরিটি অ্যানালিস্ট এবং বায়োটেক গবেষকরা, যারা Anthropic-এর ট্রাস্ট ক্রাইটেরিয়া পূরণ করেন, তারা সংবেদনশীল কাজের জন্য Mythos 5.1-এর কঠোর গার্ডরেল ব্যবহার করতে পারবেন। এর বিনিময়ে: Mythos সাধারণ জনগণের জন্য উন্মুক্ত নয়, তাই ট্রাস্টেড-প্রোগ্রাম সম্পর্ক নেই এমন ছোট দলগুলোকে আরও নমনীয় Fable 5.1-এর ওপর নির্ভর করতে হবে।

সম্ভাব্য অসুবিধা বা অমীমাংসিত প্রশ্নাবলী

এক্সপ্লয়েট জেনারেশন ব্লক করা সেই সব রেড-টিম (red-team) ব্যবহারকারীদের হতাশ করতে পারে যাদের প্রতিরক্ষা পরীক্ষা করার জন্য বাস্তবসম্মত অ্যাটাক কোড প্রয়োজন। “ট্রাস্টেড-প্রোগ্রাম” গেটওয়ে একটি স্তরভিত্তিক AI মার্কেট তৈরি করতে পারে, যেখানে কেবল সুপ্রতিষ্ঠিত বা অর্থবহ সংস্থাগুলোই সবচেয়ে নিরাপদ এবং উচ্চ-ক্ষমতাসম্পন্ন মডেলটি ব্যবহার করতে পারবে। যদিও ক্যাশ-রিড প্রাইসিং কমেছে, Anthropic তাদের সম্পূর্ণ কস্ট মডেল প্রকাশ করেনি, যার ফলে বিশাল কাজের ক্ষেত্রে প্রকৃত সাশ্রয় কত হবে তা নিয়ে ডেভেলপাররা অনিশ্চিত।

পরবর্তীতে কী লক্ষ্য করবেন

অ্যাডপশন রেট (Adoption rates) দেখাবে যে খরচ এবং নিরাপত্তার প্রতিশ্রুতিগুলো বাস্তবে উৎপাদনশীলতা বৃদ্ধিতে কতটা কার্যকর হয়। যদি ডেভেলপাররা বড় কোডবেসের জন্য ১ মিলিয়ন টোকেন উইন্ডো পছন্দ করেন, তবে Anthropic-কে Mythos-এর মতো গার্ডরেল আরও বৃহত্তর জনগোষ্ঠীর জন্য উন্মুক্ত করার চাপের মুখে পড়তে হতে পারে। ফলস-পজিটিভ হ্রাসের হার এবং ভালনারেবিলিটি-স্ক্যানিং পাইপলাইনে এর প্রভাব পর্যবেক্ষণ করুন যাতে বোঝা যায় আক্রমণাত্মক ব্যবহারের ক্ষেত্রে নতুন সিকিউরিটি পজিশন কতটা কার্যকর।

সারকথা: Claude Fable 5.1 এবং Claude Mythos 5.1-এর লক্ষ্য কেবল বেঞ্চমার্ক ভাঙা নয়, বরং দীর্ঘমেয়াদী AI ওয়ার্কফ্লোর খরচ কমানো এবং সবচেয়ে সংবেদনশীল অ্যাপ্লিকেশনগুলোর জন্য নিরাপত্তা ব্যবস্থা আরও শক্তিশালী করা।