স্ট্যানফোর্ডের 2026 AI Index অনুযায়ী গত বছর নিরাপত্তা সংক্রান্ত ঘটনার সংখ্যা বেড়ে 362টিতে দাঁড়িয়েছে, যা দ্রুত মডেলের উন্নতি এবং সেগুলোকে নির্ভরযোগ্য রাখার জন্য প্রয়োজনীয় সুরক্ষাব্যবস্থার মধ্যে ক্রমবর্ধমান ব্যবধানকে স্পষ্ট করে তুলেছে। প্রতিটি অনিয়ন্ত্রিত ব্যর্থতা অর্থায়ন, স্বাস্থ্য এবং জনসেবা খাতে ইতিমধ্যে ব্যবহৃত সিস্টেমগুলোর ওপর আস্থা কমিয়ে দিচ্ছে।
এই ব্যবধানের পেছনের তথ্য
Institute for Human-Centered Artificial Intelligence দ্বারা সংকলিত এই Index-টি মডেলের চমকপ্রদ পারফরম্যান্স এবং বাস্তব জগতের নির্ভরযোগ্যতার মধ্যে তুলনা করে। শীর্ষস্থানীয় মডেলগুলো এখনও বেঞ্চমার্ক পরীক্ষায় সফল হলেও, তাদের “hallucination” বা বিভ্রমের হার—যেখানে তারা মিথ্যা বা বানোয়াট তথ্য প্রদান করে—পুরো ক্ষেত্রে বিস্ময়করভাবে 22% থেকে 94% পর্যন্ত বিস্তৃত। যখন ব্যবহারকারীরা মডেলগুলোকে উদ্দেশ্যমূলকভাবে ভুল তথ্য প্রদান করেন, তখন GPT-4o-এর নির্ভুলতা 98.2% থেকে কমে 64.4%-এ নেমে আসে; একই পরীক্ষায় DeepSeek R1-এর নির্ভুলতা 90%-এর কিছু বেশি থেকে কমে মাত্র 14.4%-এ দাঁড়ায়। নিরাপত্তা রক্ষাকারী ব্যবস্থা (safety guardrails), যা ক্ষতিকারক প্রম্পট ব্লক করার কথা, আক্রমণকারীরা পরীক্ষা করার সময় তা নিয়মিতভাবে ভেঙে পড়ে।
কেন কোম্পানিগুলো হিমশিম খাচ্ছে
নীতি গ্রহণ করার হার তা কার্যকর করার হারের চেয়ে বেশি। পূর্ববর্তী জরিপ এবং এই বছরের মধ্যে কোনো AI গভর্নেন্স বা শাসন ব্যবস্থা নেই এমন প্রতিষ্ঠানের হার 24% থেকে কমে 11%-এ দাঁড়িয়েছে, এবং অনেকেই এখন ISO/IEC 42001 বা NIST AI Risk Management Framework-এর মতো মানদণ্ডগুলো অনুসরণ করছেন। একটি নীতি প্রণয়ন করা এবং সেটি মেনে চলা এক কথা নয়। ৫৯% উত্তরদাতার ক্ষেত্রে অভ্যন্তরীণ জ্ঞানের অভাব রয়েছে, ৪৮% ক্ষেত্রে বাজেটের সীমাবদ্ধতা বাধা হয়ে দাঁড়াচ্ছে এবং ৪১% ক্ষেত্রে নিয়ন্ত্রক সংক্রান্ত অনিশ্চয়তা সমস্যা সৃষ্টি করছে। রিপোর্টটি এটিকে একটি “প্রযুক্তিগত সমস্যা” হিসেবে অভিহিত করেছে: গোপনীয়তা নিয়ন্ত্রণ কঠোর করলে তা অনিচ্ছাকৃতভাবে নিরপেক্ষতার মানদণ্ডকে (fairness metrics) দুর্বল করে দিতে পারে, এবং এর উল্টোটাও হতে পারে; ফলে প্রকৌশলীরা পর্যাপ্ত সরঞ্জাম বা অর্থায়ন ছাড়াই পরস্পরবিরোধী লক্ষ্যগুলোর মধ্যে ভারসাম্য বজায় রাখতে হিমশিম খাচ্ছেন।
বর্তমান নিরাপত্তা যাচাইয়ের বিভ্রম
ট্রান্সপারেন্সি স্কোর—অর্থাৎ ডেভেলপাররা কতটা খোলামেলাভাবে মডেলের সীমাবদ্ধতা এবং পরীক্ষার পদ্ধতিগুলো প্রকাশ করেন তার একটি সমষ্টিগত মান—58 থেকে কমে 40-এ নেমে এসেছে, যা নির্দেশ করে যে স্বেচ্ছামূলক রিপোর্টিং বা প্রতিবেদন প্রদান তার গ্রহণযোগ্যতা হারাচ্ছে। কোম্পানিগুলো অভ্যন্তরীণ অডিটের ওপর নির্ভর করে যা প্রায়শই Index-এ নথিভুক্ত হওয়া বিশেষ বা প্রান্তিক পর্যায়ের (edge-case) ব্যর্থতাগুলো শনাক্ত করতে পারে না। এর ফলে নিরাপত্তার একটি মিথ্যা ধারণা তৈরি হয়; প্রতিষ্ঠানগুলো মনে করে তারা সুরক্ষিত, অথচ লুকানো দুর্বলতাগুলো রয়েই যায়।
পাল্টা যুক্তি: মানদণ্ডগুলো জনপ্রিয়তা পাচ্ছে
সমর্থকদের যুক্তি হলো যে ISO এবং NIST ফ্রেমওয়ার্কগুলো অনুসরণ করা একটি ইতিবাচক পদক্ষেপ। আনুষ্ঠানিক মানদণ্ডগুলো অডিটর এবং নিয়ন্ত্রকদের একটি সাধারণ ভাষা এবং প্রাথমিক প্রত্যাশা প্রদান করে, যা বিভিন্ন প্রতিষ্ঠানের মধ্যে তুলনা করা সহজ করে তোলে। যারা দ্রুত এই নীতিগুলো গ্রহণ করেছেন, তারা জানিয়েছেন যে নীতি থাকা অবস্থায় অভ্যন্তরীণ সমন্বয় এবং সমস্যা সমাধানের পথ (escalation paths) অনেক বেশি স্পষ্ট থাকে। নীতি গ্রহণের হার বৃদ্ধি পাওয়া এটাই নির্দেশ করে যে শিল্পটি ঝুঁকি সম্পর্কে সচেতন এবং গভর্নেন্সে বিনিয়োগ করতে ইচ্ছুক।
কোন বিষয়গুলো এখনও অনুপস্থিত
কাগজে-কলমে নীতি থাকলেও বাস্তবায়নে ঘাটতি রয়েছে। Index তিনটি ব্যবহারিক প্রতিবন্ধকতার কথা তুলে ধরেছে:
- জ্ঞানের অভাব: দলগুলোর AI ঝুঁকি সম্পর্কে গভীর দক্ষতার অভাব রয়েছে, যার ফলে কেবল উপর্যুপরিভাবে কমপ্লায়েন্স বা নিয়ম মেনে চলার পরীক্ষা করা হয়।
- অর্থায়নের ঘাটতি: নিরাপত্তা সরঞ্জাম, তৃতীয় পক্ষের অডিট এবং নিরবচ্ছিন্ন পর্যবেক্ষণের জন্য যে বাজেটের প্রয়োজন, তা অনেক কোম্পানি দিতে পারছে না।
- নিয়ন্ত্রক অস্পষ্টতা: অস্পষ্ট বা পরিবর্তনশীল আইনগুলোর কারণে দীর্ঘমেয়াদী কমপ্লায়েন্স রোডম্যাপ তৈরি করা কঠিন হয়ে পড়ে।
এই সমস্যাগুলো সমাধানের জন্য সম্ভবত বাহ্যিক যাচাইকরণের প্রয়োজন হবে। রিপোর্টটি আত্ম-মূল্যায়নের বাইরে গিয়ে স্বাধীন মূল্যায়নের পরামর্শ দিচ্ছে, যা বাস্তব জগতের ব্যবহার এবং অ্যাডভারসারিয়াল অ্যাটাক (adversarial attacks) সিমুলেট করতে পারে। এটি এমন প্রকৌশলগত সমাধানেরও আহ্বান জানিয়েছে যা নিরাপত্তা যাচাইকে কেবল afterthought বা afterthought হিসেবে না দেখে সরাসরি মডেল পাইপলাইনের অন্তর্ভুক্ত করবে।
