নিয়োগ অ্যালগরিদমগুলোর কাজ ছিল মানুষের অসংগতি দূর করা। একটি মডেলকে পর্যাপ্ত জীবনবৃত্তান্ত (resumes) দিলে সেটি শুধুমাত্র যোগ্যতার ভিত্তিতে বিচার করবে। কিন্তু বাস্তবতা আরও জটিল হয়ে উঠছে। প্রিন্সটন ইউনিভার্সিটি এবং শিকাগো ইউনিভার্সিটির একটি নতুন গবেষণা দেখায় যে, লার্জ ল্যাঙ্গুয়েজ মডেলগুলো কেবল পুরনো কুসংস্কার পুনরুৎপাদন করে না; বরং তারা শূন্য থেকে নতুন নতুন স্টেরিওটাইপ বা গতানুগতিক ধারণা তৈরি করে ফেলে, আর মডেলটি যত বুদ্ধিমান হবে, এটি তত দ্রুত ঘটবে।
পরীক্ষাটি যেভাবে কাজ করেছিল
গবেষকরা একটি কৃত্রিম শ্রমবাজার তৈরি করেছিলেন যাতে রিয়েল টাইমে পক্ষপাতিত্ব কীভাবে তৈরি হয় তা পর্যবেক্ষণ করা যায়। তারা চারটি কাল্পনিক জাতিগোষ্ঠী—Tufa, Aima, Reku, এবং Weki—উদ্ভাবন করেন এবং ChatGPT, Claude, এবং Gemini-এর বিভিন্ন সংস্করণকে বিশটি ভিন্ন ভিন্ন পদে কর্মী নিয়োগের দায়িত্ব দেন। এই তালিকাটি চিকিৎসক ও প্রকৌশলী থেকে শুরু করে পরিচ্ছন্নতা কর্মী ও ঝাড়ুদার পর্যন্ত বিস্তৃত ছিল। এখানে একটি গুরুত্বপূর্ণ তথ্য হলো: পর্দার আড়ালে, প্রতিটি প্রার্থীর সাফল্যের পরিসংখ্যানগত সম্ভাবনা ছিল একদম সমান। একজন Weki-র ডাক্তার হিসেবে সফল হওয়ার সম্ভাবনা ঠিক ততটাই ছিল, যতটা একজন Tufa-র ছিল। গাণিতিকভাবে সবকিছু ছিল নিরপেক্ষ।
কিন্তু নিরপেক্ষতা সেখানে দেখা যায়নি। প্রতিটি নিয়োগ পর্বের পর, মডেলগুলো একটি সাধারণ ফিডব্যাক বা প্রতিক্রিয়া পেত যে তাদের নির্বাচিত প্রার্থী সফল হয়েছে নাকি ব্যর্থ হয়েছে। যখন একজন Aima প্রার্থী একটি উচ্চপদস্থ পদে একবার খারাপ পারফরম্যান্স দেখাল, মডেলটি এটিকে কোনো আকস্মিক ঘটনা হিসেবে দেখল না; বরং এটিকে একটি নিয়ম হিসেবে ধরে নিল। সিস্টেমটি দ্রুত Aima প্রার্থীদের পরিচ্ছন্নতা কর্মীদের মতো নিম্নপদস্থ পদের মধ্যে সীমাবদ্ধ করতে শুরু করল। একটি মাত্র তথ্যই ভাগ্য হয়ে দাঁড়িয়েল। এআই এমন একটি শ্রেণিবিন্যাস তৈরি করেছিল যা কোনো মানব প্রোগ্রামার লেখেননি এবং কোনো ঐতিহাসিক ডেটাসেটেও ছিল না।
যখন বুদ্ধিমান মডেলগুলো নির্বোধ সাধারণীকরণ করে
গবেষকরা একটি পৃথকীকরণ স্কেলে (segregation scale) ফলাফল পরিমাপ করেছিলেন, যেখানে ২.০ মানে একটি নির্দিষ্ট গোষ্ঠীকে একটি নির্দিষ্ট কাজের মধ্যে সম্পূর্ণ সীমাবদ্ধ করে ফেলা। পূর্ববর্তী মনস্তাত্ত্বিক গবেষণায় মানুষের স্কোর ছিল ০.৮৪। ল্যাঙ্গুয়েজ মডেলগুলো সেই মানদণ্ডকে অনেক ছাড়িয়ে গেল। OpenAI-এর রিজনিং মডেল, o3, đạtল ১.৮৩—যা প্রায় নিখুঁত পৃথকীকরণ।
এটি হলো 'এক্সপ্লোরেশন-এক্সপ্লয়েটেশন' (exploration-exploitation) দ্বিধার একটি চরম বহিঃপ্রকাশ। এই সিস্টেমগুলোকে গণিত, কোডিং চ্যালেঞ্জ এবং লজিক পাজল সমাধানে জেতার জন্য টিউন করা হয়েছে। এই ক্ষেত্রগুলো অল্প প্রমাণের ভিত্তিতে দ্রুত সঠিক সিদ্ধান্তে পৌঁছানোর জন্য পুরস্কৃত করে। প্যাটার্নটি শনাক্ত করো। এটি নিশ্চিত করো। আরও দ্রুত কাজ করো। মানুষের ক্ষেত্রে এই একই প্রবণতা প্রয়োগ করলে, মাত্র একটি ব্যর্থ নিয়োগের ভিত্তিতে জাতিগত বিভাজন ঘটে যায়।
আরও খারাপ বিষয় হলো, মডেলগুলো যত উন্নত হচ্ছে, এই প্যাটার্নটি তত তীব্র হচ্ছে। OpenAI-এর o3 এবং DeepSeek-এর R1-এর মতো নতুন উচ্চ-রিজনিং সিস্টেমগুলো আরও শক্তিশালী পক্ষপাতিত্ব দেখিয়েছে, কারণ তারা খুব দ্রুত সাধারণীকরণ করতে আগ্রহী। তারা দ্রুত নিয়ম তৈরি করে এবং সেগুলোকে আক্রমণাত্মকভাবে পরিমার্জিত করার মাধ্যমে অপ্টিমাইজ করে। যখন বিষয়টি মানুষের হয়, তখন সেই আত্মবিশ্বাস একটি বোঝা হয়ে দাঁড়ায়। মডেলটি মনে করে যে এটি Aima গোষ্ঠী সম্পর্কে একটি সত্য আবিষ্কার করেছে। বাস্তবে, এটি একটি মাত্র ব্যতিক্রমী তথ্য (outlier) থেকে একটি খাঁচা তৈরি করেছে।
মেমরি ট্র্যাপ
এই গবেষণাটি একটি অস্বস্তিকর সময়ে সামনে এসেছে। শিল্পটি এখন "agentic" AI-এর দিকে দ্রুত মোড় নিচ্ছে—এমন সিস্টেম যা দীর্ঘমেয়াদী স্মৃতি ধরে রাখে, বিস্তারিত ইউজার প্রোফাইল তৈরি করে এবং মাস বা বছর ধরে সিদ্ধান্তগুলোকে ব্যক্তিগতকৃত করে। কর্নেল ইউনিভার্সিটির কম্পিউটার বিজ্ঞানী অ্যাঞ্জেলিনা ওয়াং সতর্ক করেছেন যে, উন্নত মেমরি মডেলগুলোকে পূর্ববর্তী মিথস্ক্রিয়াগুলোর ওপর "over-index" বা অতিরিক্ত গুরুত্ব দিতে বাধ্য করে। একটি মাত্র নেতিবাচক ব্যতিক্রম—একটি প্রত্যাখ্যান করা ঋণ, একটি চাকরিচ্যুতি বা একটি ফ্ল্যাগ করা আবেদন—একটি স্থায়ী ধারণায় পরিণত হয়। পক্ষপাতিত্ব সময়ের সাথে সাথে ফিকে হয় না; বরং এটি আরও শক্ত হয়ে ওঠে। যে বৈশিষ্ট্যটি এআই-কে আরও সহায়ক এবং প্রেক্ষাপট-সচেতন করার কথা ছিল, সেটিই একে আরও জেদি এবং অন্যায্য করে তুলতে পারে।
আসলে সমস্যাটি কীভাবে সমাধান করা যায়
গবেষকরা বেশ কিছু গার্ডরেল (guardrails) বা সুরক্ষা ব্যবস্থা পরীক্ষা করেছেন এবং ফলাফল ছিল বেশ শিক্ষা""", যা আমাদের বাস্তবতাকে চোখে আঙুল দিয়ে দেখিয়ে দেয়।
একটি মডেলকে কেবল "নিরপেক্ষ হও" বলা প্রায় কিছুই অর্জন করতে পারেনি। নির্দেশটি কেবল একটি সাজসজ্জার মতো ছিল, যখন এর অন্তর্নিহিত অপ্টিমাইজেশন ইঞ্জিন তার আসল লক্ষ্যের দিকে ছুটছিল: সফল নিয়োগের সংখ্যা সর্বোচ্চ করা। অনুরোধের মাধ্যমে আসা নৈতিকতা আসলে অবহেলিত নৈতিকতা।
যে সমাধানটি কাজ করেছে তা ছিল কাঠামোগত। যখন গবেষকরা বৈচিত্র্যময় নিয়োগের ফলাফল বজায় রাখার জন্য মডেলগুলোকে অতিরিক্ত গাণিতিক বোনাস দিলেন, তখন পৃথকীকরণ উল্লেখযোগ্যভাবে কমে গেল। সামাজিক মূল্যবোধকে সরাসরি রিওয়ার্ড ফাংশনের (reward function) মধ্যে অন্তর্ভুক্ত করতে হয়েছিল, কেবল afterthought বা afterthought হিসেবে যুক্ত করলে চলবে না। অন্য কথায়, মডেলটিকে তার নির্দেশনায় কেবল এটি পড়তে হলে চলবে না, বরং তার গণনায় এই নিরপেক্ষতার প্রণোদনা অনুভব করতে হবে।
ডেটা হাইজিনও গুরুত্বপূর্ণ ছিল। প্রাসঙ্গিক ব্যক্তিগত প্রেক্ষাপট—যেমন বয়স, শিক্ষা, কাজের অভিজ্ঞতা—সরবরাহ করার ফলে মডেলগুলো বিবেচনার জন্য বৈধ সংকেত পেয়েছিল, যা জাতিগত কুসংস্কারের ওপর তাদের নির্ভরতা কমিয়ে দিয়েছিল। কিন্তু চুলের রঙের মতো অপ্রাসঙ্গিক তথ্য যোগ করলে, সিস্টেমগুলো সেগুলোকে গোষ্ঠী-ভিত্তিক শ্রেণিবিন্যাসে ফিরে যাওয়ার অজুহাত হিসেবে ব্যবহার করে। বেশি তথ্য মানেই সবসময় ভালো নয়। এটি সম্পূর্ণভাবে নির্ভর করে সেই তথ্যটি কী এবং সেটি মডেলটিকে তার অপ্টিমাইজেশন টার্গেটের জন্য বিকল্প কোনো পথ দিচ্ছে কি না তার ওপর।
আগামীর পথ
এই সবকিছুর গুরুত্ব অনেক, কারণ এই সিস্টেমগুলো কেবল চ্যাট উইন্ডোর মধ্যেই সীমাবদ্ধ থাকছে না। একই আর্কিটেকচারগুলো ঋণ অনুমোদন, প্যারোল সুপারিশ এবং বৃহৎ পরিসরে কর্মী ব্যবস্থাপনা সংক্রান্ত সিদ্ধান্তের জন্য প্রয়োগ করা হচ্ছে, অথবা সক্রিয়ভাবে প্রস্তুত করা হচ্ছে। গবেষকরা “নতুন ধরনের পক্ষপাত” (novel biases) সম্পর্কে সতর্ক করেছেন—এমন সব কুসংস্কার যা কোনো মানুষ কখনো পোষণ করেনি এবং কোনো ঐতিহাসিক ডেটাসেটেও ছিল না, কিন্তু এআই দক্ষতার পেছনে ছুটতে গিয়ে নিজের জন্য তৈরি করে নিয়েছে।
অস্বস্তিকর সত্য হলো যে, কাঁচা যুক্তি ক্ষমতা (raw reasoning ability) এবং সামাজিক ন্যায্যতা একে অপরের বিপরীত দিকে টানতে পারে। একটি মডেল যা সঠিক উত্তরের সংক্ষিপ্ততম পথ খুঁজে পেতে অপ্টিমাইজ করা হয়েছে, সেটি মানুষের সম্পর্কে ভুল ধারণার সংক্ষিপ্ততম পথটিও সানন্দে খুঁজে নেবে। ন্যায্য সিস্টেম তৈরি করার অর্থ কেবল সুন্দরভাবে অনুরোধ করা নয়। এর অর্থ হবে উদ্দেশ্যগুলো নতুন করে ডিজাইন করা, ফিডব্যাক লুপগুলো অডিট করা এবং এটি মেনে নেওয়া যে কিছু সাধারণীকরণ (generalizations)—যেগুলো মানুষের একটি ভুলের ভিত্তিতে তাদের একটি নির্দিষ্ট শ্রেণিতে নামিয়ে আনে—তা কখনোই তৈরি হতে দেওয়া যাবে না। আমরা যদি চাই এআই প্রার্থীদের ন্যায্যভাবে বিচার করুক, তবে আমাদের ন্যায্যতাকে কেবল একটি পরামর্শ হিসেবে দেখা বন্ধ করতে হবে এবং এটিকে একটি হার্ড কনস্ট্রেইন্ট (hard constraint) হিসেবে এনকোড করতে হবে। এর চেয়ে কম কিছু করলে, মেশিনগুলো তাদের অপ্টিমাইজেশনের মাধ্যমে সরাসরি কুসংস্কারের দিকেই ধাবিত হবে।
