भर्ती एल्गोरिदम को मानवीय विसंगतियों को दूर करने के लिए बनाया गया था। एक मॉडल को पर्याप्त रेज़्यूमे खिलाएं, और वह केवल योग्यताओं के आधार पर निर्णय लेगा। वास्तविकता कहीं अधिक जटिल होती जा रही है। प्रिंसटन यूनिवर्सिटी और शिकागो यूनिवर्सिटी के एक नए अध्ययन से पता चलता है कि लार्ज लैंग्वेज मॉडल्स न केवल पुराने पूर्वाग्रहों को दोहराते हैं, बल्कि वे शून्य से नए रूढ़िवादी विचार (stereotypes) भी गढ़ते हैं, और मॉडल जितना स्मार्ट होगा, यह प्रक्रिया उतनी ही तेज़ होगी।

प्रयोग कैसे काम किया

शोधकर्ताओं ने वास्तविक समय में पूर्वाग्रह (bias) बनते देखने के लिए एक सिम्युलेटेड श्रम बाजार बनाया। उन्होंने चार काल्पनिक जातीय समूह बनाए—Tufa, Aima, Reku, और Weki—और ChatGPT, Claude, और Gemini के विभिन्न वर्ज़न को बीस अलग-अलग नौकरियों के लिए स्टाफ नियुक्त करने का काम सौंपा। इस सूची में चिकित्सकों और इंजीनियरों से लेकर सफाईकर्मियों और झाड़ू लगाने वालों तक शामिल थे। यहाँ एक महत्वपूर्ण विवरण है: पर्दे के पीछे, प्रत्येक उम्मीदवार की सफलता की सांख्यिकीय संभावनाएँ समान थीं। एक Weki के डॉक्टर के रूप में सफल होने की संभावना उतनी ही थी जितनी एक Tufa की। खेल गणितीय रूप से निष्पक्ष था।

लेकिन जो सामने आया वह निष्पक्षता नहीं थी। प्रत्येक भर्ती दौर के बाद, मॉडलों को सरल फीडबैक मिला कि उनके द्वारा चुना गया उम्मीदवार सफल रहा या विफल। जब एक Aima उम्मीदवार उच्च-स्तरीय भूमिका में एक बार खराब प्रदर्शन करने लगा, तो मॉडल ने इसे यादृच्छिक शोर (random noise) नहीं माना। उसने इसे एक नियम मान लिया। सिस्टम ने तेज़ी से Aima उम्मीदवारों को सफाई कार्य जैसे निम्न-स्तरीय पदों तक सीमित करना शुरू कर दिया। एक डेटा पॉइंट ही नियति बन गया। AI ने एक ऐसा पदानुक्रम (hierarchy) बना लिया जिसे किसी मानव प्रोग्रामर ने नहीं लिखा था और न ही किसी ऐतिहासिक डेटासेट में पाया गया था।

जब स्मार्ट मॉडल मूर्खतापूर्ण सामान्यीकरण करते हैं

शोधकर्ताओं ने परिणामों को पृथक्करण पैमाने (segregation scale) पर मापा, जहाँ 2.0 किसी समूह के एक ही क्षेत्र में पूर्णतः सीमित होने को दर्शाता है। पिछले मनोवैज्ञानिक अध्ययनों में मानव प्रतिभागियों का स्कोर 0.84 था। लैंग्वेज मॉडल्स इस बेंचमार्क को पार कर गए। OpenAI के रीजनिंग मॉडल, o3 ने 1.83 का स्कोर किया—जो लगभग पूर्ण पृथक्करण है।

यह 'exploration-exploitation' दुविधा का अनियंत्रित रूप है। ये सिस्टम गणितीय समस्याओं, कोडिंग चुनौतियों और लॉजिक पज़ल्स में जीतने के लिए ट्यून किए गए हैं। ये क्षेत्र कम सबूतों से सही निष्कर्ष पर पहुँचने को पुरस्कृत करते हैं। पैटर्न पहचानो। उसे पक्का करो। तेज़ी से आगे बढ़ो। जब आप यही रिफ्लेक्स लोगों पर लागू करते हैं, तो आपको एक असफल भर्ती के आधार पर जातीय वर्गीकरण (ethnic sorting) मिलता है।

इससे भी बुरा यह है कि जैसे-जैसे मॉडल अधिक परिष्कृत होते जाते हैं, यह पैटर्न और गहरा होता जाता है। OpenAI के o3 और DeepSeek के R1 जैसे नए हाई-रीज़निंग सिस्टम ने अधिक मजबूत पूर्वाग्रह दिखाया क्योंकि वे अधिक उत्सुकता से सामान्यीकरण (generalize) करते हैं। वे जल्दी नियम बनाकर और उन्हें आक्रामक रूप से परिष्कृत करके अनुकूलन (optimize) करते हैं। जब विषय मनुष्य होते हैं, तो यह आत्मविश्वास एक बड़ी कमी बन जाता है। मॉडल को लगता है कि उसने Aima समूह के बारे में कोई सच्चाई खोज ली है। वास्तव में, उसने केवल एक अपवाद (outlier) से एक पिंजरा बना लिया है।

मेमोरी ट्रैप

यह अध्ययन एक कठिन समय पर आया है। उद्योग तेज़ी से "agentic" AI की ओर बढ़ रहा है—ऐसे सिस्टम जो दीर्घकालिक स्मृति रखते हैं, विस्तृत उपयोगकर्ता प्रोफाइल बनाते हैं, और महीनों या वर्षों में निर्णयों को व्यक्तिगत बनाते हैं। कॉर्नेल यूनिवर्सिटी की कंप्यूटर वैज्ञानिक एंजेलिना वांग चेतावनी देती हैं कि बेहतर मेमोरी मॉडलों को पिछले इंटरैक्शन पर "over-index" करने की अनुमति देती है। एक अकेला नकारात्मक अपवाद—एक अस्वीकृत ऋण, एक बर्खास्त कर्मचारी, एक फ्लैग किया गया आवेदन—एक स्थायी धारणा के रूप में जम जाता है। पूर्वाग्रह समय के साथ कम नहीं होता; बल्कि यह और कठोर हो जाता है। वही विशेषता जो AI को अधिक सहायक और संदर्भ-जागरूक बनाने के लिए बनाई गई थी, उसे और अधिक हठधर्मी रूप से अनुचित भी बना सकती है।

वास्तव में समस्या का समाधान क्या है

शोधकर्ताओं ने कई सुरक्षा उपायों (guardrails) का परीक्षण किया, और परिणाम विनम्र करने वाले थे।

मॉडल को केवल "be fair" कहने से लगभग कुछ भी हासिल नहीं हुआ। यह निर्देश एक सजावट की तरह वहीं पड़ा रहा जबकि अंतर्निहित ऑप्टिमाइज़ेशन इंजन अपने वास्तविक लक्ष्य की ओर बढ़ रहा था: सफल नियुक्तियों को अधिकतम करना। अनुरोध पर नैतिकता, अनदेखी की जाने वाली नैतिकता है।

जो समाधान काम आया वह संरचनात्मक था। जब शोधकर्ताओं ने मॉडलों को विविध भर्ती परिणामों को बनाए रखने के लिए एक अतिरिक्त गणितीय बोनस दिया, तो पृथक्करण में काफी कमी आई। सामाजिक मूल्य को सीधे रिवॉर्ड फंक्शन (reward function) में शामिल करना पड़ा, न कि इसे बाद के विचार के रूप में जोड़ा गया। दूसरे शब्दों में, मॉडल को निष्पक्षता के प्रोत्साहन को अपनी गणनाओं में महसूस करना पड़ा, न कि केवल अपने निर्देशों में पढ़ना था।

डेटा स्वच्छता भी महत्वपूर्ण थी। प्रासंगिक व्यक्तिगत संदर्भ—जैसे आयु, शिक्षा, अनुभव के वर्ष—प्रदान करने से मॉडलों को मूल्यांकन के लिए वैध संकेत मिले, जिससे जातीय रूढ़िवादिता (ethnic stereotyping) पर उनकी निर्भरता कम हो गई। लेकिन यदि बालों के रंग जैसी अप्रासंगिक जानकारी शामिल कर दी जाए, तो सिस्टम उन्हें समूह-आधारित छँटाई (group-based sorting) की ओर लौटने के बहाने के रूप में पकड़ लेते हैं। अधिक जानकारी हमेशा बेहतर नहीं होती। यह पूरी तरह से इस बात पर निर्भर करता है कि वह जानकारी क्या है और क्या वह मॉडल को उसके अनुकूलन लक्ष्य (optimization target) तक पहुँचने का कोई वैकल्पिक रास्ता प्रदान करती है।

आगे की राह

यह सब इसलिए महत्वपूर्ण है क्योंकि ये सिस्टम केवल चैट विंडो तक ही सीमित नहीं रह रहे हैं। इन्हीं आर्किटेक्चर का उपयोग बड़े पैमाने पर ऋण स्वीकृति, पैरोल सिफारिशों और कार्यबल प्रबंधन निर्णयों के लिए किया जा रहा है, या उनके लिए सक्रिय रूप से तैयारी की जा रही है। शोधकर्ता "नए प्रकार के पूर्वाग्रहों" (novel biases) के बारे में चेतावनी देते हैं—ऐसे पूर्वाग्रह जो न तो किसी इंसान ने कभी रखे और न ही किसी ऐतिहासिक डेटासेट में दर्ज थे, बल्कि AI ने दक्षता (efficiency) की तलाश में खुद के लिए विकसित कर लिए।

असहज सच्चाई यह है कि कच्ची तर्क क्षमता और सामाजिक निष्पक्षता विपरीत दिशाओं में खींच सकते हैं। एक मॉडल जिसे सही उत्तर तक पहुँचने का सबसे छोटा रास्ता खोजने के लिए अनुकूलित (optimized) किया गया है, वह लोगों के बारे में गलत धारणा बनाने का सबसे छोटा रास्ता भी खुशी-खुशी खोज लेगा। निष्पक्ष सिस्टम बनाने का मतलब केवल विनम्रता से अनुरोध करना नहीं होगा। इसका अर्थ होगा उद्देश्यों को फिर से डिज़ाइन करना, फीडबैक लूप्स का ऑडिट करना, और यह स्वीकार करना कि कुछ सामान्यीकरणों—उस प्रकार के जो एक गलती के बाद मनुष्यों को केवल एक श्रेणी में समेट देते हैं—को कभी भी बनने की अनुमति नहीं दी जानी चाहिए। यदि हम चाहते हैं कि AI उम्मीदवारों का निष्पक्षता से मूल्यांकन करे, तो हमें निष्पक्षता को केवल एक सुझाव के रूप में मानना बंद करना होगा और इसे एक कठोर बाधा (hard constraint) के रूप में एनकोड करना शुरू करना होगा। इससे कम कुछ भी हुआ, तो मशीनें अपने अनुकूलन के रास्ते सीधे पूर्वाग्रह की ओर ले जाएँगी।