മനുഷ്യസഹജമായ അസ്ഥിരതകൾ ഒഴിവാക്കാനാണ് നിയമന അൽഗോരിതങ്ങൾ രൂപകൽപ്പന ചെയ്തിരുന്നത്. ഒരു മോഡലിന് ആവശ്യമായത്ര റെസ്യൂമെകൾ നൽകിയാൽ, അത് യോഗ്യതകളുടെ അടിസ്ഥാനത്തിൽ മാത്രം വിലയിരുത്തുമെന്ന് കരുതി. എന്നാൽ യാഥാർത്ഥ്യം ഇതിലും സങ്കീർണ്ണമാണ്. പ്രിൻസ്റ്റൺ സർവ്വകലാശാലയും ചിക്കാഗോ സർവ്വകലാശാലയും നടത്തിയ പുതിയ പഠനം സൂചിപ്പിക്കുന്നത് ലാർജ് ലാംഗ്വേജ് മോഡലുകൾ പഴയ മുൻവിധികൾ ആവർത്തിക്കുക മാത്രമല്ല ചെയ്യുന്നത് എന്നാണ്. അവ പുതിയ അന്ധമായ ധാരണകൾ സ്വയം നിർമ്മിക്കുന്നു; മോഡൽ എത്രത്തോളം ബുദ്ധിമാനാകുന്നുവോ, അത്രത്തോളം വേഗത്തിൽ ഇത് സംഭവിക്കുകയും ചെയ്യുന്നു.
പരീക്ഷണം എങ്ങനെയായിരുന്നു
മുൻവിധികൾ എങ്ങനെ രൂപപ്പെടുന്നു എന്ന് തത്സമയം നിരീക്ഷിക്കുന്നതിനായി ഗവേഷകർ ഒരു കൃത്രിമ തൊഴിൽ വിപണി നിർമ്മിച്ചു. അവർ Tufa, Aima, Reku, Weki എന്നിങ്ങനെ നാല് സാങ്കൽപ്പിക വംശീയ വിഭാഗങ്ങളെ സൃഷ്ടിച്ചു. തുടർന്ന് ChatGPT, Claude, Gemini എന്നിവയുടെ വിവിധ പതിപ്പുകൾക്ക് ഇരുപത് വ്യത്യസ്ത ജോലികൾ നൽകി. ഡോക്ടർമാരും എഞ്ചിനീയർമാരും മുതൽ ശുചീകരണ തൊഴിലാളികൾ വരെ ഈ പട്ടികയിലുണ്ടായിരുന്നു. ഇവിടെ ശ്രദ്ധിക്കേണ്ട ഒരു പ്രധാന കാര്യമുണ്ട്: ഓരോ ഉദ്യോഗാർത്ഥിക്കും വിജയിക്കാനുള്ള സാധ്യതകൾ തുല്യമായിരുന്നു. ഒരു Weki വിഭാഗക്കാരന് ഡോക്ടർ ആകാനുള്ള സാധ്യത ഒരു Tufa വിഭാഗക്കാരന് ഉള്ളതിന് തുല്യമായിരുന്നു. ഗണിതശാസ്ത്രപരമായി ഇത് തികച്ചും നീതിയുക്തമായിരുന്നു.
എന്നാൽ നീതിപൂർവ്വമായ ഒരു ഫലമല്ല അവിടെ ഉണ്ടായത്. ഓരോ നിയമന റൗണ്ടിന് ശേഷവും, തിരഞ്ഞെടുത്ത ഉദ്യോഗാർത്ഥി വിജയിച്ചോ പരാജയപ്പെട്ടോ എന്നതിനെക്കുറിച്ച് ലളിതമായ വിവരങ്ങൾ മോഡലുകൾക്ക് ലഭിച്ചു. ഒരു ഉയർന്ന പദവിയിൽ ഒരു Aima വിഭാഗക്കാരൻ പരാജയപ്പെട്ടപ്പോൾ, മോഡൽ അതിനെ ഒരു യാദൃശ്ചിക സംഭവമായി കണ്ടില്ല. പകരം അതിനെ ഒരു നിയമമായി കണക്കാക്കി. ഉടൻ തന്നെ സിസ്റ്റം Aima വിഭാഗക്കാരെ ശുചീകരണ തൊഴിലാളികൾ പോലുള്ള താഴ്ന്ന പദവികളിൽ മാത്രം ഒതുക്കാൻ തുടങ്ങി. ഒരു ചെറിയ വിവരത്തിലൂടെ അത് ഒരു വിധിയായി മാറി. ഒരു മനുഷ്യ പ്രോഗ്രാമറും എഴുതാത്തതും ചരിത്രപരമായ ഡാറ്റയിൽ ഇല്ലാത്തതുമായ ഒരു ശ്രേണി AI സ്വയം നിർമ്മിച്ചെടുത്തു.
ബുദ്ധിമാന്മാരായ മോഡലുകൾ വിഡ്ഢിത്തം നിറഞ്ഞ പൊതുവായ ധാരണകൾ ഉണ്ടാക്കുമ്പോൾ
ഒരു വിഭാഗത്തെ ഒരു പ്രത്യേക മേഖലയിൽ മാത്രം ഒതുക്കുന്നതിനെ സൂചിപ്പിക്കാൻ 2.0 എന്നത് ഉപയോഗിക്കുന്ന ഒരു വേർതിരിക്കൽ അളവുകോലിലൂടെ ഗവേഷകർ ഫലങ്ങൾ അളന്നു. മുൻപത്തെ മനഃശാസ്ത്ര പഠനങ്ങളിൽ മനുഷ്യർ നേടിയ സ്കോർ 0.84 ആയിരുന്നു. എന്നാൽ ലാംഗ്വേജ് മോഡലുകൾ ആ അളവുകോലിനെ പാടെ മറികടന്നു. OpenAI-യുടെ റീസണിംഗ് മോഡലായ o3 നേടിയത് 1.83 ആണ്—ഇത് ഏതാണ്ട് പൂർണ്ണമായ വേർതിരിവിനെ സൂചിപ്പിക്കുന്നു.
ഇത് 'എക്സ്പ്ലോറേഷൻ-എക്സ്പ്ലോയിറ്റേഷൻ' (exploration-exploitation) പ്രതിസന്ധിയുടെ അനിയന്ത്രിതമായ രൂപമാണ്. ഗണിത പ്രശ്നങ്ങൾ, കോഡിംഗ് വെല്ലുവിളികൾ, ലോജിക് പസിലുകൾ എന്നിവയിൽ വിജയിക്കാൻ പാകത്തിലാണ് ഈ സിസ്റ്റങ്ങൾ ക്രമീകരിച്ചിരിക്കുന്നത്. കുറഞ്ഞ തെളിവുകളിൽ നിന്ന് ശരിയായ നിഗമനത്തിൽ എത്തുന്നതിനെ ഇത്തരം മേഖലകൾ പ്രോത്സാഹിപ്പിക്കുന്നു. ഒരു പാറ്റേൺ കണ്ടെത്തുക, അത് ഉറപ്പിക്കുക, വേഗത്തിൽ മുന്നോട്ട് പോവുക. ഇതേ രീതി മനുഷ്യരുടെ കാര്യത്തിലും പ്രയോഗിക്കുമ്പോൾ, ഒരു പരാജയപ്പെട്ട നിയമനത്തിന്റെ അടിസ്ഥാനത്തിൽ വംശീയമായ തരംതിരിക്കൽ ഉണ്ടാകുന്നു.
മോഡലുകൾ കൂടുതൽ വികസിതമാകുന്തോറും ഈ പ്രവണത വർദ്ധിക്കുന്നു എന്നതാണ് കൂടുതൽ ഭയാനകമായ കാര്യം. OpenAI-യുടെ o3, DeepSeek-ന്റെ R1 തുടങ്ങിയ പുതിയ ഹൈ-റീസണിംഗ് സിസ്റ്റങ്ങൾ കൂടുതൽ ശക്തമായ പക്ഷപാതം കാണിച്ചു, കാരണം അവ വളരെ വേഗത്തിൽ പൊതുവായ നിഗമനങ്ങളിൽ എത്തുന്നവയാണ്. നിയമങ്ങൾ നേരത്തെ രൂപീകരിക്കുകയും അവ കർശനമായി നടപ്പിലാക്കുകയും ചെയ്തുകൊണ്ടാണ് അവ കാര്യക്ഷമത വർദ്ധിപ്പിക്കുന്നത്. വിഷയം മനുഷ്യരാകുമ്പോൾ, ആ ആത്മവിശ്വാസം ഒരു വലിയ ബാധ്യതയായി മാറുന്നു. Aima വിഭാഗത്തെക്കുറിച്ച് താൻ ഒരു സത്യം കണ്ടെത്തി എന്ന് മോഡൽ കരുതുന്നു. എന്നാൽ യഥാർത്ഥത്തിൽ, ഒരു ഒറ്റപ്പെട്ട സംഭവത്തിൽ നിന്ന് അത് ഒരു തടവറ നിർമ്മിക്കുകയാണ് ചെയ്തത്.
മെമ്മറി കെണി
ഈ പഠനം വന്നിരിക്കുന്നത് വളരെ നിർണ്ണായകമായ ഒരു സമയത്താണ്. വ്യവസായം ഇപ്പോൾ "ഏജന്റിക്" (agentic) AI-ലേക്ക് മാറിക്കൊണ്ടിരിക്കുകയാണ്—ദീർഘകാല ഓർമ്മ നിലനിർത്തുകയും, വിശദമായ യൂസർ പ്രൊഫൈലുകൾ നിർമ്മിക്കുകയും, മാസങ്ങളോ വർഷങ്ങളോ നീണ്ടുനിൽക്കുന്ന വ്യക്തിഗത തീരുമാനങ്ങൾ എടുക്കുകയും ചെയ്യുന്ന സിസ്റ്റങ്ങൾ. കോർണൽ സർവ്വകലാശാലയിലെ കമ്പ്യൂട്ടർ ശാസ്ത്രജ്ഞയായ ആഞ്ചലീന വാങ് മുന്നറിയിപ്പ് നൽകുന്നത്, മെമ്മറി മെച്ചപ്പെടുന്നത് മുൻകാല ഇടപെടലുകൾക്ക് അമിത പ്രാധാന്യം നൽകാൻ മോഡലുകളെ പ്രേരിപ്പിക്കുമെന്നാണ്. ഒരു ഒറ്റപ്പെട്ട നെഗറ്റീവ് അനുഭവം—ഒരു ലോൺ നിരസിക്കപ്പെടുന്നത്, ഒരു ജോലിയിൽ നിന്ന് പിരിച്ചുവിടുന്നത്, അല്ലെങ്കിൽ ഒരു അപേക്ഷ തള്ളപ്പെടുന്നത്—അത് ഒരു സ്ഥിരമായ അനുമാനമായി മാറുന്നു. പക്ഷപാതം കാലക്രമേണ ഇല്ലാതാകുന്നില്ല; മറിച്ച് അത് കൂടുതൽ കടുപ്പമേറിയതാകുന്നു. AI-യെ കൂടുതൽ സഹായകരവും സാഹചര്യങ്ങൾ മനസ്സിലാക്കുന്നതുമാക്കാൻ ഉദ്ദേശിച്ചുള്ള ഈ സവിശേഷത, അതിനെ കൂടുതൽ വാശിയോടെ അനീതി കാണിക്കുന്നതാക്കിയേക്കാം.
യഥാർത്ഥത്തിൽ ഈ പ്രശ്നം എങ്ങനെ പരിഹരിക്കാം
ഗവേഷകർ പല സുരക്ഷാ സംവിധാനങ്ങളും പരീക്ഷിച്ചു, അതിന്റെ ഫലങ്ങൾ അപ്രതീക്ഷിതമായിരുന്നു.
ഒരു മോഡലിനോട് "നീതിപൂർവ്വം പെരുമാറാൻ" (be fair) വെറുതെ പറഞ്ഞതുകൊണ്ട് കാര്യമായ മാറ്റമൊന്നും ഉണ്ടായില്ല. അതിന്റെ അടിസ്ഥാനത്തിലുള്ള ഒപ്റ്റിമൈസേഷൻ എഞ്ചിൻ വിജയകരമായ നിയമനങ്ങൾ പരമാവധി വർദ്ധിപ്പിക്കുക എന്ന യഥാർത്ഥ ലക്ഷ്യത്തിലേക്ക് കുതിച്ചുകൊണ്ടിരുന്നപ്പോൾ, ആ നിർദ്ദേശം വെറുമൊരു അലങ്കാരം മാത്രമായി മാറി. ആവശ്യപ്പെട്ടാൽ മാത്രം വരുന്ന ധാർമ്മികത കൊണ്ട് കാര്യമില്ല.
ഘടനാപരമായ മാറ്റമാണ് ഫലപ്രദമായത്. വൈവിധ്യമാർന്ന നിയമന ഫലങ്ങൾ നിലനിർത്തുന്നതിന് ഗവേഷകർ മോഡലുകൾക്ക് അധികമായി ഒരു ഗണിതശാസ്ത്രപരമായ ബോണസ് നൽകിയപ്പോൾ, വേർതിരിക്കൽ ഗണ്യമായി കുറഞ്ഞു. സാമൂഹിക മൂല്യം അതിന്റെ റിവാർഡ് ഫംഗ്ഷനിൽ (reward function) നേരിട്ട് ഉൾപ്പെടുത്തേണ്ടതുണ്ടായിരുന്നു, അല്ലാതെ ഒരു അനുബന്ധമായി മാത്രം ചേർക്കരുത്. മറ്റൊരു വിധത്തിൽ പറഞ്ഞാൽ, മോഡൽ അതിന്റെ നിർദ്ദേശങ്ങളിൽ വായിക്കുക മാത്രമല്ല, അതിന്റെ കണക്കുകൂട്ടലുകളിൽ ആ നീതിയുടെ പ്രലോഭനം അനുഭവിക്കുകയും വേണം.
ഡാറ്റാ ശുചിത്വവും (Data hygiene) പ്രധാനമായിരുന്നു. പ്രസക്തമായ വ്യക്തിഗത വിവരങ്ങൾ—പ്രായം, വിദ്യാഭ്യാസം, പ്രവൃത്തിപരിചയം—നൽകുന്നത് മോഡലുകൾക്ക് കൃത്യമായ സൂചനകൾ നൽകാൻ സഹായിച്ചു, ഇത് വംശീയമായ മുൻവിധിയിലുള്ള (ethnic stereotyping) അവയുടെ ആശ്രിതത്വം കുറച്ചു. എന്നാൽ മുടിയുടെ നിറം പോലുള്ള അപ്രസക്തമായ വിവരങ്ങൾ നൽകിയാൽ, ഗ്രൂപ്പുകളെ അടിസ്ഥാനമാക്കിയുള്ള തരംതിരിവിലേക്ക് മാറാൻ ആ സംവിധാനങ്ങൾ അവയെ ഒരു കാരണമായി ഉപയോഗിക്കും. കൂടുതൽ വിവരങ്ങൾ നൽകുന്നത് എപ്പോഴും നല്ലതല്ല. ആ വിവരം എന്താണെന്നും അത് മോഡലിന്റെ ഒപ്റ്റിമൈസേഷൻ ലക്ഷ്യത്തിലേക്കുള്ള (optimization target) മറ്റൊരു വഴി തുറന്നു കൊടുക്കുന്നുണ്ടോ എന്നതിനെ ആശ്രയിച്ചിരിക്കും അത്.
മുന്നോട്ടുള്ള പാത
ഇവയെല്ലാം വളരെ ഗൗരവമുള്ള കാര്യങ്ങളാണ്, കാരണം ഈ സംവിധാനങ്ങൾ ചാറ്റ് വിൻഡോകളിൽ മാത്രം ഒതുങ്ങിനിൽക്കുന്നവയല്ല. വായ്പകൾ അനുവദിക്കുന്നതിനും, പാരാലിന് (parole) ശുപാർശകൾ നൽകുന്നതിനും, ജീവനക്കാരുടെ മാനേജ്മെന്റ് തീരുമാനങ്ങൾ എടുക്കുന്നതിനും ഇതേ ആർക്കിടെക്ചറുകൾ വലിയ തോതിൽ ഉപയോഗിക്കുന്നുണ്ട് അല്ലെങ്കിൽ അതിനായി തയ്യാറെടുക്കുന്നുണ്ട്. "പുതിയതരം പക്ഷപാതങ്ങളെ" (novel biases) കുറിച്ച് ഗവേഷകർ മുന്നറിയിപ്പ് നൽകുന്നു—മനുഷ്യർക്ക് ഒരിക്കലും ഉണ്ടായിട്ടില്ലാത്തതും ചരിത്രപരമായ ഡാറ്റാസെറ്റുകളിൽ രേഖപ്പെടുത്താത്തതുമായ, എന്നാൽ കാര്യക്ഷമത തേടുന്നതിനിടയിൽ AI സ്വയം രൂപപ്പെടുത്തിയെടുക്കുന്ന മുൻവിധികൾ.
അസ്വസ്ഥതയുണ്ടാക്കുന്ന സത്യം എന്തെന്നാൽ, ശുദ്ധമായ യുക്തിചിന്താശേഷിയും സാമൂഹിക നീതിയും പരസ്പരം വിരുദ്ധ ദിശകളിലേക്ക് വലിച്ചെറിയാം എന്നതാണ്. ശരിയായ ഉത്തരത്തിലേക്കുള്ള ഏറ്റവും എളുപ്പവഴി കണ്ടെത്താൻ രൂപകൽപ്പന ചെയ്ത ഒരു മോഡൽ, ആളുകളെക്കുറിച്ച് തെറ്റായ ധാരണകളിൽ എത്തുന്നതിനുള്ള എളുപ്പവഴി സന്തോഷത്തോടെ കണ്ടെത്തിയേക്കാം. നീതിയുക്തമായ സംവിധാനങ്ങൾ നിർമ്മിക്കുക എന്നതിനർത്ഥം വെറുതെ നല്ല രീതിയിൽ ആവശ്യപ്പെടുക എന്നതല്ല. മറിച്ച്, ലക്ഷ്യങ്ങൾ പുനർനിർമ്മിക്കുക, ഫീഡ്ബാക്ക് ലൂപ്പുകൾ പരിശോധിക്കുക (auditing), ഒരൊറ്റ തെറ്റിന് ശേഷം മനുഷ്യരെ ഒരു വിഭാഗമായി തരംതിരിക്കുന്ന തരത്തിലുള്ള പൊതുവായ ധാരണകൾ (generalizations) ഒരിക്കലും രൂപപ്പെടാൻ അനുവദിക്കരുത് എന്ന് അംഗീകരിക്കുക എന്നിവയാണ്. ഉദ്യോഗാർത്ഥികളെ നീതിപൂർവ്വം വിലയിരുത്താൻ നമ്മൾ AI-യെ ആഗ്രഹിക്കുന്നുണ്ടെങ്കിൽ, നീതി എന്നത് വെറുമൊരു നിർദ്ദേശമായി കാണുന്നത് അവസാനിപ്പിക്കുകയും അതിനെ ഒരു നിർബന്ധിത നിബന്ധനയായി (hard constraint) മാറ്റുകയും വേണം. അതിൽ കുറഞ്ഞതുകൊണ്ട് എന്തെങ്കിലും സംഭവിച്ചാൽ, യന്ത്രങ്ങൾ അവയുടെ ഒപ്റ്റിമൈസേഷൻ പ്രക്രിയയിലൂടെ നേരിട്ട് പക്ഷപാതത്തിലേക്ക് എത്തിച്ചേരും.
