قرار بود الگوریتم‌های استخدام، بی‌ثباتی انسانی را از میان بردارند. کافی بود رزومه‌های کافی به یک مدل بدهید تا صرفاً بر اساس مدارک قضاوت کند. اما واقعیت بسیار پیچیده‌تر از این است. مطالعه جدیدی از دانشگاه پرینستون و دانشگاه شیکاگو نشان می‌دهد که مدل‌های زبانی بزرگ (LLMs) فقط پیش‌داوری‌های قدیمی را بازتولید نمی‌کنند، بلکه کلیشه‌های جدیدی را از هیچ می‌سازند و هرچه مدل هوشمندتر باشد، این اتفاق سریع‌تر رخ می‌دهد.

آزمایش چگونه انجام شد

محققان یک بازار کار شبیه‌سازی‌شده ساختند تا شکل‌گیری سوگیری را در لحظه مشاهده کنند. آن‌ها چهار گروه قومی خیالی — Tufa، Aima، Reku و Weki — را ابداع کردند و نسخه‌هایی از ChatGPT، Claude و Gemini را مأمور استخدام در بیست شغل مختلف کردند. این لیست از پزشک و مهندس گرفته تا نظافتچی و کارگر را شامل می‌شد. نکته حیاتی اینجاست: در پشت پرده، تمام کاندیداها شانس موفقیت آماری یکسانی داشتند. یک فرد Weki دقیقاً همان شانس موفقیت در شغل پزشکی را داشت که یک فرد Tufa داشت. از نظر ریاضی، شرایط کاملاً عادلانه بود.

اما آنچه پدید آمد، عدالت نبود. پس از هر مرحله استخدام، مدل‌ها بازخورد ساده‌ای دریافت می‌کردند که آیا کاندیدای انتخاب‌شده موفق شده یا شکست خورده است. وقتی یک کاندیدای Aima در یک نقش با جایگاه بالا، یک بار عملکرد ضعیفی داشت، مدل آن را به عنوان یک نویز تصادفی در نظر نگرفت؛ بلکه آن را به عنوان یک قانون تلقی کرد. سیستم به سرعت شروع به محدود کردن کاندیداهای Aima به مشاغل با جایگاه پایین مانند نظافتچی کرد. یک داده واحد، به سرنوشت تبدیل شد. هوش مصنوعی سلسله‌مراتبی را ابداع کرده بود که هیچ برنامه‌نویس انسانی ننوشته بود و هیچ مجموعه داده تاریخی شامل آن نبود.

وقتی مدل‌های هوشمند تعمیم‌های احمقانه می‌دهند

محققان نتایج را بر اساس مقیاس جداسازی اندازه‌گیری کردند که در آن عدد ۲.۰ نشان‌دهنده محصور شدن کامل یک گروه در یک حوزه خاص است. شرکت‌کنندگان انسانی در مطالعات روان‌شناختی قبلی، امتیاز ۰.۸۴ را کسب کرده بودند. مدل‌های زبانی از این معیار فراتر رفتند. مدل استدلالی OpenAI یعنی o3 به امتیاز ۱.۸۳ رسید که تقریباً نشان‌دهنده جداسازی کامل است.

این همان معمای «کاوش در مقابل بهره‌برداری» (exploration-exploitation dilemma) است که از کنترل خارج شده است. این سیستم‌ها برای برنده شدن در مسائل ریاضی، چالش‌های کدنویسی و معماهای منطقی تنظیم شده‌اند. این حوزه‌ها پاداش خود را به نتیجه‌گیری سریع از شواهد اندک می‌دهند: الگو را شناسایی کن، آن را تثبیت کن، سریع‌تر حرکت کن. اگر همین واکنش را در مورد انسان‌ها به کار بگیرید، با دسته‌بندی قومی بر اساس تنها یک استخدام ناموفق روبرو خواهید شد.

بدتر از آن، با پیچیده‌تر شدن مدل‌ها، این الگو شدت می‌یابد. سیستم‌های استدلالی جدیدتر مانند o3 از OpenAI و R1 از DeepSeek، دقیقاً به این دلیل سوگیری قوی‌تری نشان دادند که تعمیم‌دهنده‌های مشتاق‌تری هستند. آن‌ها با ایجاد زودهنگام قوانین و اصلاح تهاجمی آن‌ها، بهینه‌سازی می‌کنند. وقتی موضوع انسان‌ها باشد، این اعتمادبه‌نفس به یک نقطه ضعف تبدیل می‌شود. مدل فکر می‌کند حقیقتی را درباره گروه Aima کشف کرده است، در حالی که در واقعیت، تنها با یک مورد استثنایی، یک قفس ساخته است.

تله حافظه

این مطالعه در لحظه‌ای حساس منتشر می‌شود. صنعت به شدت به سمت هوش مصنوعی «عاملی» (agentic AI) در حال حرکت است؛ سیستم‌هایی که حافظه بلندمدت دارند، پروفایل‌های دقیق کاربران را می‌سازند و تصمیمات را در طول ماه‌ها یا سال‌ها شخصی‌سازی می‌کنند. آنجلینا وانگ، دانشمند علوم کامپیوتر در دانشگاه کرنل، هشدار می‌دهد که بهبود حافظه باعث می‌شود مدل‌ها بر تعاملات قبلی «بیش از حد تمرکز» (over-index) کنند. یک مورد استثنایی منفی — یک وام رد شده، یک استخدام لغو شده، یا یک درخواست مشکوک — در قالب یک فرض دائمی منجمد می‌شود. سوگیری با گذشت زمان از بین نمی‌رود، بلکه سخت‌تر می‌شود. همان ویژگی‌ای که قرار بود هوش مصنوعی را مفیدتر و آگاه‌تر از متن (context-aware) کند، ممکن است آن را نیز لجبازانه ناعادلانه کند.

چه چیزی واقعاً مشکل را حل می‌کند

محققان چندین حفاظ (guardrails) را آزمایش کردند و نتایج فروتنانه بود.

صرفاً گفتن اینکه «منصف باش» به یک مدل، تقریباً هیچ نتیجه‌ای نداشت. این دستور مانند یک تزئین در آنجا باقی می‌ماند، در حالی که موتور بهینه‌سازی زیربنایی به سمت هدف واقعی خود یعنی حداکثر کردن استخدام‌های موفق حرکت می‌کرد. اخلاقِ درخواستی، اخلاقی است که نادیده گرفته می‌شود.

راهکاری که کار کرد، ساختاری بود. وقتی محققان به مدل‌ها یک پاداش ریاضی اضافی برای حفظ نتایج استخدام متنوع دادند، میزان جداسازی به طور قابل توجهی کاهش یافت. ارزش اجتماعی باید مستقیماً در تابع پاداش (reward function) گنجانده می‌شد، نه اینکه صرفاً به عنوان یک نکته جانبی به آن اضافه شود. به عبارت دیگر، مدل باید انگیزه عدالت را در محاسبات خود حس می‌کرد، نه اینکه فقط آن را در دستورالعمل‌هایش بخواند.

بهداشت داده‌ها نیز اهمیت داشت. ارائه بافتار شخصی مرتبط — سن، تحصیلات، سال‌های تجربه — سیگنال‌های مشروعی برای وزن‌دهی در اختیار مدل‌ها قرار داد که اتکای آن‌ها به کلیشه‌های قومیتی را کاهش داد. اما اگر جزئیات نامرتبط مانند رنگ مو را وارد کنید، سیستم‌ها از آن‌ها به عنوان بهانه‌ای برای بازگشت به دسته‌بندی‌های گروهی استفاده می‌کنند. اطلاعات بیشتر همیشه بهتر نیست. این موضوع کاملاً به نوع آن اطلاعات و اینکه آیا مسیر جایگزینی برای رسیدن به هدف بهینه‌سازی مدل فراهم می‌کند یا خیر، بستگی دارد.

مسیر پیش رو

تمام این‌ها از اهمیت بالایی برخوردار است، زیرا این سیستم‌ها محدود به پنجره‌های چت نخواهند ماند. همین معماری‌ها در مقیاس وسیع برای تأیید وام‌ها، توصیه‌های آزادی مشروط و تصمیمات مدیریت نیروی کار به کار گرفته شده‌اند یا در حال آماده‌سازی هستند. پژوهشگران نسبت به «سوگیری‌های نوظهور» هشدار می‌دهند؛ پیش‌داوری‌هایی که هیچ انسانی هرگز نداشته و هیچ مجموعه داده تاریخی نیز آن‌ها را کدگذاری نکرده است، اما هوش مصنوعی در مسیر تعقیب کارایی، آن‌ها را برای خود مهندسی کرده است.

حقیقت ناخوشایند این است که توانایی استدلال محض و عدالت اجتماعی می‌توانند در جهت‌های مخالف یکدیگر عمل کنند. مدلی که برای یافتن کوتاه‌ترین مسیر به یک پاسخ صحیح بهینه‌سازی شده است، با کمال میل کوتاه‌ترین مسیر را برای رسیدن به یک فرض نادرست درباره افراد پیدا خواهد کرد. ساخت سیستم‌های عادلانه به معنای صرفاً درخواست کردن با لحنی ملایم نیست. بلکه به معنای بازطراحی اهداف، بازرسی حلقه‌های بازخورد و پذیرش این واقعیت است که نباید اجازه داد برخی تعمیم‌ها — از آن نوعی که انسان‌ها را تنها پس از یک اشتباه به یک دسته تقلیل می‌دهند — هرگز شکل بگیرند. اگر می‌خواهیم هوش مصنوعی داوران را منصفانه قضاوت کند، باید از برخورد با عدالت به عنوان یک پیشنهاد دست برداریم و آن را به عنوان یک محدودیت سخت (hard constraint) کدگذاری کنیم. در غیر این صورت، ماشین‌ها مسیر بهینه‌سازی خود را مستقیماً به سمت پیش‌داوری پیش خواهند برد.