招聘算法本应消除人类的不一致性。只要给模型喂入足够的简历,它就会严格根据资历进行判断。但现实情况却变得更加混乱。普林斯顿大学和芝加哥大学的一项新研究表明,大语言模型不仅在回收旧有的偏见,它们还在凭空捏造全新的刻板印象,而且模型越聪明,这种现象发生得就越快。
实验是如何进行的
研究人员构建了一个模拟劳动力市场,以实时观察偏见的形成。他们虚构了四个种族——Tufa、Aima、Reku 和 Weki——并要求 ChatGPT、Claude 和 Gemini 的不同版本负责招聘二十种不同的工作。职位范围从医生、工程师到清洁工和保洁员不等。这里有一个关键细节:在幕后,每个候选人获得成功的统计概率是完全相同的。一个 Weki 成为医生的机会与一个 Tufa 完全一样。这套规则在数学上是公平的。
但结果并非公平。在每一轮招聘后,模型都会收到关于所选候选人成功或失败的简单反馈。当一名 Aima 候选人在高地位职位上偶然表现不佳时,模型并不会将其视为随机噪声,而是将其视为定律。系统迅速开始将 Aima 候选人限制在诸如清洁工作之类的低地位职位中。一个数据点变成了命运。AI 发明了一种既没有人类程序员编写,也没有历史数据集包含的等级制度。
当聪明的模型做出愚蠢的概括时
研究人员在隔离度量表上测量了结果,其中 2.0 代表一个群体被完全限制在单一领域。在之前的心理学研究中,人类参与者的得分是 0.84。而语言模型远超这一基准。OpenAI 的推理模型 o3 的得分达到了 1.83——几乎实现了完美的隔离。
这是“探索与利用”困境(exploration-exploitation dilemma)的失控表现。这些系统经过调整,旨在解决数学问题、编程挑战和逻辑谜题。在这些领域,从微小的证据中迅速得出正确结论会获得奖励。发现模式,锁定结论,快速行动。如果将同样的反射机制应用于人类,就会导致基于单次招聘失败而产生的种族分类。
更糟糕的是,随着模型变得越来越先进,这种模式反而会加剧。像 OpenAI 的 o3 和 DeepSeek 的 R1 这样较新的高推理系统表现出更强的偏见,正是因为它们是更急于进行概括的系统。它们通过尽早形成规则并积极地进行优化来提升效率。当对象是人类时,这种自信就成了一种负担。模型认为它发现了关于 Aima 群体的真相。而实际上,它只是通过一个离群值构建了一个囚笼。
记忆陷阱
这项研究出现在一个尴尬的时刻。行业正全力转向“代理式”(agentic)AI——即能够保留长期记忆、构建详细用户画像并在数月或数年内实现决策个性化的系统。康奈尔大学的计算机科学家 Angelina Wang 警告说,增强的记忆力会让模型对之前的交互产生“过度加权”(over-index)。一个单一的负面离群值——一次被拒绝的贷款、一次被终止的雇佣、一次被标记的申请——都会被固化为永久性的假设。偏见不会随时间消退,反而会变得更加顽固。旨在让 AI 更有用、更具上下文感知能力的特性,也可能使其变得更加固执地不公平。
究竟该如何解决问题
研究人员测试了几种防护措施,结果令人汗颜。
仅仅告诉模型“要公平”几乎没有任何效果。这种指令就像装饰品一样摆在那里,而底层的优化引擎仍在朝着其真实目标——最大化成功招聘率——不断运转。口头上的伦理终将被无视。
有效的解决方法是结构性的。当研究人员为保持多样化的招聘结果而给予模型额外的数学奖励时,隔离程度显著下降。社会价值必须直接植入奖励函数中,而不是作为事后的补充。换句话说,模型必须在计算中感受到公平的激励,而不仅仅是在指令中读到它。
数据卫生也至关重要。提供相关的个人背景信息——如年龄、教育程度、工作年限——为模型提供了可以权衡的正当信号,从而减少了它们对种族刻板印象的依赖。但如果加入像发色这样无关紧要的细节,系统就会将其视为借口,退回到基于群体的分类逻辑中。信息并非越多越好。这完全取决于信息的性质,以及它是否为模型提供了实现其优化目标的另一种路径。
前行之路
这一切都至关重要,因为这些系统并不仅仅局限于聊天窗口。同样的架构正被部署(或正在积极筹备)于贷款审批、假释建议以及大规模的人力资源管理决策中。研究人员警告称存在“新型偏见”——即没有任何人类持有过、也没有任何历史数据集编码过的偏见,而是 AI 在追求效率的过程中自行构建出来的偏见。
一个令人不安的事实是,纯粹的推理能力与社会公平性可能会向相反的方向拉扯。一个旨在寻找正确答案最短路径的模型,会乐于寻找对人产生错误假设的最短路径。构建公平的系统并不意味着仅仅是“礼貌地请求”。它意味着要重新设计目标、审计反馈循环,并承认某些概括性结论——即那种在犯一次错后就将人类归为某一类别的概括——绝不能被允许形成。如果我们希望 AI 公平地评判候选人,我们就必须停止将公平视为一种建议,而要开始将其编码为一项硬性约束。否则,机器将在优化的过程中直接滑向偏见。
