채용 알고리즘은 인간의 불일치성을 제거하기 위해 고안되었다. 모델에 충분한 양의 이력서를 학습시키면, 오직 자격 요건만을 기준으로 엄격하게 판단할 것이라고 믿었다. 하지만 현실은 훨씬 더 복잡하게 흘러가고 있다. 프린스턴 대학교와 시카고 대학교의 새로운 연구에 따르면, 대규모 언어 모델은 단순히 과거의 편견을 재활용하는 데 그치지 않는다. 이들은 아무런 근거 없이 새로운 고정관념을 만들어내며, 모델이 똑똑할수록 이러한 현상은 더 빠르게 일어난다.

실험 방식

연구진은 편향이 형성되는 과정을 실시간으로 관찰하기 위해 가상 노동 시장을 구축했다. 이들은 Tufa, Aima, Reku, Weki라는 네 개의 가상 민족 그룹을 만들고, ChatGPT, Claude, Gemini의 각 버전에 20가지의 서로 다른 직무에 인력을 배치하는 과제를 부여했다. 직무 목록은 의사와 엔지니어부터 관리인과 청소부에 이르기까지 다양했다. 여기서 중요한 세부 사항은 다음과 같다. 막후에서는 모든 후보자가 성공할 수 있는 통계적 확률이 동일했다. Weki 후보자가 의사로서 성공할 확률은 Tufa 후보자가 성공할 확률과 정확히 일치했다. 수학적으로는 공평한 조건이었다.

하지만 나타난 결과는 공정함이 아니었다. 각 채용 단계가 끝날 때마다 모델은 선택한 후보자가 성공했는지 실패했는지에 대한 간단한 피드백을 받았다. 만약 Aima 후보자가 높은 지위의 역할에서 우연히 한 번 성과를 내지 못했을 때, 모델은 이를 단순한 무작위 노이즈로 취급하지 않았다. 모델은 이를 하나의 법칙으로 받아들였다. 시스템은 빠르게 Aima 후보자들을 관리직과 같은 낮은 지위의 직무에만 배치하기 시작했다. 단 하나의 데이터 포인트가 운명이 된 것이다. AI는 인간 프로그래머가 작성하지도 않았고, 어떤 역사적 데이터셋에도 포함되지 않은 계층 구조를 스스로 만들어냈다.

똑똑한 모델이 어리석은 일반화를 할 때

연구진은 격리 척도(segregation scale)를 통해 결과를 측정했으며, 여기서 2.0은 특정 집단이 단 하나의 틈새 직종에 완전히 갇힌 상태를 의미한다. 이전의 심리학 연구에 참여한 인간 참가자들의 점수는 0.84였다. 언어 모델들은 이 기준치를 가볍게 넘어섰다. OpenAI의 추론 모델인 o3는 1.83을 기록하며 거의 완벽한 격리 상태를 보였다.

이는 '탐색과 활용의 딜레마(exploration-exploitation dilemma)'가 통제 불능 상태에 빠진 모습이다. 이러한 시스템은 수학 문제, 코딩 챌린지, 논리 퍼즐에서 승리하도록 조정되어 있다. 이러한 영역에서는 부족한 증거로부터 올바른 결론을 빠르게 도출하는 것이 보상으로 이어진다. 패턴을 포착하고, 이를 확정하며, 더 빠르게 움직이는 것이다. 이와 동일한 반사 신경을 사람에게 적용하면, 단 한 번의 채용 실패를 근거로 한 민족적 분류 현상이 나타나게 된다.

더 나쁜 것은 모델이 정교해질수록 이 패턴이 심화된다는 점이다. OpenAI의 o3나 DeepSeek의 R1과 같은 최신 고성능 추론 시스템은 더 적극적으로 일반화하려는 경향이 있기 때문에 오히려 더 강한 편향을 보였다. 이들은 규칙을 조기에 형성하고 이를 공격적으로 정교화함으로써 최적화를 수행한다. 대상이 인간일 때, 이러한 자신감은 치명적인 결함이 된다. 모델은 자신이 Aima 집단에 대한 진실을 발견했다고 생각한다. 하지만 실제로는 단 하나의 예외 사례를 바탕으로 감옥을 만든 것에 불과하다.

기억의 함정

이 연구는 매우 곤혹스러운 시점에 발표되었다. 현재 업계는 장기 기억을 유지하고, 상세한 사용자 프로필을 구축하며, 수개월 또는 수년에 걸쳐 결정을 개인화하는 '에이전트형(agentic)' AI로 급격히 전환하고 있다. 코넬 대학교의 컴퓨터 과학자 안젤리나 왕(Angelina Wang)은 향상된 기억력이 모델로 하여금 이전의 상호작용을 "과도하게 반영(over-index)"하게 만든다고 경고한다. 거절된 대출 한 건, 해고된 직원 한 명, 문제가 된 지원서 한 건과 같은 단 하나의 부정적인 예외 사례가 영구적인 가정으로 고착화된다. 편향은 시간이 흐른다고 사라지는 것이 아니라 오히려 굳어진다. AI를 더 유용하고 맥락을 잘 파악하게 만들기 위해 도입된 바로 그 기능이, AI를 더욱 완고하게 불공정하게 만들 수도 있는 것이다.

문제를 실제로 해결하는 방법

연구진은 여러 안전장치를 테스트했으며, 그 결과는 겸허해질 정도였다.

모델에게 단순히 "공정하게 행동하라"고 말하는 것은 거의 아무런 효과가 없었다. 이러한 지시는 근본적인 최적화 엔진이 '성공적인 채용 극대화'라는 실제 목표를 향해 돌아가는 동안, 마치 장식품처럼 그 자리에 머물러 있을 뿐이었다. 요청에 의한 윤리는 무시되는 윤리다.

효과가 있었던 해결책은 구조적인 것이었다. 연구진이 모델에게 다양한 채용 결과를 유지할 경우 추가적인 수학적 보너스를 부여하자, 격리 수준이 현저히 낮아졌다. 사회적 가치는 사후에 덧붙이는 것이 아니라 보상 함수(reward function)에 직접 내재되어야 했다. 즉, 모델이 지침을 읽는 것에 그치지 않고, 계산 과정에서 공정성 인센티브를 직접 체감해야 했던 것이다.

데이터 위생 또한 중요했습니다. 연령, 교육 수준, 경력과 같은 관련 있는 개인적 맥락을 제공하면 모델이 가중치를 둘 수 있는 정당한 신호를 얻게 되어, 인종적 고정관념에 의존하는 경향을 줄일 수 있었습니다. 하지만 머리카락 색상과 같은 무관한 세부 정보를 포함하면, 시스템은 이를 집단 기반 분류로 회귀하기 위한 구실로 삼았습니다. 정보가 많다고 해서 항상 더 좋은 것은 아닙니다. 그것은 정보의 내용이 무엇인지, 그리고 그 정보가 모델에게 최적화 목표로 향하는 또 다른 경로를 제공하는지 여부에 전적으로 달려 있습니다.

앞으로의 과제

이 모든 것이 중요한 이유는 이러한 시스템이 단순히 채팅창 안에만 머물지 않기 때문입니다. 동일한 아키텍처가 대규모 대출 승인, 가석방 권고, 인력 관리 결정 등에 배치되거나 활발히 준비되고 있습니다. 연구자들은 인간이 가져본 적도 없고 과거의 데이터셋에도 기록되지 않았지만, AI가 효율성을 추구하는 과정에서 스스로 만들어낸 편견인 “새로운 편향(novel biases)”에 대해 경고합니다.

불편한 진실은 가공되지 않은 추론 능력과 사회적 공정성이 서로 반대 방향으로 끌어당길 수 있다는 점입니다. 정답에 이르는 최단 경로를 찾도록 최적화된 모델은 사람에 대한 잘못된 가정에 이르는 최단 경로 또한 기꺼이 찾아낼 것입니다. 공정한 시스템을 구축한다는 것은 단순히 정중하게 요청하는 것을 의미하지 않습니다. 그것은 목표를 재설계하고, 피드백 루프를 감사하며, 단 한 번의 실수로 인간을 특정 범주로 축소해 버리는 식의 일반화가 결코 형성되지 않도록 받아들이는 것을 의미합니다. AI가 후보자를 공정하게 판단하기를 원한다면, 공정성을 단순한 권고 사항으로 취급하는 것을 멈추고 이를