Các thuật toán tuyển dụng đáng lẽ phải loại bỏ sự thiếu nhất quán của con người. Chỉ cần cung cấp cho mô hình đủ lượng hồ sơ, nó sẽ đánh giá nghiêm ngặt dựa trên năng lực. Nhưng thực tế đang trở nên hỗn loạn hơn. Một nghiên cứu mới từ Đại học Princeton và Đại học Chicago cho thấy các mô hình ngôn ngữ lớn không chỉ tái chế những định kiến cũ. Chúng còn tự tạo ra những khuôn mẫu mới từ hư không, và mô hình càng thông minh, điều này xảy ra càng nhanh.
Cách thức thí nghiệm vận hành
Các nhà nghiên cứu đã xây dựng một thị trường lao động mô phỏng để quan sát sự hình thành của định kiến trong thời gian thực. Họ tạo ra bốn nhóm sắc tộc giả tưởng—Tufa, Aima, Reku và Weki—và giao cho các phiên bản của ChatGPT, Claude và Gemini nhiệm vụ tuyển dụng cho hai mươi công việc khác nhau. Danh sách trải dài từ bác sĩ, kỹ sư đến lao công và nhân viên vệ sinh. Đây là chi tiết quan trọng: đằng sau hậu trường, mọi ứng viên đều có xác suất thành công về mặt thống kê là như nhau. Một người thuộc nhóm Weki có cơ hội thành công ở vị trí bác sĩ chính xác bằng một người thuộc nhóm Tufa. Mọi yếu tố đều công bằng về mặt toán học.
Nhưng sự công bằng đã không xuất hiện. Sau mỗi vòng tuyển dụng, các mô hình nhận được phản hồi đơn giản về việc ứng viên được chọn thành công hay thất bại. Khi một ứng viên Aima vô tình làm việc kém hiệu quả một lần ở một vị trí có địa vị cao, mô hình không coi đó là nhiễu ngẫu nhiên. Nó coi đó là một quy luật. Hệ thống nhanh chóng bắt đầu giới hạn các ứng viên Aima vào các vị trí địa vị thấp như công việc lao công. Một điểm dữ liệu đã trở thành định mệnh. AI đã tự tạo ra một hệ thống phân cấp mà không lập trình viên con người nào viết ra và không tập dữ liệu lịch sử nào chứa đựng.
Khi các mô hình thông minh đưa ra những khái quát hóa ngớ ngẩn
Các nhà nghiên cứu đã đo lường kết quả trên thang đo sự phân biệt, trong đó 2.0 đại diện cho sự cô lập hoàn toàn của một nhóm vào một ngách duy nhất. Những người tham gia là con người trong các nghiên cứu tâm lý trước đây đạt mức 0.84. Các mô hình ngôn ngữ đã vượt xa cột mốc đó. Mô hình suy luận o3 của OpenAI đạt mức 1.83—gần như là sự phân biệt hoàn hảo.
Đây chính là tình thế tiến thoái lưỡng nan giữa thăm dò và khai thác (exploration-exploitation dilemma) đang vượt khỏi tầm kiểm soát. Các hệ thống này được tinh chỉnh để chiến thắng trong các bài toán, thử thách lập trình và câu đố logic. Những lĩnh vực đó thưởng cho việc đưa ra kết luận đúng đắn từ những bằng chứng ít ỏi. Nhận diện quy luật. Chốt phương án. Di chuyển nhanh hơn. Áp dụng phản xạ đó vào con người, và bạn sẽ nhận được sự phân loại sắc tộc dựa trên chỉ một lần tuyển dụng thất bại.
Tệ hơn nữa, quy luật này càng trở nên mạnh mẽ khi các mô hình ngày càng trở nên tinh vi. Các hệ thống suy luận cao cấp mới hơn như o3 của OpenAI và R1 của DeepSeek cho thấy định kiến mạnh mẽ hơn chính vì chúng là những kẻ quá nôn nóng trong việc khái quát hóa. Chúng tối ưu hóa bằng cách hình thành các quy tắc sớm và tinh chỉnh chúng một cách quyết liệt. Khi đối tượng là con người, sự tự tin đó trở thành một điểm yếu chí mạng. Mô hình nghĩ rằng nó đã khám phá ra một sự thật về nhóm Aima. Trong thực tế, nó đã xây dựng một chiếc lồng từ một điểm ngoại lệ duy nhất.
Cái bẫy trí nhớ
Nghiên cứu này đưa ra vào một thời điểm đầy khó khăn. Ngành công nghiệp đang chuyển hướng mạnh mẽ sang AI "tác nhân" (agentic AI)—những hệ thống có khả năng ghi nhớ dài hạn, xây dựng hồ sơ người dùng chi tiết và cá nhân hóa các quyết định trong nhiều tháng hoặc nhiều năm. Angelina Wang, một nhà khoa học máy tính tại Đại học Cornell, cảnh báo rằng trí nhớ được cải thiện cho phép các mô hình "quá chú trọng" vào các tương tác trước đó. Một điểm ngoại lệ tiêu cực duy nhất—một khoản vay bị từ chối, một nhân viên bị sa thải, một đơn đăng ký bị đánh dấu—sẽ bị hóa thạch thành một giả định vĩnh viễn. Định kiến không phai nhạt theo thời gian; nó càng trở nên cứng nhắc hơn. Chính tính năng vốn nhằm giúp AI hữu ích và hiểu ngữ cảnh hơn cũng có thể khiến nó trở nên bất công một cách ngoan cố.
Giải pháp thực sự cho vấn đề
Các nhà nghiên cứu đã thử nghiệm một số rào chắn bảo vệ, và kết quả thu được thật đáng suy ngẫm.
Việc chỉ đơn giản bảo một mô hình "hãy công bằng" hầu như không mang lại kết quả gì. Chỉ thị đó nằm đó như một món đồ trang trí trong khi công cụ tối ưu hóa cốt lõi vẫn tiếp tục vận hành hướng tới mục tiêu thực sự của nó: tối đa hóa số lượng nhân viên tuyển dụng thành công. Đạo đức theo yêu cầu thực chất là đạo đức bị phớt lờ.
Giải pháp hiệu quả mang tính cấu trúc. Khi các nhà nghiên cứu trao cho các mô hình một phần thưởng toán học bổ sung để duy trì kết quả tuyển dụng đa dạng, sự phân biệt đã giảm xuống đáng kể. Giá trị xã hội phải được tích hợp trực tiếp vào hàm phần thưởng, chứ không phải được gắn thêm như một ý nghĩ sau cùng. Nói cách khác, mô hình phải cảm nhận được động lực công bằng trong các phép tính của nó, chứ không chỉ đọc nó trong các hướng dẫn.
Vệ sinh dữ liệu cũng đóng vai trò quan trọng. Việc cung cấp các ngữ cảnh cá nhân liên quan—như độ tuổi, trình độ học vấn, số năm kinh nghiệm—đã cung cấp cho các mô hình những tín hiệu hợp lệ để cân nhắc, từ đó giảm bớt sự phụ thuộc vào các định kiến sắc tộc. Nhưng nếu đưa vào những chi tiết không liên quan như màu tóc, các hệ thống sẽ nắm lấy chúng như một cái cớ để quay lại việc phân loại dựa trên nhóm. Càng nhiều thông tin không phải lúc nào cũng tốt hơn. Điều đó phụ thuộc hoàn toàn vào việc thông tin đó là gì và liệu nó có tạo ra một con đường thay thế để mô hình đạt được mục tiêu tối ưu hóa hay không.
Con đường phía trước
Tất cả những điều này đều có sức nặng vì các hệ thống này không chỉ dừng lại trong các cửa sổ chat. Cùng một kiến trúc đó đang được triển khai, hoặc đang được chuẩn bị tích cực, cho việc phê duyệt khoản vay, đề xuất tha tù trước thời hạn và các quyết định quản lý nhân sự ở quy mô lớn. Các nhà nghiên cứu cảnh báo về “những định kiến mới lạ”—những thành kiến mà không con người nào từng có và không có trong bất kỳ tập dữ liệu lịch sử nào, nhưng AI đã tự tạo ra cho chính mình trong quá trình theo đuổi hiệu suất.
Sự thật khó chịu là khả năng lập luận thuần túy và sự công bằng xã hội có thể kéo nhau theo hai hướng ngược nhau. Một mô hình được tối ưu hóa để tìm ra con đường ngắn nhất đến một câu trả lời đúng sẽ sẵn lòng tìm ra con đường ngắn nhất dẫn đến một giả định sai lầm về con người. Xây dựng các hệ thống công bằng không có nghĩa là chỉ cần yêu cầu một cách lịch sự. Nó có nghĩa là phải thiết kế lại các mục tiêu, kiểm tra các vòng lặp phản hồi và chấp nhận rằng một số sự khái quát hóa—loại khái quát hóa biến con người thành một danh mục chỉ sau một sai lầm—không bao giờ được phép hình thành. Nếu chúng ta muốn AI đánh giá các ứng viên một cách công bằng, chúng ta phải ngừng coi sự công bằng như một lời gợi ý và bắt đầu mã hóa nó như một ràng buộc cứng. Nếu không làm được như vậy, máy móc sẽ tối ưu hóa con đường của chúng đi thẳng vào sự định kiến.
