Amazon이 만료일을 설정했습니다. 2026년 7월 30일, Mechanical Turk는 신규 고객을 더 이상 받지 않을 예정입니다. 기존 계정은 계속 유지되며, Amazon은 플랫폼의 보안과 가동 시간을 유지하겠다고 밝혔습니다. 하지만 회사는 새로운 기능도 추가되지 않을 것임을 분명히 했습니다. 인터넷 노동의 시대를 정의하는 데 기여한 서비스로서, 이는 사실상 서비스 종료 통보나 다름없습니다.
원조 긱 워크(Gig Work) 마켓플레이스
Mechanical Turk는 Uber나 TaskRabbit 같은 앱들이 파편화된 노동을 대중적인 개념으로 만들기 훨씬 전인 2005년에 출시되었습니다. Amazon은 이를 소프트웨어가 아직 처리할 수 없는 작은 작업들인 "인간 지능 작업(human intelligence tasks)"을 위한 마켓플레이스로 구축했습니다. 주로 익명의 상태로 전 세계에 흩어져 있는 작업자들은 오디오 조각을 전사하거나, 상점 주소를 확인하고, 콘텐츠를 중재하며, 이미지에 태그를 달기 위해 로그인했습니다. CAPTCHA를 풀거나, 검색 결과의 순위를 매기거나, 제품 리뷰가 긍정적인지 화가 났는지 판단할 사람이 필요하신가요? MTurk가 바로 그곳이었습니다.
가격은 종종 센트(cent) 단위로 책정되었습니다. 이미지 분류 작업 1,000건의 묶음이 개당 1페니를 지급할 수도 있었습니다. 연구자, 마케터, 그리고 자본이 부족한 스타트업들에게 이는 혁명적이었습니다. 갑자기 오후 한나절 만에 수백 명의 참가자를 대상으로 설문조사를 실시하거나, 전체 어노테이션(annotation) 인력을 고용하지 않고도 컴퓨터 비전 모델을 위한 학습 데이터를 라벨링할 수 있게 되었습니다. 이 플랫폼은 인프라가 되었습니다. 사회 과학자들은 이를 통해 실험을 진행했고, 기술 기업들은 인터페이스를 테스트했으며, AI 팀들은 데이터셋을 구축했습니다.
2018년경, Amazon은 그 역할을 현대화하려고 시도했습니다. Mechanical Turk를 신경망을 위한 데이터 어노테이션 엔진으로 재정의하며 Amazon SageMaker AI와 더 밀접하게 연결했습니다. 그 아이디어는 머신러닝 파이프라인에 데이터를 공급하는 것이었습니다. 즉, 알고리즘이 학습하는 데 필요한 원재료를 인간이 정제하고, 라벨링하고, 검증하는 방식이었습니다. MTurk는 더 이상 단순한 잡무 처리장이 아니었습니다. AI 붐의 인간적 중추 역할을 수행하게 된 것입니다.
그 붐은 계속 성장했습니다. 하지만 Mechanical Turk는 그와 함께 성장하지 못했습니다.
인간 계층이 AI를 사용하기 시작할 때
모순은 조용히 찾아왔다가, 어느 순간 한꺼번에 터져 나왔습니다. 2023년의 한 분석에 따르면, MTurk 작업자의 33%에서 46% 사이가 수작업으로 수행하기로 계약된 작업을 완료하기 위해 거대 언어 모델(LLM)을 사용하고 있는 것으로 나타났습니다. 연구자들은 인간의 판단력을 위해 비용을 지불했지만, 대신 ChatGPT를 받게 된 것입니다.
이것은 단순히 작업자들이 요령을 피우는 것에 대한 이야기가 아닙니다. 어노테이터가 고객 리뷰의 감정을 라벨링하거나, 의료 텍스트를 분류하거나, 챗봇 학습 세트를 위한 대화를 작성하기 위해 LLM을 사용할 때, 그 데이터는 더 이상 인간에 기반한 진실(human-grounded truth)이 아니게 됩니다. 그것은 기계의 최선의 추측을 복사한 복사본이 됩니다. 그 복사본을 다시 다른 모델에 그라운드 트루스(ground truth)로 입력하면 루프는 더욱 견고해집니다. 신호는 소음으로 퇴화합니다. '루프 안의 인간(human in the loop)'은 이미 백그라운드에서 실행 중인 소프트웨어에 대한 단순한 승인 도구(rubber stamp)로 전락합니다.
AI 산업에 있어 이는 실질적인 위기입니다. 팀들은 다양하고 유기적인 인간의 관점을 구매하고 있다고 믿으며 MTurk 계약에 수천 달러를 지출합니다. 만약 그 노동의 상당 부분이 자동화된다면, 결과물인 데이터셋은 실제 작업을 수행하는 LLM의 편향성, 사각지대, 환각(hallucination)을 그대로 물려받게 됩니다. 품질 관리는 점점 더 어려워집니다. 연구자들은 실제로 인간이 작업하고 있다는 것을 증명하기 위해서만 점점 더 복잡한 주의력 확인(attention checks)과 함정 질문(trap questions)을 설계해야 합니다. 이러한 방어적인 태도는 비용을 높이고 프로젝트 속도를 늦춥니다.
