آمازون یک تاریخ انقضا تعیین کرده است. در ۳۰ ژوئیه ۲۰۲۶، Mechanical Turk پذیرش مشتریان جدید را متوقف خواهد کرد. حساب‌های موجود به فعالیت خود ادامه خواهند داد و آمازون می‌گوید امنیت و پایداری پلتفرم را حفظ خواهد کرد. اما این شرکت همچنین تصریح کرده است که هیچ ویژگی جدیدی اضافه نخواهد شد. برای خدماتی که به تعریف عصری از نیروی کار اینترنتی کمک کرد، این خبر به منزله‌ی اعلام پایان فعالیت (sunset notice) است.

بازار اصلی کارهای پاره‌وقت (Gig Work)

Mechanical Turk در سال ۲۰۰۵ راه‌اندازی شد، مدت‌ها پیش از آنکه اپلیکیشن‌هایی مانند Uber یا TaskRabbit، مفهوم کارهای خرد را به یک موضوع همه‌گیر تبدیل کنند. آمازون آن را به عنوان بازاری برای «وظایف مبتنی بر هوش انسانی» (human intelligence tasks) ساخت؛ کارهای کوچکی که نرم‌افزارها هنوز قادر به انجام آن‌ها نبودند. کارگران که عمدتاً ناشناس و در سراسر جهان پراکنده بودند، برای پیاده‌سازی قطعات صوتی، تأیید آدرس فروشگاه‌ها، مدیریت محتوا و برچسب‌گذاری تصاویر وارد سیستم می‌شدند. آیا به کسی نیاز داشتید که یک CAPTCHA را حل کند، نتایج جستجو را رتبه‌بندی کند یا تشخیص دهد که آیا نظر یک مشتری مثبت است یا خشمگین؟ MTurk همان‌جا بود.

قیمت‌ها اغلب بر حسب سنت (cents) محاسبه می‌شدند. ممکن بود برای دسته‌ای شامل هزار مورد طبقه‌بندی تصویر، برای هر مورد فقط یک پنی پرداخت شود. برای پژوهشگران، بازاریابان و استارتاپ‌های نوپا، این موضوع انقلابی بود. ناگهان می‌توانستید در یک بعدازظهر نظرسنجی‌ای با صدها شرکت‌کننده انجام دهید، یا بدون استخدام یک تیم کامل برای برچسب‌گذاری، داده‌های آموزشی یک مدل بینایی ماشین را آماده کنید. این پلتفرم به یک زیرساخت تبدیل شد. دانشمندان علوم اجتماعی روی آن آزمایش می‌کردند، شرکت‌های فناوری رابط‌های کاربری را می‌آزمودند و تیم‌های هوش مصنوعی مجموعه‌داده‌ها را می‌ساختند.

در حدود سال ۲۰۱۸، آمازون سعی کرد این نقش را مدرن کند. این شرکت Mechanical Turk را به عنوان یک موتور برچسب‌گذاری داده (data annotation engine) برای شبکه‌های عصبی بازتعریف کرد و آن را با Amazon SageMaker AI پیوند نزدیک‌تری داد. ایده این بود که خط لوله یادگیری ماشین تغذیه شود: انسان‌ها مواد خام مورد نیاز الگوریتم‌ها برای یادگیری را پاک‌سازی، برچسب‌گذاری و تأیید می‌کردند. MTurk دیگر فقط مجموعه‌ای از کارهای پراکنده نبود؛ قرار بود ستون فقرات انسانی برای انفجار هوش مصنوعی باشد.

آن انفجار همچنان رو به رشد بود، اما Mechanical Turk با آن رشد نکرد.

وقتی لایه انسانی شروع به استفاده از هوش مصنوعی می‌کند

این تضاد ابتدا بی‌صدا و سپس به ناگهان پدیدار شد. یک تحلیل در سال ۲۰۲۳ نشان داد که بین ۳۳ تا ۴۶ درصد از کارگران MTurk از مدل‌های زبانی بزرگ (LLMs) برای انجام وظایفی استفاده می‌کردند که برای انجام آن‌ها با دست پول می‌گرفتند. پژوهشگران برای قضاوت انسانی هزینه می‌کردند، اما در عوض با ChatGPT مواجه می‌شدند.

این فقط داستانِ کارگرانی نیست که می‌خواهند از راه‌های میان‌بر استفاده کنند. وقتی یک برچسب‌گذار از یک LLM برای تعیین لحن در نظرات مشتریان، طبقه‌بندی متون پزشکی، یا نوشتن دیالوگ برای مجموعه‌داده‌های آموزشی چت‌بات استفاده می‌کند، داده‌ها دیگر «حقیقت مبتنی بر انسان» نیستند؛ بلکه به کپیِ حدس و گمان‌های بهترین تخمین یک ماشین تبدیل می‌شوند. اگر آن کپی را دوباره به عنوان «حقیقت مرجع» (ground truth) به مدل دیگری بدهید، این چرخه تنگ‌تر می‌شود. سیگنال به نویز تبدیل می‌شود و «انسان در چرخه» (human in the loop) تنها به مهر تأییدی برای نرم‌افزاری تبدیل می‌شود که از قبل در پس‌زمینه در حال اجرا بوده است.

برای صنعت هوش مصنوعی، این یک بحران عملی است. تیم‌ها هزاران دلار صرف قراردادهای MTurk می‌کنند با این باور که در حال خرید دیدگاه‌های متنوع و ارگانیک انسانی هستند. اگر بخش بزرگی از آن نیروی کار خودکارسازی شود، مجموعه‌داده‌ی حاصل، سوگیری‌ها، نقاط کور و توهمات (hallucinations) آن LLM را که کار اصلی را انجام می‌دهد، به ارث می‌برد. کنترل کیفیت دشوارتر می‌شود. پژوهشگران مجبورند برای اثبات اینکه واقعاً یک انسان در آنجا حضور دارد، آزمون‌های توجه و سوالات تله‌ی (trap questions) پیچیده‌تری طراحی کنند. این رویکرد تدافعی باعث افزایش هزینه‌ها و کند شدن پروژه‌ها می‌شود.