وزارت دادگستری ایالات متحده مداخله حقوقی مهمی در جنگ حق تکثیر (کپیرایت) جاری میان غولهای رسانهای و توسعهدهندگان هوش مصنوعی انجام داده است. با استدلال اینکه آموزش مدلهای زبانی بزرگ (LLMs) بر روی دادههای دارای حق تکثیر، مصداق «استفاده منصفانه» (fair use) است، وزارت دادگستری سپر قانونی عظیمی برای شرکتهایی مانند OpenAI و Microsoft فراهم کرده است.
استدلال وزارت دادگستری: آموزش در مقابل خروجی
در قلب شکایت تجمیعی مربوط به The New York Times، تمایزی بنیادی میان نحوه یادگیری هوش مصنوعی و آنچه تولید میکند وجود دارد. The New York Times ادعا میکند که میلیونها مقاله آن بدون اجازه برای آموزش مدلهایی مانند GPT-4 استفاده شده است که باعث خسارات میلیاردی شده و محصولاتی ایجاد کرده که مستقیماً با این روزنامه رقابت میکنند.
با این حال، لایحه اخیر وزارت دادگستری استدلال میکند که نقض حق تکثیر در مرحله خروجی رخ میدهد، نه در مرحله دریافت دادهها (ingestion). این وزارتخانه معتقد است که اگرچه آثار کامل در مرحله آموزش کپی میشوند، اما این کپیها هرگز در دسترس عموم قرار نمیگیرند. علاوه بر این، وزارت دادگستری تأکید میکند که خروجیهای مدلهایی مانند GPT-4 «اغلب، اگر نگوییم همیشه، فاقد شباهت ماهوی» با منبع اصلی هستند. وزارت دادگستری با جداسازی فرآیند آموزش از محتوای تولید شده، تلاش میکند تا عمل یادگیری ماشین را از مفهوم حقوقی «جایگزینی در بازار» جدا کند.
«تمثیل همینگوی» و خلاقیت انسانی
برای ملموس کردن مفهوم یادگیری ماشین، وزارت دادگستری از یک تمثیل ادبی با استفاده از نام نویسنده، Joan Didion، بهره برد. در این لایحه اشاره شده است که Didion در دوران نوجوانی، داستانهای Ernest Hemingway را کپی میکرد تا ساختار جملات او را تحلیل کند و مهارتهای او را بیاموزد. وزارت دادگستری استدلال میکند که اگر قانون، آموزش ماشین را به عنوان نقض حق تکثیر تلقی میکرد، نویسندهای مانند Didion تئوریکاً میتوانست هر بار که اثر جدیدی منتشر میکند با مسئولیت حقوقی روبرو شود، زیرا فرآیند یادگیری او با نوشتههای بعدیاش پیوندی ناگسستنی دارد.
این وزارتخانه همچنین استدلال میکند که اعمال مسئولیت مطلق برای آموزش هوش مصنوعی، به شکلی متناقض، همان خلاقیتی را که قانون کپیرایت برای محافظت از آن وضع شده است، سرکوب میکند. با توجه به اینکه انسانها به طور فزایندهای از LLMs برای پیشنویس و ویرایش آثار اصلی استفاده میکنند، وزارت دادگستری پیشنهاد میکند که غیرمجاز دانستن آموزش بدون طرحهای گسترده صدور مجوز، نوآوریهای مبتنی بر هوش مصنوعی را فلج خواهد کرد.
به چالش کشیدن اداره کپیرایت ایالات متحده
موضع وزارت دادگستری مستقیماً با یافتههای اخیر اداره کپیرایت ایالات متحده در تضاد است. Shira Perlmutter، ثبتکننده سابق، پیش از این با دفاع کلی از «استفاده منصفانه» مخالفت کرده و خاطرنشان کرده بود که هوش مصنوعی در مقیاس و سرعتی بسیار فراتر از توانایی انسان عمل میکند و اغلب محصولات تجاریای تولید میکند که مستقیماً با تولیدکنندگان اصلی محتوا رقابت میکنند.
وزارت دادگستری در پاسخ به این ارزیابی، حالت تهاجمی به خود گرفته و اعلام کرده است که گزارش Perlmutter فاقد اعتبار حقوقی الزامآور است و تحلیلهای مورد نیاز برای بررسی مورد به مورد (case-by-case) را نادیده گرفته است. این وزارتخانه هشدار میدهد که اعمال مسئولیت گسترده، عملاً یک رژیم صدور مجوز را اجباری میکند که توسعه مدلهای پیشرفته هوش مصنوعی را از نظر قانونی و مالی غیرممکن میسازد.
نکات کلیدی
- جداسازی آموزش و خروجی: وزارت دادگستری استدلال میکند که کپی کردن متن برای آموزش، اگر خروجیهای مدل حاصل از آن «شباهت ماهوی» با آثار اصلی نشان ندهند، مصداق نقض حق تکثیر نیست.
- محافظت از نوآوری: این وزارتخانه هشدار میدهد که الزام به دریافت مجوز برای تمام دادههای آموزشی، خلاقیت را سرکوب کرده و مانع از توسعه LLMهایی میشود که به خلق محتوا توسط انسان کمک میکنند.
- یک معیار حقوقی: این مداخله، یک تضاد پرمخاطره میان وزارت دادگستری و اداره کپیرایت ایالات متحده ایجاد میکند و زمینه را برای یک حکم قطعی دادگاه در مورد آینده هوش مصنوعی مولد فراهم میسازد.
ARTICLE: وزارت دادگستری ایالات متحده یک لایحه amicus brief در شکایت کپیرایت نیویورک تایمز ارائه کرد و استدلال نمود که کپی کردن متنهای محافظتشده برای آموزش مدلهای زبانی بزرگ (LLMs) واجد شرایط «استفاده منصفانه» است. این لایحه به شرکتهایی مانند OpenAI و Microsoft سپر قانونی میدهد که میتواند آنها را از پرداخت خساراتی که روزنامه میلیاردی تخمین میزند، مصون بدارد.
چرا این پرونده اکنون اهمیت دارد
این شکایت چندین ادعا را تجمیع میکند که توسعهدهندگان هوش مصنوعی میلیونها مقاله روزنامه را بدون اجازه وارد مدلهای خود کرده و سپس محصولاتی را عرضه کردهاند که مستقیماً با گزارشهای خودِ تایمز رقابت میکنند. اگر دادگاه استدلال «استفاده منصفانه» وزارت دادگستری را رد کند، شرکتهای هوش مصنوعی ممکن است با هزینههای سنگین مجوز مواجه شوند یا مجبور به توقف توسعه نسل بعدی عوامل گفتگوگر (conversational agents) شوند.
استدلال اصلی وزارت دادگستری
این لایحه گردش کار هوش مصنوعی را به دو مرحله متمایز تقسیم میکند. نخست، مدل مجموعههای بزرگی از متن را جذب میکند؛ دوم، به پرسشهای کاربران پاسخ میدهد. این وزارتخانه میگوید نقض حقوق تنها زمانی رخ میدهد که یک اثر دارای حق چاپ (کپیرایت) به گونهای بازتولید شود که عموم مردم بتوانند به آن دسترسی داشته باشند. از آنجایی که نسخههای آموزشی هرگز از سرورهای توسعهدهنده خارج نمیشوند، عمل جذب دادهها به آن آستانه نمیرسد.
وزارت دادگستری (DOJ) همچنین بر آزمون «شباهت ماهوی»، که یک استاندارد دیرینه در کپیرایت است، تکیه میکند. این وزارتخانه استدلال میکند که متن خروجی مدلهایی مانند GPT-4 «اغلب، اگر نگوییم همیشه»، آنقدر با هر منبع واحد تفاوت دارد که خواهان نمیتواند شباهت لازم را اثبات کند. به طور خلاصه، این لایحه استدلال میکند که تمرکز حقوقی باید بر خروجی نهایی باشد، نه بر فرآیند یادگیری داخلی.
یک تمثیل ادبی برای روشن شدن موضوع
برای ملموستر کردن استدلال فنی، این لایحه به داستانی درباره یک نویسنده نوجوان اشاره میکند که داستانهای ارنست همینگوی را برای مطالعه سبک او کپی میکرد. وزارت دادگستری میگوید اگر قانون با آن تمرین یادگیری به عنوان نقض کپیرایت برخورد میکرد، نویسنده میتوانست هر بار که اثر جدیدی منتشر میکند مورد شکایت قرار گیرد، حتی اگر کار او اصیل بود. این وزارتخانه هشدار میدهد که تعمیم همین منطق به هوش مصنوعی، «همان خلاقیتی را که قانون کپیرایت برای محافظت از آن طراحی شده است، فلج خواهد کرد.»
مخاطرات برای توسعهدهندگان هوش مصنوعی و تولیدکنندگان محتوا
- ریسک نوآوری: الزام به دریافت مجوز برای هر قطعه متن مورد استفاده در آموزش میتواند هزینهها را چنان بالا ببرد که ساخت مدلهای پیشرفته از نظر مالی غیرممکن شود.
- گردش کار خلاقانه: نویسندگان انسانی به طور فزایندهای برای پیشنویس، ویرایش و ایدهپردازی به LLMها متکی هستند. اگر فرآیند آموزش غیرقانونی تشخیص داده شود، این ابزارها ممکن است ناپدید شوند و شیوه تولید محتوا را در صنایع مختلف تغییر دهند.
- تأثیر بر بازار: صنعت روزنامهنگاری استدلال میکند مدلهای هوش مصنوعی که میتوانند به سؤالات پاسخ دهند یا متنی شبیه به اخبار تولید کنند، ارزش گزارشگری اصیل را کاهش میدهند و پتانسیل جذب درآمد تبلیغات و حق اشتراک را از آنها میگیرند.
دیدگاه متقابل اداره کپیرایت
گزارش اخیر اداره کپیرایت ایالات متحده، که تحت نظارت مدیر سابق، شیرا پرلموتر، تهیه شده است، با دفاع کلی از «استفاده منصفانه» (fair-use) مخالفت کرد. این اداره بر سه عامل تأکید کرد که هوش مصنوعی را از یادگیری انسانی متمایز میکند: حجم عظیم مطالب کپیشده، سرعتی که با آن پردازش میشوند، و این واقعیت که مدلهای حاصل میتوانند به عنوان محصولات تجاری بستهبندی و فروخته شوند که مستقیماً با خالقان منابع اصلی رقابت میکنند.
وزارت دادگستری این نکات را رد میکند و خاطرنشان میسازد که این گزارش فاقد اعتبار قانونی الزامآور است و رویههای قضایی موجود در حال حاضر مستلزم تحلیل مورد به موردِ استفاده منصفانه هستند. این وزارتخانه هشدار میدهد که اعمال «مسئولیت گسترده» عملاً صنعت را مجبور به پذیرش رژیم مجوزدهی میکند که «توسعه مدلهای پیشرفته هوش مصنوعی را از نظر قانونی و مالی غیرممکن میسازد.»
آنچه ممکن است در آینده رخ دهد
دادگاه منطقهای که پرونده تایمز را رسیدگی میکند، باید موضع وزارت دادگستری در مورد استفاده منصفانه را در برابر یافتههای اداره کپیرایت بسنجد. حکمی به نفع وزارت دادگستری، سابقهای ایجاد میکند که نشان میدهد دادههای آموزشی را میتوان بدون اجازه صریح جمعآوری کرد، مشروط بر اینکه خروجیهای مدل از شباهت ماهوی فاصله داشته باشند. تصمیمی به نفع روزنامهها میتواند موجی از مذاکرات مربوط به مجوزدهی را به راه بیندازد و به طور بالقوه اقتصاد تحقیقات هوش مصنوعی را بازتعریف کند.
خلاصه کلام
لایحه وزارت دادگستری، پرسشِ اینکه آیا آموزش هوش مصنوعی مصداق «استفاده منصفانه» است یا خیر را به یک نبرد حقوقی پرمخاطره تبدیل میکند. نتیجه مشخص خواهد کرد که آیا توسعهدهندگان میتوانند به ساخت مدلهای زبانی قدرتمند بر پایه متون موجود ادامه دهند یا باید برای هر قطعه از مطالبی که جذب میکنند، به دنبال مجوزهای پرهزینه باشند. این تصمیم در بخش فناوری، صنعت رسانه و اقتصاد خلاق گستردهتر، بازتابهای وسیعی خواهد داشت.
