چرا این پرونده به دادگاه کشیده شد

ANI پس از مشاهده اینکه پاسخ‌های ChatGPT به پرسش‌های مربوط به اخبار اخیر هند، مشابه مقالات خود این خبرگزاری است که در اوت و سپتامبر ۲۰۲۴ منتشر شده بودند، شکایت کرد. این خبرگزاری استدلال کرد که این مدل زبانی بزرگ در حال بازتولید متن‌های دارای حق کپی‌رایت آن‌هاست؛ ادعایی که در صورت تأیید، OpenAI را مجبور می‌کرد فعالیت مدل‌های خود را در هند متوقف کرده یا به شدت محدود کند.

OpenAI در پاسخ اعلام کرد که دو مدل ذکر شده — GPT-4 و مدل جدیدتر GPT-4o — بر اساس داده‌هایی با تاریخ قطع (cut-off) آوریل ۲۰۲۲ و آوریل ۲۰۲۴ آموزش دیده‌اند. مقالات ANI پس از این تاریخ‌ها منتشر شده بودند، بنابراین نمی‌توانستند در مجموعه داده‌های آموزشی اصلی باشند. قاضی Amit Bansal اعلام کرد که این هم‌پوشانی به احتمال زیاد ناشی از Retrieval-Augmented Generation (RAG) است که محتوای فعلی وب را به‌صورت لحظه‌ای (real-time) در پاسخ وارد می‌کند، و نه از طریق «به یاد آوردن» مقالات توسط مدل.

چرخش حقوقی: آموزش به مثابه «تحقیق»

اهمیت این پرونده در آن است که دادگاه استثنای کپی‌رایت هند برای «استفاده خصوصی یا شخصی، از جمله تحقیق» را به شکلی گسترده تفسیر کرد. هر دو طرف موافق بودند که OpenAI از مطالب ANI در مرحله اولیه آموزش استفاده کرده است، اما قاضی با این استفاده به عنوان یک امر «تحول‌آفرین» (transformative) برخورد کرد. به عبارت دیگر، مدل تنها دستور زبان، نحو (syntax) و الگوهای آماری را استخراج کرده و محتوای بیانی را دست‌نخورده باقی گذاشته است.

دادگاه دو شرط سختگیرانه تعیین کرد:

  • نسخه‌های استفاده شده برای آموزش باید از منابع قانونی تهیه شوند، نه از آرشیوهای غیرقانونی (pirated) یا صفحات دارای پرداخت (paywalls) که کاربر به آن‌ها دسترسی ندارد.
  • مطالب باید در محیط خودِ توسعه‌دهنده باقی بمانند؛ آن‌ها نباید منتشر یا توزیع شوند.

قاضی با اعمال یک آزمون انصاف سه‌مرحله‌ای، دریافت که استفاده OpenAI محدود به آموزش بوده است، هیچ شواهدی مبنی بر حفظ کردن عبارات کلمه به کلمه توسط مدل نیافت و خاطرنشان کرد که ANI دچار ضرر اقتصادی مستقیم نشده است، زیرا این دو شرکت در بخش‌های متفاوتی از بازار فعالیت می‌کنند.

جایگاه این حکم در میان مجموعه‌ای از احکام جهانی

موضع هند اکنون بازتاب‌دهنده چندین پرونده در ایالات متحده است که از دیدگاه «تحول‌آفرین» نسبت به خروجی‌های هوش مصنوعی حمایت می‌کنند. در پرونده Kadrey v. Meta، دادگاه حکم داد که متن‌های تولید شده‌ای که کلمات دقیق را کپی نمی‌کنند، نقض کپی‌رایت محسوب نمی‌شوند؛ در حالی که تصمیم قدیمی Google Books، یک استثنای محدود برای «جستجو و نمایش» در پروژه‌های دیجیتالی‌سازی را به رسمیت شناخت. سایر دعاوی در ایالات متحده، مانند پرونده Raw Story، به دلیل عدم وجود آسیب قابل اثبات رد شدند، اما جنجال Anthropic به قضات یادآوری کرد که استفاده از داده‌های غیرقانونی همچنان می‌تواند منجر به مسئولیت حقوقی شود.

در سراسر اروپا، نظرات به شدت متفاوت است. دادگاه‌ها در مونیخ حکم داده‌اند که بازتولید اشعار موسیقی که در وزن‌های مدل (model weights) تعبیه شده‌اند، مصداق نقض کپی‌رایت است، در حالی که یک دادگاه در لندن اخیراً ادعایی علیه Stability AI را با دلایل مشابه رد کرد. حکم دادگاه عالی دهلی نقطه داده دیگری را اضافه می‌کند: اگر آموزش به منابع قانونی محدود شود و خروجی یک کپی کلمه به کلمه نباشد، این فعالیت ممکن است تحت استثنای تحقیق قرار گیرد.

آنچه توسعه‌دهندگان باید زیر نظر داشته باشند

  • RAG در مقابل آموزش – تمایز دادگاه بین «حفظ کردن» (آموزش) و بازیابی لحظه‌ای (RAG) نشان می‌دهد که اختلافات آینده بر این موضوع متمرکز خواهد بود که آیا یک پاسخ از یک پایگاه دانش ایستا می‌آید یا به‌صورت زنده از وب فراخوانی می‌شود. توسعه‌دهندگان ممکن است نیاز داشته باشند که این مرز را در مستندات محصول خود شفاف‌تر کنند.
  • منشأ منابع – الزام به استفاده از «منابع قانونی» می‌تواند شرکت‌ها را وادار کند تا فرآیندهای مدیریت داده (data-curation) خود را با استفاده از قراردادها یا مجوزهایی که مشروع بودن هر بخش از متن را اثبات می‌کنند، سخت‌گیرانه‌تر کنند.
  • استفاده صرفاً داخلی – شرکت‌هایی که قصد تجاری‌سازی خروجی‌های مدل را دارند، باید داده‌های آموزشی را کاملاً داخلی نگه دارند. به اشتراک گذاشتن مجموعه‌های متنی خام (corpora) با شرکا یا عموم می‌تواند دفاعیه مبتنی بر «تحقیق» را تضعیف کند.
  • آزمون آسیب اقتصادی – از آنجایی که دادگاه بر عدم وجود آسیب مالی مستقیم تأکید کرد، خواهان‌ها باید ضرر ملموسی را نشان دهند، نه فقط کاهش احتمالی ارزش برند را.
  • پاسخ قانون‌گذاری – قانون‌گذاران هند در حال نظارت بر بحث‌های کپی‌رایت مرتبط با هوش مصنوعی هستند. هر اصلاحیه‌ای که استثنای تحقیق را محدود کند، می‌تواند به‌طور بازگشتی بر مدل‌هایی که قبلاً مستقر شده‌اند تأثیر بگذارد و موجی از حسابرسی‌های انطباق (compliance audits) را به راه بیندازد.

استدلال متقابلی که همچنان هوش مصنوعی را تهدید می‌کند

شکایت ANI یک نگرانی واقعی را برجسته کرد: با ماهرتر شدن LLMها در تکرار عبارت‌های خاص، مرز بین استفاده «تحول‌آفرین» و «کپی» می‌تواند کمرنگ شود. منتقدان استدلال می‌کنند که RAG، اگرچه از نظر فنی یک عملکرد جستجو است، اما همچنان محتوای دارای کپی‌رایت را بدون اجازه نمایش می‌دهد که پتانسیل نقض حق «ارتباط با عموم» را دارد.

یک رویه با اثرات موج‌گونه در سراسر جهان

دادگاه عالی دهلی با طبقه‌بندی آموزش مدل به عنوان یک فعالیت پژوهشی مجاز، سیگنال داد که هند به طور خودکار مانع توسعه مدل‌های زبانی بزرگ بر اساس قوانین حق تکثیر (کپی‌رایت) نخواهد شد، مشروط بر اینکه توسعه‌دهندگان به قانونی بودن منابع احترام گذاشته و فرآیند آموزش را به صورت داخلی نگه دارند. این تفسیر ممکن است شرکت‌ها را تشویق کند تا با دانستن اینکه یک مانع حقوقی کلیدی کاهش یافته است، فعالیت‌های خود را در هند گسترش دهند.

برای نهادهای تنظیم‌گر در سایر نقاط جهان، این حکم یک الگو ارائه می‌دهد: تعریف یک استثنای پژوهشی محدود و مستند، وضع استانداردهای شفاف برای منبع‌یابی، و الزام به مدیریت صرفاً داخلی داده‌های آموزشی. کشورهایی که ادبیات مشابهی را اتخاذ کنند، می‌توانند قطعیت لازم برای جذب سرمایه را به اکوسیستم‌های هوش مصنوعی داخلی خود ببخشند.

خلاصه کلام: تصمیم دادگاه عالی دهلی به معنای دادن اختیار مطلق برای استخراج هر متنی جهت آموزش هوش مصنوعی نیست، اما این اصل را تثبیت می‌کند که طبق قوانین هند، آموزش منضبط و مطابق با قانون، در زمره پژوهش قرار می‌گیرد. این تفسیر می‌تواند به یک نقطه مرجع برای دادگاه‌ها در سراسر جهان تبدیل شود، در حالی که آن‌ها با این چالش دست‌وپنجه نرم می‌کنند که آیا آموزش ماشین‌ها برای درک زبان، یک فعالیت علمی محافظت‌شده است یا تخطی از حقوق که در انتظار وقوع است.