یہ کیس عدالت میں کیوں پہنچا

ANI نے اس وقت مقدمہ دائر کیا جب اس نے محسوس کیا کہ حالیہ بھارتی خبروں کے بارے میں ChatGPT کے جوابات اگست اور ستمبر 2024 میں شائع ہونے والے اس کے اپنے مضامین سے مشابہت رکھتے ہیں۔ ایجنسی نے دلیل دی کہ یہ لارج لینگویج ماڈل (LLM) اس کے کاپی رائٹ شدہ متن کو دوبارہ پیش کر رہا ہے، ایک ایسا دعویٰ جسے اگر برقرار رکھا گیا تو اس سے OpenAI کو بھارت میں اپنے ماڈلز کو روکنے یا ان پر سخت پابندیاں لگانے پر مجبور ہونا پڑے گا۔

OpenAI نے جواب دیا کہ جن دو ماڈلز کا حوالہ دیا گیا ہے—GPT-4 اور نیا GPT-4o—انہیں اپریل 2022 اور اپریل 2024 کی کٹ آف تاریخوں والے ڈیٹا پر تربیت دی گئی تھی۔ ANI کے مضامین ان تاریخوں کے بعد شائع ہوئے، اس لیے وہ اصل ٹریننگ سیٹ میں شامل نہیں ہو سکتے تھے۔ جج امت بنسل نے کہا کہ یہ مماثلت زیادہ تر Retrieval-Augmented Generation (RAG) کی وجہ سے ہو سکتی ہے، جو ریئل ٹائم میں ویب کا تازہ ترین مواد جواب میں شامل کرتا ہے، نہ کہ ماڈل کے مضامین کو "یاد رکھنے" کی وجہ سے۔

قانونی موڑ: تربیت بطور "تحقیق"

یہ کیس اس لیے اہم ہے کیونکہ عدالت نے "نجی یا ذاتی استعمال، بشمول تحقیق" کے لیے بھارت کے کاپی رائٹ استثنا (exception) کی وسیع تشریح کی۔ دونوں فریقین اس بات پر متفق تھے کہ OpenAI نے ابتدائی تربیت کے مرحلے کے دوران ANI کا مواد استعمال کیا، لیکن جج نے اس استعمال کو "تبدیلی لانے والا" (transformative) قرار دیا۔ دوسرے لفظوں میں، ماڈل نے صرف گرامر، سینٹیکس اور شماریاتی پیٹرنز نکالے، جبکہ تخلیقی مواد کو برقرار رکھا۔

عدالت نے دو سخت شرائط مقرر کیں:

  • تربیت کے لیے استعمال ہونے والی کاپیاں قانونی ذرائع سے ہونی چاہئیں، نہ کہ پائریٹڈ آرکائیوز یا ایسے پے والز (paywalls) سے جن تک صارف کی رسائی نہ ہو۔
  • مواد ڈویلپر کے اپنے ماحول کے اندر رہنا چاہیے؛ اسے شائع یا تقسیم نہیں کیا جا سکتا۔

تین حصوں پر مشتمل انصاف کے ٹیسٹ (fairness test) کا اطلاق کرتے ہوئے، جج نے پایا کہ OpenAI کا استعمال صرف تربیت تک محدود تھا، ماڈل کے لفظ بہ لفظ اقتباسات یاد کرنے کا کوئی ثبوت نہیں ملا، اور یہ نوٹ کیا کہ ANI کو کوئی براہ راست معاشی نقصان نہیں ہوا کیونکہ دونوں کمپنیاں مختلف مارکیٹ سیگمنٹس میں کام کرتی ہیں۔

یہ عالمی فیصلوں کے مجموعے میں کیسے فٹ بیٹھتا ہے

بھارت کا موقف اب امریکہ کے کئی ایسے کیسز کی عکاسی کرتا ہے جو AI کے نتائج کے "تبدیلی لانے والے" (transformative) نقطہ نظر کی حمایت کرتے ہیں۔ Kadrey v. Meta میں، عدالت نے قرار دیا کہ تیار کردہ متن جو عین الفاظ کی نقل نہیں کرتا وہ خلاف ورزی نہیں ہے، جبکہ طویل عرصے سے جاری Google Books کے فیصلے نے ڈیجیٹائزیشن پروجیکٹس کے لیے ایک محدود "سرچ اینڈ ڈسپلے" استثنا کو تسلیم کیا ہے۔ امریکہ کے دیگر مقدمات، جیسے کہ Raw Story کیس، قابلِ اثبات نقصان کی کمی کی وجہ سے خارج کر دیے گئے تھے، لیکن Anthropic تنازعہ نے ججوں کو یاد دلایا کہ پائریٹڈ ڈیٹا کا استعمال اب بھی ذمہ داری (liability) کا باعث بن سکتا ہے۔

پورے یورپ میں، آراء میں واضح فرق ہے۔ میونخ کی عدالتوں نے فیصلہ دیا ہے کہ ماڈل ویٹس (weights) میں شامل گیتوں کے بول کو دوبارہ پیش کرنا خلاف ورزی کے مترادف ہے، جبکہ لندن کے ایک ٹربیونل نے حال ہی میں اسی بنیاد پر Stability AI کے خلاف دعوے کو مسترد کر دیا۔ دہلی ہائی کورٹ کا فیصلہ ایک اور اہم نکتہ شامل کرتا ہے: اگر تربیت قانونی ذرائع تک محدود ہے اور نتیجہ لفظ بہ لفظ نقل نہیں ہے، تو یہ سرگرمی تحقیق کے استثنا کے تحت آ سکتی ہے۔

ڈویلپرز کو کن چیزوں پر نظر رکھنی چاہیے

  • RAG بمقابلہ ٹریننگ – عدالت کی جانب سے "یادداشت" (ٹریننگ) اور ریئل ٹائم ریٹریول (RAG) کے درمیان فرق یہ بتاتا ہے کہ مستقبل کے تنازعات اس بات پر مرکوز ہوں گے کہ آیا جواب کسی ساکن نالج بیس سے آتا ہے یا ویب سے لائیو حاصل کیا جاتا ہے۔ ڈویلپرز کو شاید پروڈکٹ کی دستاویزات میں اس فرق کو مزید واضح کرنے کی ضرورت پڑے۔
  • ذرائع کی اصلیت (Source provenance) – "قانونی ذرائع" کی ضرورت کمپنیوں کو ڈیٹا کی کیوریٹیشن (curation) کے عمل کو مزید سخت کرنے پر مجبور کر سکتی ہے، جس میں ایسے معاہدوں یا لائسنسوں کا استعمال کیا جائے جو ثابت کریں کہ متن کا ہر حصہ قانونی ہے۔
  • صرف اندرونی استعمال – جو کمپنیاں ماڈل کے نتائج کو کمرشلائز کرنے کا منصوبہ بنا رہی ہیں، انہیں ٹریننگ ڈیٹا کو سختی سے اندرونی رکھنا چاہیے۔ پارٹنرز یا عوام کے ساتھ خام ڈیٹا (raw corpora) شیئر کرنے سے "تحقیق" کے دفاعی موقف کو نقصان پہنچ سکتا ہے۔
  • معاشی نقصان کا ٹیسٹ – چونکہ عدالت نے براہ راست مالی نقصان کی عدم موجودگی پر زور دیا ہے، اس لیے دعویداروں کو صرف برانڈ کی ساکھ میں کمی کے بجائے ٹھوس نقصان دکھانا ہوگا۔
  • قانون ساز ردعمل – بھارتی قانون ساز AI سے متعلق کاپی رائٹ بحثوں کی نگرانی کر رہے ہیں۔ کوئی بھی ترمیم جو تحقیق کے استثنا کو محدود کرتی ہے، وہ پہلے سے موجود ماڈلز پر اثر انداز ہو سکتی ہے، جس سے تعمیل کے آڈٹ (compliance audits) کی ایک لہر شروع ہو سکتی ہے۔

وہ جوابی دلیل جو اب بھی AI کے لیے خطرہ بنی ہوئی ہے

ANI کی شکایت نے ایک حقیقی تشویش کو اجاگر کیا ہے: جیسے جیسے LLMs مخصوص الفاظ کو دہرانے میں زیادہ ماہر ہوتے جا رہے ہیں، "تبدیلی لانے والے" استعمال اور "نقل" کے درمیان فرق دھندلا سکتا ہے۔ ناقدین کا کہنا ہے کہ RAG، اگرچہ تکنیکی طور پر ایک سرچ فنکشن ہے، پھر بھی اجازت کے بغیر کاپی رائٹ شدہ مواد سامنے لاتا ہے، جو ممکنہ طور پر "عوام تک رسائی" (communication to the public) کے حق کی خلاف ورزی ہے۔

ایک نظیر جس کے عالمی اثرات ہوں گے

ماڈل کی تربیت کو ایک جائز تحقیقی سرگرمی قرار دے کر، دہلی ہائی کورٹ نے یہ اشارہ دیا ہے کہ بھارت کاپی رائٹ کی بنیاد پر لارج لینگویج ماڈلز کی ترقی کو خود بخود نہیں روکے گا، بشرطیکہ ڈویلپرز ذرائع کی قانونی حیثیت کا احترام کریں اور تربیت کے عمل کو اندرونی سطح تک محدود رکھیں۔ یہ تشریح کمپنیوں کو اپنے بھارتی آپریشنز کو وسعت دینے کی ترغیب دے سکتی ہے، کیونکہ اب انہیں معلوم ہے کہ ایک اہم قانونی رکاوٹ نرم پڑ گئی ہے۔

دیگر مقامات پر ریگولیٹرز کے لیے، یہ فیصلہ ایک نمونہ فراہم کرتا ہے: ایک محدود اور اچھی طرح سے دستاویزی تحقیقی استثنا کی تعریف کریں، ذرائع کے واضح معیارات نافذ کریں، اور تربیتی ڈیٹا کی صرف اندرونی طور پر ہینڈلنگ کو لازمی قرار دیں۔ وہ ممالک جو اسی طرح کی زبان اپنائیں گے، وہ اپنے مقامی AI ایکو سسٹم کو سرمایہ کاری راغب کرنے کے لیے ضروری یقینی صورتحال فراہم کر سکتے ہیں۔

خلاصہ: دہلی ہائی کورٹ کا فیصلہ AI تربیت کے لیے کسی بھی متن کو اسکریپ کرنے کی مکمل آزادی نہیں دیتا، لیکن یہ اس بات کو مستحکم کرتا ہے کہ بھارتی قانون کے تحت، نظم و ضبط کے ساتھ اور قانون کی پاسداری کرتے ہوئے کی جانے والی تربیت تحقیق کے زمرے میں آتی ہے۔ یہ تشریح دنیا بھر کی عدالتوں کے لیے ایک حوالہ بن سکتی ہے جب وہ اس الجھن سے نمٹ رہی ہوں کہ مشینوں کو زبان سمجھنا سکھانا ایک محفوظ علمی سرگرمی ہے یا ایک ایسی خلاف ورزی جو ہونے ہی والی ہے۔