मामला अदालत में क्यों पहुँचा

ANI ने तब मुकदमा किया जब उसने पाया कि हालिया भारतीय समाचारों से संबंधित प्रश्नों के ChatGPT के उत्तर अगस्त और सितंबर 2024 में प्रकाशित उसके अपने लेखों से मिलते-जुलते थे। एजेंसी ने तर्क दिया कि लार्ज लैंग्वेज मॉडल (LLM) उसके कॉपीराइट वाले टेक्स्ट को दोहरा रहा है, एक ऐसा दावा जिसे यदि बरकरार रखा गया, तो OpenAI को भारत में अपने मॉडलों को रोकने या भारी रूप से प्रतिबंधित करने के लिए मजबूर होना पड़ेगा।

OpenAI ने जवाब दिया कि उद्धृत किए गए दो मॉडल—GPT-4 और नया GPT-4o—अप्रैल 2022 और अप्रैल 2024 की कट-ऑफ तारीखों वाले डेटा पर प्रशिक्षित थे। ANI के लेख उन तारीखों के बाद आए थे, इसलिए वे मूल प्रशिक्षण सेट (training set) में नहीं हो सकते थे। न्यायाधीश अमित बंसल ने कहा कि यह समानता (overlap) संभवतः Retrieval-Augmented Generation (RAG) से आई है, जो वास्तविक समय में वेब सामग्री को उत्तर में शामिल करता है, न कि मॉडल द्वारा लेखों को "याद रखने" से।

कानूनी मोड़: "अनुसंधान" के रूप में प्रशिक्षण

यह मामला महत्वपूर्ण है क्योंकि अदालत ने "निजी या व्यक्तिगत उपयोग, जिसमें अनुसंधान शामिल है" के लिए भारत के कॉपीराइट अपवाद को व्यापक रूप से पढ़ा। दोनों पक्ष इस बात पर सहमत थे कि OpenAI ने प्रारंभिक प्रशिक्षण चरण के दौरान ANI की सामग्री का उपयोग किया था, लेकिन न्यायाधीश ने उस उपयोग को "परिवर्तनकारी" (transformative) माना। दूसरे शब्दों में, मॉडल ने केवल व्याकरण, वाक्य विन्यास (syntax) और सांख्यिकीय पैटर्न निकाले, जबकि अभिव्यंजक सामग्री (expressive content) को अप्रभावित छोड़ दिया।

अदालत ने दो सख्त शर्तें रखीं:

  • प्रशिक्षण के लिए उपयोग की जाने वाली प्रतियां वैध स्रोतों से होनी चाहिए, न कि पायरेटेड आर्काइव या पेवॉल (paywalls) से जिन्हें उपयोगकर्ता एक्सेस नहीं कर सकता।
  • सामग्री डेवलपर के अपने वातावरण के भीतर ही रहनी चाहिए; इसे प्रकाशित या वितरित नहीं किया जा सकता है।

तीन-चरणीय निष्पक्षता परीक्षण (three-part fairness test) लागू करते हुए, न्यायाधीश ने पाया कि OpenAI का उपयोग केवल प्रशिक्षण तक सीमित था, मॉडल द्वारा शब्दशः (verbatim) अंशों को याद रखने का कोई प्रमाण नहीं मिला, और उन्होंने नोट किया कि ANI को कोई प्रत्यक्ष आर्थिक नुकसान नहीं हुआ क्योंकि दोनों कंपनियां अलग-अलग बाजार क्षेत्रों में काम करती हैं।

यह वैश्विक फैसलों के ताने-बाने में कैसे फिट बैठता है

भारत का रुख अब कई अमेरिकी मामलों के समान है जो AI आउटपुट के परिवर्तनकारी दृष्टिकोण का समर्थन करते हैं। Kadrey v. Meta में, अदालत ने माना कि उत्पन्न टेक्स्ट जो सटीक शब्दों की नकल नहीं करता है, वह उल्लंघन नहीं है, जबकि लंबे समय से चले आ रहे Google Books निर्णय ने डिजिटलीकरण परियोजनाओं के लिए एक सीमित "खोज-और-प्रदर्शन" (search-and-display) अपवाद को मान्यता दी। अन्य अमेरिकी मुकदमों, जैसे कि Raw Story मामला, को प्रत्यक्ष नुकसान के अभाव में खारिज कर दिया गया था, लेकिन Anthropic विवाद ने न्यायाधीशों को याद दिलाया कि पायरेटेड डेटा का उपयोग करने से अभी भी दायित्व (liability) उत्पन्न हो सकता है।

पूरे यूरोप में, राय काफी भिन्न हैं। म्यूनिख की अदालतों ने फैसला सुनाया है कि मॉडल वेट्स (weights) में अंतर्निहित गीतों (lyrics) को पुनरुत्पादित करना उल्लंघन के समान है, जबकि लंदन के एक न्यायाधिकरण ने हाल ही में इसी आधार पर Stability AI के खिलाफ एक दावे को खारिज कर दिया। दिल्ली उच्च न्यायालय का फैसला एक और डेटा बिंदु जोड़ता है: यदि प्रशिक्षण वैध स्रोतों तक सीमित है और आउटपुट शब्दशः प्रतिलिपि नहीं है, तो यह गतिविधि अनुसंधान अपवाद के अंतर्गत आ सकती है।

डेवलपर्स को किन बातों पर ध्यान देना चाहिए

  • RAG बनाम प्रशिक्षण – "याद रखने" (प्रशिक्षण) और वास्तविक समय में पुनर्प्राप्ति (RAG) के बीच अदालत का अंतर बताता है कि भविष्य के विवाद इस बात पर केंद्रित होंगे कि क्या उत्तर एक स्थिर ज्ञान आधार (static knowledge base) से आता है या वेब से लाइव प्राप्त किया जाता है। डेवलपर्स को उत्पाद दस्तावेज़ों (product documentation) में उस अंतर को अधिक स्पष्ट करने की आवश्यकता हो सकती है।
  • स्रोत की उत्पत्ति (Source provenance) – "वैध स्रोतों" की आवश्यकता फर्मों को डेटा-क्यूरेशन पाइपलाइनों को सख्त करने के लिए प्रेरित कर सकती है, जिसमें ऐसे अनुबंधों या लाइसेंसों का उपयोग किया जाए जो यह साबित करें कि टेक्स्ट का प्रत्येक हिस्सा वैध है।
  • केवल आंतरिक उपयोग – जो कंपनियां मॉडल आउटपुट का व्यावसायीकरण करने की योजना बना रही हैं, उन्हें प्रशिक्षण डेटा को सख्ती से आंतरिक रखना चाहिए। भागीदारों या जनता के साथ कच्चे कॉर्पोरा (raw corpora) साझा करने से अनुसंधान बचाव (research defense) कमजोर हो सकता है।
  • आर्थिक-नुकसान परीक्षण – चूंकि अदालत ने प्रत्यक्ष वित्तीय क्षति की अनुपस्थिति पर जोर दिया, इसलिए दावेदारों को केवल ब्रांड की कथित गिरावट नहीं, बल्कि ठोस नुकसान दिखाना होगा।
  • विधायी प्रतिक्रिया – भारतीय कानून निर्माता AI से संबंधित कॉपीराइट बहसों की निगरानी कर रहे हैं। कोई भी संशोधन जो अनुसंधान अपवाद को सीमित करता है, वह पहले से तैनात मॉडलों को पूर्वव्यापी रूप से प्रभावित कर सकता है, जिससे अनुपालन ऑडिट (compliance audits) की लहर शुरू हो सकती है।

वह प्रति-तर्क जो अभी भी AI को परेशान करता है

ANI की शिकायत ने एक वास्तविक चिंता को उजागर किया: जैसे-जैसे LLM विशिष्ट वाक्यांशों को दोहराने में अधिक कुशल होते जा रहे हैं, "परिवर्तनकारी" उपयोग और "कॉपी" के बीच की रेखा धुंधली हो सकती है। आलोचकों का तर्क है कि RAG, हालांकि तकनीकी रूप से एक खोज कार्य है, फिर भी बिना अनुमति के कॉपीराइट वाली सामग्री को सामने लाता है, जो संभावित रूप से "जनता को संचार" (communication to the public) के अधिकार का उल्लंघन करता है।

एक मिसाल जिसके वैश्विक प्रभाव होंगे

मॉडल प्रशिक्षण को एक अनुमेय अनुसंधान गतिविधि के रूप में वर्गीकृत करके, दिल्ली उच्च न्यायालय ने संकेत दिया है कि भारत कॉपीराइट के आधार पर लार्ज लैंग्वेज मॉडल्स के विकास को स्वतः ही नहीं रोकेगा, बशर्ते कि डेवलपर्स स्रोत की वैधता का सम्मान करें और प्रशिक्षण को आंतरिक रखें। यह व्याख्या कंपनियों को अपने भारतीय परिचालन का विस्तार करने के लिए प्रोत्साहित कर सकती है, क्योंकि उन्हें पता है कि एक प्रमुख कानूनी बाधा अब कम हो गई है।

अन्य स्थानों के नियामकों के लिए, यह निर्णय एक खाका प्रदान करता है: एक संकीर्ण, अच्छी तरह से प्रलेखित अनुसंधान अपवाद को परिभाषित करना, स्पष्ट सोर्सिंग मानक लागू करना, और प्रशिक्षण डेटा के केवल आंतरिक प्रबंधन की आवश्यकता रखना। जो राष्ट्र इसी तरह की भाषा अपनाते हैं, वे अपने घरेलू AI इकोसिस्टम को निवेश आकर्षित करने के लिए आवश्यक निश्चितता प्रदान कर सकते हैं।

निष्कर्ष: दिल्ली उच्च न्यायालय का निर्णय AI प्रशिक्षण के लिए किसी भी टेक्स्ट को स्क्रैप करने की पूर्ण छूट नहीं देता है, लेकिन यह स्थापित करता है कि भारतीय कानून के तहत, अनुशासित और कानून के अनुपालन वाला प्रशिक्षण अनुसंधान की श्रेणी में आता है। यह व्याख्या दुनिया भर की अदालतों के लिए एक संदर्भ बिंदु बन सकती है क्योंकि वे इस बात से जूझ रही हैं कि मशीनों को भाषा समझना सिखाना एक संरक्षित विद्वत्तापूर्ण गतिविधि है या उल्लंघन की प्रतीक्षा कर रहा एक मामला।