अमेरिकी न्याय विभाग (DOJ) ने मीडिया दिग्गजों और AI डेवलपर्स के बीच चल रहे कॉपीराइट युद्ध में एक महत्वपूर्ण कानूनी हस्तक्षेप किया है। यह तर्क देकर कि कॉपीराइट डेटा पर लार्ज लैंग्वेज मॉडल्स (LLMs) को प्रशिक्षित करना "उचित उपयोग" (fair use) के अंतर्गत आता है, DOJ ने OpenAI और Microsoft जैसी कंपनियों को एक विशाल कानूनी ढाल प्रदान की है।

DOJ का तर्क: प्रशिक्षण बनाम आउटपुट

The New York Times से जुड़े समेकित मुकदमे के केंद्र में इस बात का मौलिक अंतर है कि एक AI कैसे सीखता है और वह क्या उत्पन्न करता है। The New York Times का आरोप है कि GPT-4 जैसे मॉडलों को प्रशिक्षित करने के लिए उसके लाखों लेखों का बिना अनुमति के उपयोग किया गया, जिससे अरबों डॉलर का नुकसान हुआ और ऐसे उत्पाद बने जो सीधे समाचार पत्र के साथ प्रतिस्पर्धा करते हैं।

हालांकि, DOJ की हालिया फाइलिंग का तर्क है कि कॉपीराइट उल्लंघन आउटपुट के समय होता है, न कि डेटा ग्रहण (ingestion) के समय। विभाग का तर्क है कि हालांकि प्रशिक्षण चरण के दौरान संपूर्ण कार्यों की नकल की जाती है, लेकिन इन प्रतियों को कभी भी सार्वजनिक रूप से उपलब्ध नहीं कराया जाता है। इसके अलावा, DOJ का दावा है कि GPT-4 जैसे मॉडलों के आउटपुट में "अक्सर, यदि हमेशा नहीं, तो मूल स्रोत सामग्री के साथ पर्याप्त समानता का अभाव होता है"। प्रशिक्षण प्रक्रिया को उत्पन्न सामग्री से अलग करके, DOJ मशीन लर्निंग की क्रिया को बाजार प्रतिस्थापन (market substitution) की कानूनी अवधारणा से अलग करने का प्रयास कर रहा है।

"हेमिंग्वे सादृश्य" (Hemingway Analogy) और मानवीय रचनात्मकता

मशीन लर्निंग की अवधारणा को समझने योग्य बनाने के लिए, DOJ ने लेखिका Joan Didion से संबंधित एक साहित्यिक सादृश्य का सहारा लिया। फाइलिंग में उल्लेख किया गया कि किशोरावस्था में, Didion उनकी वाक्य संरचना का विश्लेषण करने और उनकी कला सीखने के लिए Ernest Hemingway की कहानियों की नकल करती थीं। DOJ का तर्क है कि यदि कानून मशीन प्रशिक्षण को उल्लंघन मानता है, तो Didion जैसे लेखक को सैद्धांतिक रूप से हर बार नया काम प्रकाशित करने पर दायित्व का सामना करना पड़ सकता है, क्योंकि उनकी सीखने की प्रक्रिया उनके बाद के लेखन से अटूट रूप से जुड़ी होगी।

विभाग का आगे तर्क है कि AI प्रशिक्षण के लिए सख्त दायित्व (strict liability) थोपना विरोधाभासी रूप से उसी रचनात्मकता को बाधित करेगा जिसकी रक्षा कॉपीराइट कानून का उद्देश्य है। चूंकि मनुष्य मूल कार्यों को ड्राफ्ट और एडिट करने के लिए तेजी से LLMs का उपयोग कर रहे हैं, इसलिए DOJ का सुझाव है कि बिना किसी बड़े लाइसेंसिंग तंत्र के प्रशिक्षण को वर्जित करना AI-संचालित नवाचार को पंगु बना देगा।

DOJ का रुख US Copyright Office के हालिया निष्कर्षों के सीधे विपरीत है। पूर्व रजिस्ट्रार Shira Perlmutter ने पहले एक व्यापक "उचित उपयोग" (fair use) बचाव के खिलाफ तर्क दिया था, जिसमें उन्होंने कहा था कि AI मानव क्षमता से कहीं अधिक पैमाने और गति पर काम करता है और अक्सर ऐसे वाणिज्यिक उत्पाद बनाता है जो मूल सामग्री निर्माताओं के साथ सीधे प्रतिस्पर्धा करते हैं।

DOJ ने इस मूल्यांकन के खिलाफ आक्रामक रुख अपनाते हुए कहा है कि Perlmutter की रिपोर्ट की कोई बाध्यकारी कानूनी शक्ति नहीं है और यह मामले-दर-मामले विश्लेषण (case-by-case analysis) के संबंध में स्थापित केस कानून को ध्यान में रखने में विफल रहती है। विभाग ने चेतावनी दी है कि व्यापक दायित्व थोपना प्रभावी रूप से एक लाइसेंसिंग व्यवस्था को अनिवार्य कर देगा जो उन्नत AI मॉडलों के विकास को कानूनी और वित्तीय रूप से असंभव बना देगी।

मुख्य बातें

  • प्रशिक्षण और आउटपुट का पृथक्करण: DOJ का तर्क है कि प्रशिक्षण के लिए टेक्स्ट की नकल करना उल्लंघन नहीं है यदि परिणामी मॉडल आउटपुट मूल कार्यों के साथ "पर्याप्त समानता" नहीं दिखाते हैं।
  • नवाचार का संरक्षण: विभाग चेतावनी देता है कि सभी प्रशिक्षण डेटा के लिए लाइसेंस की आवश्यकता होने से रचनात्मकता बाधित होगी और उन LLMs के विकास को रोका जाएगा जो मानव सामग्री निर्माण में सहायता करते हैं।
  • एक कानूनी मार्गदर्शक (Legal Bellwether): यह हस्तक्षेप DOJ और US Copyright Office के बीच एक उच्च-दांव वाला संघर्ष पैदा करता है, जो जनरेटिव AI के भविष्य पर एक निर्णायक अदालती फैसले के लिए मंच तैयार करता है।

ARTICLE: अमेरिकी न्याय विभाग ने New York Times के कॉपीराइट मुकदमे में एक 'एमिकस ब्रीफ' (amicus brief) दायर किया है, जिसमें तर्क दिया गया है कि लार्ज लैंग्वेज मॉडल्स (LLMs) को प्रशिक्षित करने के लिए संरक्षित टेक्स्ट की नकल करना 'उचित उपयोग' (fair use) की श्रेणी में आता है। यह फाइलिंग OpenAI और Microsoft जैसी कंपनियों को एक कानूनी ढाल प्रदान करती है जो उन्हें अरबों डॉलर के संभावित हर्जाने से बचा सकती है, जिसका अनुमान समाचार पत्र ने लगाया है।

यह मामला अब क्यों महत्वपूर्ण है

यह मुकदमा कई दावों को समाहित करता है कि AI डेवलपर्स ने बिना अनुमति के अपने मॉडलों में समाचार पत्रों के लाखों लेखों को फीड किया, और फिर ऐसे उत्पाद जारी किए जो Times की अपनी रिपोर्टिंग के साथ सीधे प्रतिस्पर्धा करते हैं। यदि अदालत DOJ के 'उचित उपयोग' के तर्क को खारिज कर देती है, तो AI फर्मों को भारी लाइसेंसिंग बिलों का सामना करना पड़ सकता है या उन्हें अगली पीढ़ी के कन्वर्सेशनल एजेंट्स के विकास को रोकने के लिए मजबूर किया जा सकता है।

DOJ का मुख्य तर्क

यह संक्षिप्त विवरण AI वर्कफ़्लो को दो अलग-अलग चरणों में विभाजित करता है। पहला, मॉडल टेक्स्ट के विशाल संग्रह (corpora) को ग्रहण (ingest) करता है; दूसरा, यह उपयोगकर्ता के प्रॉम्प्ट के जवाब उत्पन्न करता है। विभाग का कहना है कि उल्लंघन तभी होता है जब किसी कॉपीराइट कार्य को इस तरह से पुनरुत्पादित (reproduce) किया जाता है कि जनता उस तक पहुँच सके। चूंकि प्रशिक्षण की प्रतियां कभी भी डेवलपर के सर्वर से बाहर नहीं निकलती हैं, इसलिए ग्रहण करने की यह प्रक्रिया उस सीमा (threshold) तक नहीं पहुँचती है।

DOJ "substantial similarity" (पर्याप्त समानता) परीक्षण पर भी भरोसा करता है, जो कि कॉपीराइट का एक पुराना मानक है। इसका तर्क है कि GPT-4 जैसे मॉडलों द्वारा टेक्स्ट आउटपुट "अक्सर, यदि हमेशा नहीं भी" किसी भी एकल स्रोत से इतना भिन्न होता है कि वादी (plaintiff) आवश्यक समानता साबित नहीं कर सकता। संक्षेप में, यह संक्षिप्त विवरण तर्क देता है कि कानूनी ध्यान अंतिम आउटपुट पर होना चाहिए, न कि आंतरिक सीखने की प्रक्रिया पर।

इस बात को समझाने के लिए एक साहित्यिक उदाहरण

तकनीकी तर्क को अधिक समझने योग्य बनाने के लिए, इस फाइलिंग में एक किशोर लेखिका की कहानी का उल्लेख किया गया है, जिसने अर्नेस्ट हेमिंग्वे की शैली का अध्ययन करने के लिए उनकी कहानियों की नकल की थी। DOJ का कहना है कि यदि कानून उस सीखने के अभ्यास को उल्लंघन मानता, तो लेखिका पर हर बार मुकदमा चलाया जा सकता था जब वह कोई नई रचना प्रकाशित करती, भले ही उसका काम मौलिक था। विभाग चेतावनी देता है कि AI पर इसी तर्क को लागू करने से "वही रचनात्मकता पंगु हो जाएगी जिसकी रक्षा के लिए कॉपीराइट कानून बनाया गया था।"

AI डेवलपर्स और कंटेंट क्रिएटर्स के लिए दांव पर क्या है

  • नवाचार का जोखिम (Innovation risk): प्रशिक्षण में उपयोग किए जाने वाले टेक्स्ट के हर हिस्से के लिए लाइसेंस की आवश्यकता होने से लागत इतनी बढ़ सकती है कि अत्याधुनिक (state-of-the-art) मॉडल बनाना आर्थिक रूप से असंभव हो जाए।
  • रचनात्मक वर्कफ़्लो (Creative workflow): मानव लेखक ड्राफ्टिंग, एडिटिंग और मंथन (brainstorming) के लिए तेजी से LLMs पर निर्भर हो रहे हैं। यदि प्रशिक्षण प्रक्रिया को अवैध माना जाता है, तो वे उपकरण गायब हो सकते हैं, जिससे विभिन्न उद्योगों में कंटेंट उत्पादन का तरीका बदल सकता है।
  • बाजार पर प्रभाव (Market impact): समाचार उद्योग का तर्क है कि जो AI मॉडल सवालों के जवाब दे सकते हैं या समाचार जैसे टेक्स्ट उत्पन्न कर सकते हैं, वे मूल रिपोर्टिंग के मूल्य को कम करते हैं, जिससे संभावित रूप से विज्ञापन राजस्व और सब्सक्रिप्शन का नुकसान हो सकता है।

कॉपीराइट कार्यालय का प्रतिवाद

पूर्व रजिस्ट्रार शिरा पर्लमटर के नेतृत्व में तैयार की गई अमेरिकी कॉपीराइट कार्यालय की एक हालिया रिपोर्ट ने 'फेयर-यूज़' (fair-use) के व्यापक बचाव का विरोध किया है। कार्यालय ने तीन कारकों पर प्रकाश डाला जो AI को मानव सीखने से अलग करते हैं: कॉपी की गई सामग्री की विशाल मात्रा, जिस गति से इसे प्रोसेस किया जाता है, और यह तथ्य कि परिणामी मॉडलों को वाणिज्यिक उत्पादों के रूप में पैक और बेचा जा सकता है जो सीधे मूल रचनाकारों के साथ प्रतिस्पर्धा करते हैं।

DOJ इन बिंदुओं का खंडन करता है, यह नोट करते हुए कि रिपोर्ट में बाध्यकारी कानूनी अधिकार नहीं है और मौजूदा केस कानून पहले से ही फेयर-यूज़ के तथ्य-दर-तथ्य विश्लेषण की मांग करता है। यह चेतावनी देता है कि "व्यापक दायित्व" (broad liability) थोपने से उद्योग प्रभावी रूप से एक ऐसे लाइसेंसिंग शासन में फंस जाएगा जो "उन्नत AI मॉडलों के विकास को कानूनी और आर्थिक रूप से असंभव बना देगा।"

आगे क्या हो सकता है

टाइम्स मामले की सुनवाई करने वाली जिला अदालत को कॉपीराइट कार्यालय के निष्कर्षों के मुकाबले DOJ के फेयर-यूज़ के रुख को तौलना होगा। DOJ के पक्ष में फैसला एक मिसाल कायम करेगा कि प्रशिक्षण डेटा को स्पष्ट अनुमति के बिना एकत्र किया जा सकता है, बशर्ते कि मॉडल का आउटपुट 'substantial similarity' (पर्याप्त समानता) से दूर रहे। समाचार पत्र के पक्ष में निर्णय लाइसेंसिंग वार्ताओं की एक लहर शुरू कर सकता है, जो संभावित रूप से AI अनुसंधान के अर्थशास्त्र को नया रूप दे सकता है।

निष्कर्ष

DOJ की फाइलिंग इस सवाल को कि क्या AI प्रशिक्षण 'फेयर-यूज़' है, एक उच्च-दांव वाली अदालती लड़ाई में बदल देती है। परिणाम यह तय करेगा कि क्या डेवलपर्स मौजूदा टेक्स्ट पर शक्तिशाली लैंग्वेज मॉडल बनाना जारी रख सकते हैं या उन्हें अपने द्वारा ग्रहण किए जाने वाले सामग्री के हर हिस्से के लिए महंगे लाइसेंस लेने होंगे। यह निर्णय तकनीकी क्षेत्र, मीडिया उद्योग और व्यापक रचनात्मक अर्थव्यवस्था में व्यापक प्रभाव डालेगा।