মিডিয়া জায়ান্ট এবং এআই ডেভেলপারদের মধ্যে চলমান কপিরাইট যুদ্ধে মার্কিন বিচার বিভাগ (US Department of Justice) একটি গুরুত্বপূর্ণ আইনি হস্তক্ষেপ করেছে। কপিরাইটযুক্ত ডেটার ওপর লার্জ ল্যাঙ্গুয়েজ মডেল (LLMs) প্রশিক্ষণ দেওয়াকে "ফেয়ার ইউজ" (fair use) হিসেবে যুক্তি দিয়ে DOJ, OpenAI এবং Microsoft-এর মতো কোম্পানিগুলোর জন্য একটি বিশাল আইনি সুরক্ষা প্রদান করেছে।
DOJ-এর যুক্তি: প্রশিক্ষণ বনাম আউটপুট
The New York Times-এর সাথে জড়িত সমন্বিত মামলার মূলে রয়েছে একটি এআই কীভাবে শেখে এবং এটি কী তৈরি করে তার মধ্যে একটি মৌলিক পার্থক্য। The New York Times অভিযোগ করেছে যে, GPT-4-এর মতো মডেলগুলোকে প্রশিক্ষণ দেওয়ার জন্য তাদের লক্ষ লক্ষ নিবন্ধ অনুমতি ছাড়া ব্যবহার করা হয়েছে, যা বিলিয়ন ডলারের ক্ষতি করেছে এবং এমন পণ্য তৈরি করেছে যা সরাসরি সংবাদপত্রের সাথে প্রতিযোগিতা করে।
তবে, DOJ-এর সাম্প্রতিক ফাইলিংয়ে যুক্তি দেওয়া হয়েছে যে, কপিরাইট লঙ্ঘন ঘটে আউটপুট বা ফলাফল প্রদানের সময়, তথ্য গ্রহণের (ingestion) সময় নয়। বিভাগটি দাবি করেছে যে, প্রশিক্ষণ চলাকালীন সম্পূর্ণ কাজগুলো কপি করা হলেও, এই কপিগুলো কখনোই জনসমক্ষে উপলব্ধ করা হয় না। তদুপরি, DOJ দাবি করেছে যে GPT-4-এর মতো মডেলগুলোর আউটপুট প্রায়শই মূল উৎস উপাদানের সাথে "উল্লেখযোগ্য সাদৃশ্য প্রদর্শন করে না"। প্রশিক্ষণ প্রক্রিয়াকে জেনারেটেড কন্টেন্ট বা তৈরি করা বিষয়বস্তু থেকে আলাদা করার মাধ্যমে, DOJ মেশিন লার্নিং-এর কাজকে বাজার প্রতিস্থাপনের (market substitution) আইনি ধারণা থেকে বিচ্ছিন্ন করার চেষ্টা করছে।
"হেমিনওয়ে উপমা" এবং মানুষের সৃজনশীলতা
মেশিন লার্নিংয়ের ধারণাটিকে সহজবোধ্য করতে, DOJ লেখক Joan Didion-কে অন্তর্ভুক্ত করে একটি সাহিত্যিক উপমা ব্যবহার করেছে। ফাইলিংটিতে উল্লেখ করা হয়েছে যে, কিশোর বয়সে Didion তার বাক্য গঠন বিশ্লেষণ করতে এবং তার দক্ষতা শিখতে Ernest Hemingway-এর গল্পগুলো কপি করতেন। DOJ যুক্তি দিচ্ছে যে, আইন যদি মেশিন ট্রেনিংকে কপিরাইট লঙ্ঘন হিসেবে গণ্য করে, তবে Didion-এর মতো একজন লেখক তাত্ত্বিকভাবে প্রতিবার নতুন কাজ প্রকাশের সময় আইনি দায়বদ্ধতার সম্মুখীন হতে পারেন, কারণ তার শেখার প্রক্রিয়াটি তার পরবর্তী লেখার সাথে অবিচ্ছেদ্যভাবে যুক্ত।
বিভাগটি আরও যুক্তি দিয়েছে যে, এআই প্রশিক্ষণের জন্য কঠোর দায়বদ্ধতা আরোপ করাות কপিরাইট আইন যে সৃজনশীলতাকে রক্ষা করতে চায়, তার বিপরীতে সৃজনশীলতাকে বাধাগ্রস্ত করবে। মানুষ যখন ক্রমবর্ধমানভাবে মূল কাজ ড্রাফট এবং এডিট করার জন্য LLM ব্যবহার করছে, DOJ পরামর্শ দিচ্ছে যে বিশাল লাইসেন্সিং ব্যবস্থা ছাড়া প্রশিক্ষণকে নিষিদ্ধ করা হলে তা এআই-চালিত উদ্ভাবনকে পঙ্গু করে দেবে।
US Copyright Office-কে চ্যালেঞ্জ জানানো
DOJ-এর অবস্থান US Copyright Office-এর সাম্প্রতিক ফলাফলের সাথে সরাসরি সাংঘর্ষিক। প্রাক্তন রেজিস্ট্রার Shira Perlmutter আগে একটি ঢালাও "ফেয়ার ইউজ" প্রতিরক্ষার বিরুদ্ধে যুক্তি দিয়েছিলেন, উল্লেখ করেছিলেন যে এআই মানুষের ক্ষমতার বাইরে এমন স্কেল এবং গতিতে কাজ করে এবং প্রায়শই এমন বাণিজ্যিক পণ্য তৈরি করে যা মূল কন্টেন্ট নির্মাতাদের সাথে সরাসরি প্রতিযোগিতা করে।
DOJ এই মূল্যায়নের বিরুদ্ধে আক্রমণাত্মক অবস্থান নিয়েছে এবং বলেছে যে Perlmutter-এর রিপোর্ট কোনো বাধ্যতামূলক আইনি কর্তৃত্ব বহন করে না এবং এটি প্রতিটি মামলার আলাদা বিশ্লেষণের (case-by-case analysis) ক্ষেত্রে প্রতিষ্ঠিত মামলা সংক্রান্ত আইনকে বিবেচনা করতে ব্যর্থ হয়েছে। বিভাগটি সতর্ক করেছে যে, ব্যাপক দায়বদ্ধতা আরোপ করা কার্যকরভাবে একটি লাইসেন্সিং ব্যবস্থা বাধ্যতামূলক করবে যা উন্নত এআই মডেলের বিকাশকে আইনি ও আর্থিকভাবে অসম্ভব করে তুলবে।
মূল বিষয়সমূহ
- প্রশিক্ষণ এবং আউটপুটের পৃথকীকরণ: DOJ যুক্তি দিচ্ছে যে প্রশিক্ষণের জন্য টেক্সট কপি করা কপিরাইট লঙ্ঘন নয় যদি ফলাফলস্বরূপ মডেলের আউটপুট মূল কাজের সাথে "উল্লেখযোগ্য সাদৃশ্য" প্রদর্শন না করে।
- উদ্ভাবনের সুরক্ষা: বিভাগটি সতর্ক করেছে যে সমস্ত প্রশিক্ষণ ডেটার জন্য লাইসেন্স প্রয়োজন হলে তা সৃজনশীলতাকে বাধাগ্রস্ত করবে এবং মানুষের কন্টেন্ট তৈরিতে সহায়ক LLM-এর বিকাশ রোধ করবে।
- একটি আইনি মাপকাঠি: এই হস্তক্ষেপ DOJ এবং US Copyright Office-এর মধ্যে একটি উচ্চ-ঝুঁকিপূর্ণ দ্বন্দ্ব তৈরি করেছে, যা জেনারেটিভ এআই-এর ভবিষ্যৎ সম্পর্কে একটি চূড়ান্ত আদালতের রায়ের পথ তৈরি করছে।
ARTICLE: মার্কিন বিচার বিভাগ (US Department of Justice) New York Times-এর কপিরাইট মামলায় একটি অ্যামিকাস ব্রিফ (amicus brief) দাখিল করেছে, যেখানে যুক্তি দেওয়া হয়েছে যে লার্জ ল্যাঙ্গুয়েজ মডেল (LLMs) প্রশিক্ষণের জন্য সুরক্ষিত টেক্সট কপি করা "ফেয়ার ইউজ" হিসেবে গণ্য হয়। এই ফাইলিং OpenAI এবং Microsoft-এর মতো কোম্পানিগুলোকে একটি আইনি সুরক্ষা প্রদান করে যা তাদের বিলিয়ন ডলারের ক্ষতিপূরণ প্রদানের ঝুঁকি থেকে রক্ষা করতে পারে বলে সংবাদপত্রটি ধারণা করেছে।
কেন এই মামলাটি এখন গুরুত্বপূর্ণ
মামলাটি বেশ কিছু দাবিকে একত্রিত করেছে যে এআই ডেভেলপাররা অনুমতি ছাড়া তাদের মডেলে লক্ষ লক্ষ সংবাদ নিবন্ধ ইনপুট দিয়েছে এবং তারপর এমন পণ্য বাজারে এনেছে যা Times-এর নিজস্ব রিপোর্টিংয়ের সাথে সরাসরি প্রতিযোগিতা করে। যদি আদালত DOJ-এর ফেয়ার-ইউজ যুক্তি প্রত্যাখ্যান করে, তবে এআই সংস্থাগুলোকে বিশাল লাইসেন্সিং বিলের সম্মুখীন হতে হতে পারে বা পরবর্তী প্রজন্মের কনভারসেশনাল এজেন্টগুলোর বিকাশ বন্ধ করতে বাধ্য হতে পারে।
DOJ-এর মূল যুক্তি
ব্রিফটি AI কাজের ধারাকে (workflow) দুটি স্বতন্ত্র পর্যায়ে বিভক্ত করেছে। প্রথমত, মডেলটি বিশাল টেক্সট কর্পোরা (corpora) গ্রহণ করে; দ্বিতীয়ত, এটি ব্যবহারকারীর প্রম্পটের বিপরীতে প্রতিক্রিয়া তৈরি করে। বিভাগটি বলছে যে কপিরাইট লঙ্ঘন তখনই ঘটে যখন একটি কপিরাইটযুক্ত কাজ এমনভাবে পুনরুৎপাদন করা হয় যা জনসাধারণ দেখতে বা ব্যবহার করতে পারে। যেহেতু প্রশিক্ষণের জন্য ব্যবহৃত কপিগুলো কখনোই ডেভেলপারের সার্ভার থেকে বাইরে যায় না, তাই এই গ্রহণ করার প্রক্রিয়াটি সেই সীমার মধ্যে পড়ে না।
DOJ "substantial similarity" বা "যথেষ্ট সাদৃশ্য" পরীক্ষার ওপরও নির্ভর করছে, যা কপিরাইটের একটি দীর্ঘস্থায়ী মানদণ্ড। এটি দাবি করে যে GPT-4 এর মতো মডেলগুলোর টেক্সট আউটপুট "প্রায়শই বা সব সময়ই" কোনো একক উৎস থেকে যথেষ্ট আলাদা হয়, যার ফলে একজন বাদী প্রয়োজনীয় সাদৃশ্য প্রমাণ করতে পারেন না। সংক্ষেপে, ব্রিফটি যুক্তি দিচ্ছে যে আইনি গুরুত্ব চূড়ান্ত আউটপুটের ওপর হওয়া উচিত, অভ্যন্তরীণ শেখার প্রক্রিয়ার ওপর নয়।
বিষয়টি বোঝানোর জন্য একটি সাহিত্যিক উপমা
প্রযুক্তিগত যুক্তিটিকে আরও সহজবোধ্য করতে, এই ফাইলিংয়ে একজন কিশোর লেখকের গল্প ব্যবহার করা হয়েছে যে তার শৈলী অধ্যয়নের জন্য আর্নেস্ট হেমিংওয়ের গল্পগুলো নকল করেছিল। DOJ বলছে যে আইন যদি সেই শেখার প্রক্রিয়াটিকে লঙ্ঘন হিসেবে গণ্য করত, তবে লেখক যখনই নতুন কোনো লেখা প্রকাশ করতেন তখনই তার বিরুদ্ধে মামলা করা যেত, যদিও তার কাজ ছিল মৌলিক। বিভাগটি সতর্ক করেছে যে AI-এর ক্ষেত্রে একই যুক্তি প্রয়োগ করলে তা "সেই সৃজনশীলতাকে পঙ্গু করে দেবে যা কপিরাইট আইন রক্ষার জন্য তৈরি করা হয়েছিল।"
AI ডেভেলপার এবং কন্টেন্ট ক্রিয়েটরদের জন্য ঝুঁকির বিষয়গুলো
- উদ্ভাবনের ঝুঁকি: প্রশিক্ষণে ব্যবহৃত প্রতিটি টেক্সটের জন্য লাইসেন্স প্রয়োজন হলে খরচ এত বেশি বেড়ে যেতে পারে যে অত্যাধুনিক মডেল তৈরি করা আর্থিকভাবে অসম্ভব হয়ে পড়বে।
- সৃজনশীল কাজের ধারা: মানুষ লেখকরা খসড়া তৈরি, সম্পাদনা এবং ব্রেইনস্টর্মিংয়ের জন্য ক্রমবর্ধমানভাবে LLM-এর ওপর নির্ভর করছেন। যদি প্রশিক্ষণ প্রক্রিয়াটি অবৈধ বলে গণ্য করা হয়, তবে সেই টুলগুলো অদৃশ্য হয়ে যেতে পারে, যা বিভিন্ন শিল্পে কন্টেন্ট তৈরির পদ্ধতিকে বদলে দেবে।
- বাজারের প্রভাব: সংবাদপত্র শিল্প যুক্তি দিচ্ছে যে, যে AI মডেলগুলো প্রশ্নের উত্তর দিতে পারে বা সংবাদধর্মী টেক্সট তৈরি করতে পারে, তা মূল রিপোর্টিংয়ের গুরুত্ব কমিয়ে দেয়, যা সম্ভাব্য বিজ্ঞাপন রাজস্ব এবং সাবস্ক্রিপশন উভয়কেই ক্ষতিগ্রস্ত করতে পারে।
কপিরাইট অফিসের পাল্টা যুক্তি
সাবেক রেজিস্ট্রার শিরা পার্লমটারের অধীনে রচিত ইউএস কপিরাইট অফিসের একটি সাম্প্রতিক রিপোর্ট 'ফেয়ার-ইউজ' (fair-use) বা ন্যায্য ব্যবহারের ঢালাও প্রতিরক্ষার বিরুদ্ধে মত দিয়েছে। অফিসটি তিনটি বিষয়ের ওপর আলোকপাত করেছে যা AI-কে মানুষের শেখার প্রক্রিয়া থেকে আলাদা করে: কপি করা উপাদানের বিশাল পরিমাণ, যে গতিতে এটি প্রক্রিয়া করা হয়, এবং এই যে ফলাফলস্বরূপ তৈরি মডেলগুলোকে বাণিজ্যিক পণ্য হিসেবে প্যাকেজ করে বিক্রি করা যেতে পারে যা সরাসরি মূল নির্মাতাদের সাথে প্রতিযোগিতা করে।
DOJ সেই পয়েন্টগুলোর খণ্ডন করে বলেছে যে, রিপোর্টটির কোনো বাধ্যতামূলক আইনি কর্তৃত্ব নেই এবং বিদ্যমান মামলা অনুযায়ী 'ফেয়ার-ইউজ'-এর ক্ষেত্রে ইতিমধ্যেই প্রতিটি তথ্যভিত্তিক বিশ্লেষণ প্রয়োজন। এটি সতর্ক করেছে যে "ব্যাপক দায়বদ্ধতা" আরোপ করা হলে তা কার্যত শিল্পটিকে এমন একটি লাইসেন্সিং ব্যবস্থার দিকে ঠেলে দেবে যা "উন্নত AI মডেলের বিকাশকে আইনি ও আর্থিকভাবে অসম্ভব করে তুলবে।"
পরবর্তীতে কী ঘটতে পারে
টাইমস মামলাটি পরিচালনা করা জেলা আদালতকে DOJ-এর 'ফেয়ার-ইউজ' অবস্থান এবং কপিরাইট অফিসের প্রাপ্ত তথ্যের মধ্যে ভারসাম্য বজায় রাখতে হবে। DOJ-এর পক্ষে রায় দিলে এটি একটি নজির স্থাপন করবে যে, মডেলের আউটপুট যদি 'যথেষ্ট সাদৃশ্য' থেকে মুক্ত থাকে, তবে স্পষ্ট অনুমতি ছাড়াই ট্রেনিং ডেটা সংগ্রহ করা যেতে পারে। সংবাদপত্রের পক্ষে সিদ্ধান্ত নিলে লাইসেন্সিং আলোচনার একটি ঢেউ শুরু হতে পারে, যা সম্ভাব্যভাবে AI গবেষণার অর্থনীতিকে নতুন রূপ দিতে পারে।
মূল কথা
DOJ-এর এই ফাইলিং AI প্রশিক্ষণ 'ফেয়ার-ইউজ' কি না, সেই প্রশ্নটিকে একটি উচ্চ-ঝুঁকিপূর্ণ আইনি লড়াইয়ে পরিণত করেছে। এর ফলাফল নির্ধারণ করবে যে ডেভেলপাররা কি বিদ্যমান টেক্সটের ওপর শক্তিশালী ল্যাঙ্গুয়েজ মডেল তৈরি করা চালিয়ে যেতে পারবেন, নাকি তাদের প্রতিটি উপাদানের জন্য ব্যয়বহুল লাইসেন্স সংগ্রহ করতে হবে। এই সিদ্ধান্ত প্রযুক্তি খাত, মিডিয়া শিল্প এবং বৃহত্তর সৃজনশীল অর্থনীতির ওপর ব্যাপক প্রভাব ফেলবে।
