ഈ കേസ് കോടതിയിൽ എത്തിയത് എന്തുകൊണ്ട്
2024 ഓഗസ്റ്റിലും സെപ്റ്റംബറിലും പ്രസിദ്ധീകരിച്ച തങ്ങളുടെ ലേഖനങ്ങളോട് സാമ്യമുള്ള ഉത്തരങ്ങളാണ് സമീപകാല ഇന്ത്യൻ വാർത്തകളെക്കുറിച്ചുള്ള ചോദ്യങ്ങൾക്ക് ChatGPT നൽകുന്നതെന്ന് ശ്രദ്ധയിൽപ്പെട്ടതിനെത്തുടർന്ന് ANI കോടതിയെ സമീപിച്ചു. ലാർജ് ലാംഗ്വേജ് മോഡൽ (LLM) തങ്ങളുടെ പകർപ്പവകാശമുള്ള (copyrighted) ടെക്സ്റ്റുകൾ പുനർനിർമ്മിക്കുകയാണെന്ന് ഏജൻസി വാദിച്ചു. ഈ വാദം ശരിയാണെന്ന് തെളിയിക്കപ്പെട്ടാൽ, ഇന്ത്യയിൽ തങ്ങളുടെ മോഡലുകൾ നിർത്തലാക്കാനോ അല്ലെങ്കിൽ കടുത്ത നിയന്ത്രണങ്ങൾ ഏർപ്പെടുത്താനോ OpenAI-ക്ക് നിർബന്ധിതമാകും.
പരാമർശിക്കപ്പെട്ട രണ്ട് മോഡലുകളായ GPT-4, പുതിയ GPT-4o എന്നിവ ഏപ്രിൽ 2022, ഏപ്രിൽ 2024 എന്നീ തീയതികളിൽ അവസാനിക്കുന്ന ഡാറ്റ ഉപയോഗിച്ചാണ് പരിശീലിപ്പിക്കപ്പെട്ടതെന്ന് OpenAI മറുപടി നൽകി. ANI-യുടെ ലേഖനങ്ങൾ ഈ തീയതികൾക്ക് ശേഷമാണ് വന്നത്, അതിനാൽ അവ യഥാർത്ഥ ട്രെയിനിംഗ് സെറ്റിൽ ഉൾപ്പെട്ടിരിക്കാൻ കഴിയില്ല. ഈ സാമ്യം ഉണ്ടാകാൻ കാരണം മോഡൽ ലേഖനങ്ങൾ "ഓർത്തെടുക്കുന്നത്" അല്ലെന്നും, മറിച്ച് നിലവിലെ വെബ് ഉള്ളടക്കം തത്സമയം ഉത്തരങ്ങളിൽ ഉൾപ്പെടുത്തുന്ന Retrieval-Augmented Generation (RAG) സാങ്കേതികവിദ്യയാണെന്നും ജഡ്ജി അമിത് ബൻസാൽ പറഞ്ഞു.
നിയമപരമായ വഴിത്തിരിവ്: പരിശീലനം ഒരു "ഗവേഷണം" എന്ന നിലയിൽ
"ഗവേഷണം ഉൾപ്പെടെയുള്ള സ്വകാര്യ അല്ലെങ്കിൽ വ്യക്തിഗത ഉപയോഗത്തിനായുള്ള" ഇന്ത്യയുടെ പകർപ്പവകാശ ഇളവുകളെ കോടതി വിശാലമായി വ്യാഖ്യാനിച്ചതിനാൽ ഈ കേസ് വളരെ പ്രധാനപ്പെട്ടതാണ്. പ്രാരംഭ പരിശീലന ഘട്ടത്തിൽ OpenAI, ANI-യുടെ മെറ്റീരിയലുകൾ ഉപയോഗിച്ചിരുന്നുവെന്ന് ഇരുപക്ഷവും സമ്മതിച്ചുവെങ്കിലും, ആ ഉപയോഗത്തെ ജഡ്ജി "പരിവർത്തനപരമായത്" (transformative) ആയി കണക്കാക്കി. മറ്റൊരു വിധത്തിൽ പറഞ്ഞാൽ, മോഡൽ വ്യാകരണം (grammar), സിന്റാക്സ് (syntax), സ്റ്റാറ്റിസ്റ്റിക്കൽ പാറ്റേണുകൾ എന്നിവ മാത്രമാണ് വേർതിരിച്ചെടുത്തത്; ഉള്ളടക്കത്തിന്റെ ആവിഷ്കാരപരമായ വശങ്ങളെ അത് ബാധിച്ചില്ല.
കോടതി രണ്ട് കർശനമായ നിബന്ധനകൾ വെച്ചു:
- പരിശീലനത്തിനായി ഉപയോഗിക്കുന്ന കോപ്പികൾ നിയമപരമായ സ്രോതസ്സുകളിൽ നിന്ന് ലഭിച്ചതാകണം; പൈറേറ്റഡ് ആർക്കൈവുകളിൽ നിന്നോ ഉപയോക്താവിന് പ്രവേശനമില്ലാത്ത പേവാളുകളിൽ (paywalls) നിന്നോ ആകരുത്.
- മെറ്റീരിയലുകൾ ഡെവലപ്പറുടെ സ്വന്തം എൻവയോൺമെന്റിനുള്ളിൽ തന്നെയായിരിക്കണം; അവ പ്രസിദ്ധീകരിക്കാനോ വിതരണം ചെയ്യാനോ പാടില്ല.
മൂന്ന് ഘട്ടങ്ങളുള്ള ഫെയർനസ് ടെസ്റ്റ് (fairness test) പ്രയോഗിച്ചുകൊണ്ട്, OpenAI-യുടെ ഉപയോഗം പരിശീലനത്തിൽ മാത്രം പരിമിതമാണെന്നും, മോഡൽ വാചകങ്ങൾ അതേപടി മനഃപാഠമാക്കിയതിന് തെളിവുകളില്ലെന്നും ജഡ്ജി കണ്ടെത്തി. കൂടാതെ, രണ്ട് കമ്പനികളും വ്യത്യസ്ത വിപണി മേഖലകളിൽ പ്രവർത്തിക്കുന്നതിനാൽ ANI-ക്ക് നേരിട്ട് സാമ്പത്തിക നഷ്ടം സംഭവിച്ചിട്ടില്ലെന്നും അദ്ദേഹം നിരീക്ഷിച്ചു.
ആഗോള വിധിന്യായങ്ങളുടെ പശ്ചാത്തലത്തിൽ ഇതിന്റെ സ്ഥാനം
AI ഔട്ട്പുട്ടുകളെ പരിവർത്തനപരമായ കാഴ്ചപ്പാടിലൂടെ കാണുന്ന അമേരിക്കയിലെ പല കേസുകളുടെയും അതേ നിലപാടാണ് ഇപ്പോൾ ഇന്ത്യയും സ്വീകരിക്കുന്നത്. Kadrey v. Meta കേസിൽ, കൃത്യമായ പദപ്രയോഗങ്ങൾ പകർത്തിയിട്ടില്ലാത്ത ജനറേറ്റഡ് ടെക്സ്റ്റുകൾ പകർപ്പവകാശ ലംഘനമല്ലെന്ന് കോടതി വിധിച്ചു. അതുപോലെ, ദീർഘകാലമായി നിലനിൽക്കുന്ന Google Books വിധി ഡിജിറ്റൈസേഷൻ പ്രോജക്റ്റുകൾക്കായി പരിമിതമായ ഒരു "സെർച്ച്-ആൻഡ്-ഡിസ്പ്ലേ" (search-and-display) ഇളവ് അംഗീകരിച്ചിട്ടുണ്ട്. Raw Story പോലുള്ള മറ്റ് യുഎസ് കേസുകൾ തെളിയിക്കപ്പെട്ട ദോഷഫലങ്ങളുടെ അഭാവത്തിൽ തള്ളിക്കളഞ്ഞെങ്കിലും, പൈറേറ്റഡ് ഡാറ്റ ഉപയോഗിക്കുന്നത് നിയമപരമായ ഉത്തരവാദിത്തത്തിലേക്ക് നയിച്ചേക്കാം എന്ന് Anthropic വിവാദം ജഡ്ജിമാരെ ഓർമ്മിപ്പിച്ചു.
യൂറോപ്പിലുടനീളം അഭിപ്രായങ്ങൾ വ്യത്യസ്തമാണ്. മോഡൽ വെയ്റ്റുകളിൽ (model weights) ഉൾപ്പെടുത്തിയിരിക്കുന്ന വരികൾ പുനർനിർമ്മിക്കുന്നത് പകർപ്പവകാശ ലംഘനമാണെന്ന് മ്യൂണിക്കിലെ കോടതികൾ വിധിച്ചിട്ടുണ്ട്, എന്നാൽ ലണ്ടനിലെ ഒരു ട്രൈബ്യൂണൽ അടുത്തിടെ സമാനമായ കാരണത്താൽ Stability AI-ക്കെതിരെയുള്ള അവകാശവാദം തള്ളിക്കളഞ്ഞു. ഡൽഹി ഹൈക്കോടതിയുടെ വിധി മറ്റൊരു കാര്യം കൂടി വ്യക്തമാക്കുന്നു: പരിശീലനം നിയമപരമായ സ്രോതസ്സുകളിൽ മാത്രമായി പരിമിതപ്പെടുത്തുകയും ഔട്ട്പുട്ട് അതേപടി പകർത്തിയതാകരുത് എന്നും വന്നാൽ, ആ പ്രവർത്തനം ഗവേഷണ ഇളവിന്റെ പരിധിയിൽ വരാം.
ഡെവലപ്പർമാർ ശ്രദ്ധിക്കേണ്ട കാര്യങ്ങൾ
- RAG vs. training – "മനഃപാഠമാക്കൽ" (പരിശീലനം), തത്സമയ വിവരശേഖരണം (RAG) എന്നിവ തമ്മിലുള്ള കോടതിയുടെ വേർതിരിവ് സൂചിപ്പിക്കുന്നത്, ഭാവിയിലെ തർക്കങ്ങൾ ഒരു ഉത്തരം ഒരു സ്റ്റാറ്റിക് നോളജ് ബേസിൽ നിന്നാണോ അതോ വെബിൽ നിന്ന് തത്സമയം എടുക്കുന്നതാണോ എന്നതിനെ അടിസ്ഥാനമാക്കിയായിരിക്കും എന്നാണ്. ഡെവലപ്പർമാർ തങ്ങളുടെ ഉൽപ്പന്നത്തിന്റെ ഡോക്യുമെന്റേഷനിൽ ഈ വ്യത്യാസം കൂടുതൽ വ്യക്തമാക്കേണ്ടി വന്നേക്കാം.
- Source provenance – "നിയമപരമായ സ്രോതസ്സുകൾ" എന്ന നിബന്ധന, ഓരോ ടെക്സ്റ്റും നിയമപരമാണെന്ന് തെളിയിക്കുന്ന കരാറുകളോ ലൈസൻസുകളോ ഉപയോഗിച്ച് ഡാറ്റാ ക്യൂറേഷൻ പൈപ്പ്ലൈനുകൾ കർശനമാക്കാൻ കമ്പനികളെ പ്രേരിപ്പിച്ചേക്കാം.
- Internal-only use – മോഡൽ ഔട്ട്പുട്ടുകൾ വാണിജ്യവൽക്കരിക്കാൻ പദ്ധതിയിടുന്ന കമ്പനികൾ പരിശീലന ഡാറ്റ കർശനമായി ആന്തരികമായി (internal) സൂക്ഷിക്കണം. റോ കോർപ്പസുകൾ (raw corpora) പങ്കാളികളുമായോ പൊതുജനങ്ങളുമായോ പങ്കുവെക്കുന്നത് ഗവേഷണ സംരക്ഷണത്തെ (research defense) ബാധിച്ചേക്കാം.
- Economic-harm test – നേരിട്ടുള്ള സാമ്പത്തിക നഷ്ടമില്ലെന്ന് കോടതി ഊന്നിപ്പറഞ്ഞതിനാൽ, പരാതിക്കാർക്ക് ബ്രാൻഡ് മൂല്യം കുറയുന്നു എന്നതുകൊണ്ട് മാത്രം പോരാ, മറിച്ച് കൃത്യമായ സാമ്പത്തിക നഷ്ടം ഉണ്ടായെന്ന് തെളിയിക്കേണ്ടതുണ്ട്.
- Legislative response – ഇന്ത്യൻ നിയമനിർമ്മാതാക്കൾ AI സംബന്ധമായ പകർപ്പവകാശ ചർച്ചകൾ നിരീക്ഷിച്ചുവരുന്നു. ഗവേഷണ ഇളവ് പരിമിതപ്പെടുത്തുന്ന ഏതെങ്കിലും ഭേദഗതി നിലവിൽ വന്നാൽ, അത് നിലവിൽ ഉപയോഗിച്ചുകൊണ്ടിരിക്കുന്ന മോഡലുകളെയും ബാധിച്ചേക്കാം, ഇത് വലിയ തോതിലുള്ള കംപ്ലയൻസ് ഓഡിറ്റുകൾക്ക് കാരണമായേക്കാം.
AI-യെ ഇപ്പോഴും വേട്ടയാടുന്ന എതിർവാദങ്ങൾ
ANI-യുടെ പരാതി ഒരു യഥാർത്ഥ ആശങ്ക ഉയർത്തുന്നു: LLM-കൾ പ്രത്യേക പദപ്രയോഗങ്ങൾ അനുകരിക്കുന്നതിൽ കൂടുതൽ വൈദഗ്ധ്യം നേടുമ്പോൾ, "പരിവർത്തനപരമായ" ഉപയോഗവും "പകർപ്പും" തമ്മിലുള്ള വ്യത്യാസം അവ്യക്തമായേക്കാം. RAG സാങ്കേതികമായി ഒരു സെർച്ച് ഫംഗ്ഷൻ ആണെങ്കിലും, അനുമതിയില്ലാതെ പകർപ്പവകാശമുള്ള ഉള്ളടക്കം പുറത്തുകൊണ്ടുവരുന്നത് "പൊതുജനങ്ങളിലേക്കുള്ള ആശയവിനിമയ" (communication to the public) അവകാശത്തിന്റെ ലംഘനമാകാൻ സാധ്യതയുണ്ടെന്ന് വിമർശകർ വാദിക്കുന്നു.
ആഗോളതലത്തിൽ പ്രത്യാഘാതങ്ങൾ ഉണ്ടാക്കുന്ന ഒരു കീഴ്വഴക്കം
മോഡൽ പരിശീലനത്തെ അനുവദനീയമായ ഒരു ഗവേഷണ പ്രവർത്തനമായി തരംതിരിച്ചുകൊണ്ട്, ഡൽഹി ഹൈക്കോടതി ഒരു സൂചന നൽകി: ഡെവലപ്പർമാർ സ്രോതസ്സിന്റെ നിയമസാധുത മാനിക്കുകയും പരിശീലനം സ്വന്തം പരിധിക്കുള്ളിൽ മാത്രം പരിമിതപ്പെടുത്തുകയും ചെയ്യുന്നുണ്ടെങ്കിൽ, പകർപ്പവകാശ കാരണങ്ങളാൽ ഇന്ത്യ ലാർജ് ലാംഗ്വേജ് മോഡലുകളുടെ വികസനം തടയില്ല. ഒരു പ്രധാന നിയമപരമായ തടസ്സം ലഘൂകരിക്കപ്പെട്ടുവെന്നറിഞ്ഞതോടെ, കമ്പനികൾ ഇന്ത്യയിലെ തങ്ങളുടെ പ്രവർത്തനങ്ങൾ വിപുലീകരിക്കാൻ ഇത് പ്രേരിപ്പിച്ചേക്കാം.
മറ്റ് രാജ്യങ്ങളിലെ റെഗുലേറ്റർമാർക്ക് ഈ വിധി ഒരു മാതൃകയാണ്: കൃത്യമായി രേഖപ്പെടുത്തിയതും പരിമിതവുമായ ഒരു ഗവേഷണ ഇളവ് നിർവചിക്കുക, വ്യക്തമായ സ്രോതസ്സ് മാനദണ്ഡങ്ങൾ ഏർപ്പെടുത്തുക, പരിശീലന ഡാറ്റ സ്വന്തം പരിധിക്കുള്ളിൽ മാത്രം കൈകാര്യം ചെയ്യണമെന്ന് നിബന്ധന വെക്കുക എന്നിവയാണ് ഇതിൽ ഉൾപ്പെടുന്നത്. സമാനമായ നിയമങ്ങൾ സ്വീകരിക്കുന്ന രാജ്യങ്ങൾക്ക് തങ്ങളുടെ ആഭ്യന്തര AI ഇക്കോസിസ്റ്റങ്ങൾക്ക് നിക്ഷേപം ആകർഷിക്കുന്നതിന് ആവശ്യമായ നിശ്ചിതത്വം നൽകാൻ സാധിക്കും.
ചുരുക്കത്തിൽ: ഡൽഹി ഹൈക്കോടതിയുടെ തീരുമാനം AI പരിശീലനത്തിനായി ഏത് ടെക്സ്റ്റും ശേഖരിക്കാൻ (scrape) അനിയന്ത്രിതമായ അനുമതി നൽകുന്നില്ല, മറിച്ച് ഇന്ത്യൻ നിയമപ്രകാരം അച്ചടക്കത്തോടും നിയമവിധേയമായും നടത്തുന്ന പരിശീലനം ഗവേഷണമായി കണക്കാക്കാമെന്ന് സ്ഥാപിക്കുന്നു. യന്ത്രങ്ങളെ ഭാഷ മനസ്സിലാക്കാൻ പഠിപ്പിക്കുന്നത് സംരക്ഷിക്കപ്പെട്ട ഒരു പാണ്ഡിത്യപരമായ പ്രവർത്തനമാണോ അതോ പകർപ്പവകാശ ലംഘനമാണോ എന്ന കാര്യത്തിൽ ലോകമെമ്പാടുമുള്ള കോടതികൾ പ്രതിസന്ധി നേരിടുമ്പോൾ, ഈ വ്യാഖ്യാനം ഒരു പ്രധാന സൂചികയായി മാറിയേക്കാം.
