இந்த வழக்கு ஏன் நீதிமன்றத்திற்கு வந்தது

ஆகஸ்ட் மற்றும் செப்டம்பர் 2024-ல் வெளியிடப்பட்ட தனது சொந்தக் கட்டுரைகளை, சமீபத்திய இந்தியச் செய்திகள் குறித்த கேள்விகளுக்கு ChatGPT அளிக்கும் பதில்கள் ஒத்துப்போவதைக் கவனித்த பிறகு ANI வழக்குத் தொடர்ந்தது. இந்த லார்ஜ் லாங்குவேஜ் மாடல் (LLM) தனது பதிப்புரிமை பெற்ற உரையை மீண்டும் உருவாக்குவதாக அந்த நிறுவனம் வாதிட்டது; இந்த வாதம் ஏற்றுக்கொள்ளப்பட்டால், OpenAI தனது மாடல்களை இந்தியாவில் நிறுத்தி வைக்கவோ அல்லது கடுமையாகக் கட்டுப்படுத்தவோ வேண்டியிருக்கும்.

குறிப்பிடப்பட்ட இரண்டு மாடல்களான GPT-4 மற்றும் புதிய GPT-4o ஆகியவை ஏப்ரல் 2022 மற்றும் ஏப்ரல் 2024 ஆகிய காலக்கெடுவுள்ள தரவுகளைக் கொண்டு பயிற்சியளிக்கப்பட்டவை என்று OpenAI பதிலளித்தது. ANI-ன் கட்டுரைகள் அந்தத் தேதிகளுக்குப் பிறகு வந்தவை என்பதால், அவை அசல் பயிற்சித் தொகுப்பில் (training set) இருக்க வாய்ப்பில்லை. இந்த ஒற்றுமை பெரும்பாலும் Retrieval-Augmented Generation (RAG) மூலம் ஏற்பட்டிருக்கலாம் என்று நீதிபதி Amit Bansal கூறினார்; இது கட்டுரைகளை மாடல் "நினைவில்" வைத்திருப்பதன் மூலம் அல்லாமல், தற்போதைய இணைய உள்ளடக்கத்தை நிகழ்நேரத்தில் (real time) பதிலுக்குள் கொண்டு வருவதன் மூலம் நிகழ்கிறது.

சட்ட ரீதியான திருப்பம்: பயிற்சியை "ஆராய்ச்சி" எனக் கருதுதல்

"ஆராய்ச்சி உட்பட தனிப்பட்ட அல்லது சொந்தப் பயன்பாட்டிற்கான" இந்தியாவின் பதிப்புரிமை விதிவிலக்கை நீதிமன்றம் விரிவாகப் புரிந்துகொண்டதால் இந்த வழக்கு முக்கியத்துவம் பெறுகிறது. ஆரம்பக்கட்டப் பயிற்சியின் போது OpenAI, ANI-ன் தரவைப் பயன்படுத்தியதை இரு தரப்பினரும் ஒப்புக்கொண்டனர், ஆனால் நீதிபதி அந்தப் பயன்பாட்டை "மாற்றத்தக்கது" (transformative) என்று கருதினார். அதாவது, மாடல் இலக்கணம், தொடரியல் (syntax) மற்றும் புள்ளிவிவர முறைகளை மட்டுமே பிரித்தெடுத்தது, அதன் வெளிப்பாட்டுத் தன்மையுள்ள உள்ளடக்கத்தை (expressive content) மாற்றாமல் விட்டுவிட்டது.

நீதிமன்றம் இரண்டு கடுமையான நிபந்தனைகளை விதித்தது:

  • பயிற்சியில் பயன்படுத்தப்படும் நகல்கள் சட்டபூர்வமான ஆதாரங்களிலிருந்து வர வேண்டும்; திருடப்பட்ட ஆவணங்களிலிருந்தோ அல்லது பயனரால் அணுக முடியாத கட்டணத் தளங்களிலிருந்தோ (paywalls) வரக்கூடாது.
  • அந்தத் தரவு டெவலப்பரின் சொந்தச் சூழலுக்குள்ளேயே (environment) இருக்க வேண்டும்; அதை வெளியிடவோ அல்லது விநியோகிக்கவோ கூடாது.

மூன்று அம்சங்களைக் கொண்ட நியாயமான சோதனை முறையைப் (fairness test) பயன்படுத்திய நீதிபதி, OpenAI-ன் பயன்பாடு பயிற்சியுடன் மட்டுமே மட்டுப்படுத்தப்பட்டிருப்பதை கண்டறிந்தார்; மாடல் வார்த்தைக்கு வார்த்தை அப்படியே நினைவில் வைத்திருப்பதற்கான ஆதாரங்கள் ஏதும் இல்லை என்பதையும், இரு நிறுவனங்களும் வெவ்வேறு சந்தைப் பிரிவுகளில் செயல்படுவதால் ANI எந்த நேரடிப் பொருளாதார இழப்பையும் சந்திக்கவில்லை என்பதையும் சுட்டிக்காட்டினார்.

உலகளாவிய தீர்ப்புகளின் பின்னணியில் இது எவ்வாறு பொருந்துகிறது

AI வெளியீடுகளின் "மாற்றத்தக்க" பார்வையை ஆதரிக்கும் பல அமெரிக்க வழக்குகளை இந்தியாவின் நிலை இப்போது பிரதிபலிக்கிறது. Kadrey v. Meta வழக்கில், உருவாக்கப்பட்ட உரை துல்லியமான வார்த்தைகளை நகலெடுக்கவில்லை என்றால் அது பதிப்புரிமை மீறல் அல்ல என்று நீதிமன்றம் கூறியது; அதேபோல், நீண்டகாலமாக நடைமுறையில் உள்ள Google Books தீர்ப்பு, டிஜிட்டல் மயமாக்கல் திட்டங்களுக்கான வரையறுப்பட்ட "தேடல் மற்றும் காட்சிப்படுத்துதல்" (search-and-display) விதிவிலக்கை அங்கீகரித்தது. Raw Story வழக்கு போன்ற பிற அமெரிக்க வழக்குகள், நிரூபிக்கக்கூடிய பாதிப்பு இல்லாத காரணத்தால் தள்ளுபடி செய்யப்பட்டன, ஆனால் Anthropic சர்ச்சை, திருடப்பட்ட தரவைப் பயன்படுத்துவது இன்னும் சட்டப் பொறுப்பை (liability) ஏற்படுத்தக்கூடும் என்பதை நீதிபதிகளுக்கு நினைவூட்டியது.

ஐரோப்பா முழுவதும் கருத்துக்கள் மாறுபடுகின்றன. மாடல் எடைகளில் (model weights) பொதிந்துள்ள பாடல்களை மீண்டும் உருவாக்குவது பதிப்புரிமை மீறலாகும் என்று மியூனிக் நீதிமன்றங்கள் தீர்ப்பளித்துள்ளன, அதே நேரத்தில் லண்டன் தீர்ப்பாயம் சமீபத்தில் Stability AI க்கு எதிரான ஒரு கோரிக்கையை இதே போன்ற காரணங்களுக்காகத் தள்ளுபடி செய்தது. டெல்லி உயர் நீதிமன்றத்தின் தீர்ப்பு மற்றொரு முக்கியத் தரவைச் சேர்க்கிறது: பயிற்சி சட்டபூர்வமான ஆதாரங்களுக்குள் மட்டுப்படுத்தப்பட்டால் மற்றும் வெளியீடு வார்த்தைக்கு வார்த்தை நகலாக இல்லாவிட்டால், அந்தச் செயல் ஆராய்ச்சி விதிவிலக்கின் கீழ் வரலாம்.

டெவலப்பர்கள் கவனிக்க வேண்டியவை

  • RAG vs. training – "நினைவில் வைத்திருத்தல்" (பயிற்சி) மற்றும் நிகழ்நேரத் தேடல் (RAG) ஆகியவற்றிற்கு இடையிலான நீதிமன்றத்தின் வேறுபாடு, எதிர்காலத் தகராறுகள் ஒரு பதில் நிலையான அறிவுத் தளத்திலிருந்து (static knowledge base) வருகிறதா அல்லது இணையத்திலிருந்து நேரடியாகப் பெறப்படுகிறதா என்பதில் கவனம் செலுத்தும் என்பதைக் காட்டுகிறது. டெவலப்பர்கள் தங்கள் தயாரிப்பு ஆவணங்களில் (product documentation) அந்த வேறுபாட்டைத் தெளிவாகக் குறிப்பிட வேண்டியிருக்கலாம்.
  • Source provenance – "சட்டபூர்வமான ஆதாரங்கள்" என்றத் தேவை, ஒவ்வொரு உரைத் துண்டும் (text slice) முறையானது என்பதை நிரூபிக்கும் ஒப்பந்தங்கள் அல்லது உரிமங்களைப் பயன்படுத்தி, தரவுத் தொகுப்பு முறைகளை (data-curation pipelines) நிறுவனங்கள் வலுப்படுத்தத் தூண்டலாம்.
  • Internal-only use – மாடல் வெளியீடுகளை வணிகமயமாக்கத் திட்டமிடும் நிறுவனங்கள், பயிற்சித் தரவை முற்றிலும் உள்நாட்டிலேயே (internal) வைத்திருக்க வேண்டும். மூலத் தரவுகளை (raw corpora) கூட்டாளிகளுடனோ அல்லது பொதுமக்களுடனோ பகிர்வது ஆராய்ச்சிப் பாதுகாப்பைக் குறைக்கக்கூடும்.
  • Economic-harm test – நேரடி நிதி இழப்பு இல்லை என்பதை நீதிமன்றம் வலியுறுத்தியதால், புகார்தாரர்கள் வெறும் பிராண்ட் மதிப்பு குறைவதைக் காட்டாமல், உறுதியான இழப்பைக் காட்ட வேண்டியிருக்கும்.
  • Legislative response – இந்தியச் சட்டமன்ற உறுப்பினர்கள் AI தொடர்பான பதிப்புரிமை விவாதங்களைக் கண்காணித்து வருகின்றனர். ஆராய்ச்சி விதிவிலக்கைக் குறைக்கும் எந்தவொரு திருத்தமும் ஏற்கனவே பயன்பாட்டில் உள்ள மாடல்களைப் பின்னோக்கிப் பாதிக்கலாம், இது இணக்கத் தணிக்கைகளின் (compliance audits) அலைக்கு வழிவகுக்கும்.

AI-ஐத் தொடர்ந்து அச்சுறுத்தும் எதிர்வாதம்

ANI-ன் புகார் ஒரு உண்மையான கவலையைச் சுட்டிக்காட்டியது: LLM-கள் குறிப்பிட்ட சொற்றொடர்களைப் பிரதிபலிப்பதில் அதிகத் திறமை பெறும் போது, "மாற்றத்தக்க" பயன்பாட்டிற்கும் "நகல்" எடுப்பதற்கும் இடையிலான எல்லை மங்கலாகலாம். RAG என்பது தொழில்நுட்ப ரீதியாக ஒரு தேடல் செயல்பாடாக இருந்தாலும், அது அனுமதியின்றி பதிப்புரிமை பெற்ற உள்ளடக்கத்தை வெளிப்படுத்துகிறது என்றும், இது "பொதுமக்களுக்குத் தகவல் தெரிவிக்கும்" (communication to the public) உரிமையை மீறக்கூடும் என்றும் விமர்சகர்கள் வாதிடுகின்றனர்.

உலகளாவிய தாக்கங்களை ஏற்படுத்தக்கூடிய ஒரு முன்னுதாரணம்

மாதிரிப் பயிற்சியை (model training) ஒரு அனுமதிக்கப்பட்ட ஆராய்ச்சிச் செயல்பாடாக வகைப்படுத்துவதன் மூலம், டெலியில் உயர் நீதிமன்றம் ஒரு முக்கிய செய்தியைத் தெரிவித்துள்ளது: மேம்பாட்டாளர்கள் மூலங்களின் சட்டபூர்வத்தன்மையைக் கடைப்பிடித்து, பயிற்சியை உள்முறைப்படியே வைத்திருக்கும் பட்சத்தில், பதிப்புரிமை அடிப்படையில் இந்தியாவில் பெரிய மொழி மாதிரிகளின் (large language models) வளர்ச்சியைத் தானாகவே தடுக்காது. ஒரு முக்கிய சட்டத் தடை தளர்ந்துவிட்டதை அறிந்த நிறுவனங்கள், இந்தியாவில் தங்களது செயல்பாடுகளை விரிவாக்க இது ஊக்கமளிக்கலாம்.

மற்ற இடங்களிலுள்ள ஒழுங்குமுறை அமைப்புகளுக்கு, இந்தத் தீர்ப்பு ஒரு முன்மாதிரியை வழங்குகிறது: குறுகிய மற்றும் நன்கு ஆவணப்படுத்தப்பட்ட ஒரு ஆராய்ச்சி விதிவிலக்கை வரையறுத்தல், தெளிவான மூலத் தரத் தரநிலைகளை விதித்தல் மற்றும் பயிற்சித் தரவுகளை உள்முறையிலேயே கையாளுவதை உறுதி செய்தல். இதே போன்ற நடைமுறைகளைத் தழுவிக்கொள்ளும் நாடுகள், தங்கள் உள்நாட்டு AI சுற்றுச்சூழல் அமைப்புகளுக்கு முதலீடுகளை ஈர்க்கத் தேவையான உறுதியை வழங்க முடியும்.

முக்கிய அம்சம்: டெலியில் உயர் நீதிமன்றத்தின் இந்தத் தீர்ப்பு, AI பயிற்சிக்காக எந்தவொரு உரையையும் (text) சேகரிக்க முழு சுதந்திரத்தை வழங்கவில்லை; ஆனால், இந்தியச் சட்டத்தின் கீழ், முறைப்படியான மற்றும் சட்டத்திற்கு உட்பட்ட பயிற்சி என்பது ஒரு ஆராய்ச்சிச் செயல்பாடாகக் கருதப்படும் என்பதை இது உறுதிப்படுத்துகிறது. இயந்திரங்களுக்கு மொழியைப் புரிந்துகொள்ளக் கற்பிப்பது என்பது பாதுகாக்கப்பட்ட ஒரு கல்விசார் செயல்பாடா அல்லது அது ஒரு பதிப்புரிமை மீறலா என்ற சிக்கலை உலகெங்கிலும் உள்ள நீதிமன்றங்கள் எதிர்கொள்ளும் போது, இந்த விளக்கம் ஒரு முக்கியக் குறிப்புப் புள்ளியாக அமையக்கூடும்.