Kwa nini kesi hii ilifikishwa mahakamani
ANI ilifungua kesi baada ya kugundua kuwa majibu ya ChatGPT kwa maswali kuhusu habari za hivi karibuni za India yalifanana na makala zake zenyewe zilizochapishwa mnamo Agosti na Septemba 2024. Shirika hilo lilidai kuwa modeli kubwa ya lugha ilikuwa ikirejelea maandishi yake yenye hakimiliki, dai ambalo, likithibitishwa, lingelazimisha OpenAI kusitisha au kuzuia vikali modeli zake nchini India.
OpenAI ilijibu kuwa modeli mbili zilizotajwa—GPT-4 na GPT-4o mpya—zilifundishwa kwa kutumia data zenye tarehe za mwisho za Aprili 2022 na Aprili 2024. Makala za ANI yalichapishwa baada ya tarehe hizo, hivyo hayawezi kuwa yalikuwa katika seti ya awali ya mafunzo. Jaji Amit Bansal alisema ulinganifu huo ulikuwa unatokana zaidi na Retrieval-Augmented Generation (RAG), ambayo huvuta maudhui ya sasa ya wavuti na kuyaweka kwenye jibu kwa wakati halisi, na si kutokana na modeli "kukumbuka" makala hizo.
Mabadiliko ya kisheria: mafunzo kama "utafiti"
Kesi hii ni muhimu kwa sababu mahakama ilitafsiri ubaguzi wa hakimiliki wa India kwa ajili ya "matumizi ya kibinafsi au ya mtu binafsi, ikiwa ni pamoja na utafiti" kwa upana. Pande zote mbili zilikubaliana kuwa OpenAI ilitumia nyenzo za ANI wakati wa hatua ya awali ya mafunzo, lakini jaji alichukulia matumizi hayo kama "mabadiliko ya kimaudhui" (transformative). Kwa maneno mengine, modeli hiyo ilichukua tu sarufi, muundo wa sentensi na mifumo ya kitakwimu, bila kugusa maudhui ya kielezo.
Mahakama iliweka masharti mawili makali:
- Nakala zinazotumiwa kwa mafunzo lazima zitoke kwenye vyanzo vya kisheria, si kwenye kumbukumbu za kinyonyaji au kuta za malipo (paywalls) ambazo mtumiaji hawezi kuzipata.
- Nyenzo lazima ibaki ndani ya mazingira ya msanidi programu mwenyewe; haiwezi kuchapishwa au kusambazwa.
Akitumia mtihani wa haki wa sehemu tatu, jaji aligundua kuwa matumizi ya OpenAI yalikuwa yamekomitwa kwenye mafunzo, hakukuwa na ushahidi kwamba modeli hiyo ilihifadhi vifungu vya maneno neno kwa neno, na alibainisha kuwa ANI haikupata hasara ya moja kwa moja ya kiuchumi kwa sababu kampuni hizo mbili zinafanya kazi katika sehemu tofauti za soko.
Jinsi hii inavyoingia katika mfululizo wa maamuzi ya kimataifa
Mtazamo wa India sasa unafanana na kesi kadhaa za Marekani zinazounga mkono mtazamo wa mabadiliko ya kimaudhui wa matokeo ya AI. Katika Kadrey v. Meta, mahakama iliamua kuwa maandishi yaliyozalishwa ambayo hayanakili maneno yale yale si ukiukaji, wakati uamuzi wa muda mrefu wa Google Books ulitambua ubaguzi mdogo wa "kutafuta na kuonyesha" kwa miradi ya kidijitali. Mashitaka mengine ya Marekani, kama vile kesi ya Raw Story, yalifutwa kwa kukosekana kwa madhara yanayoweza kuthibitishwa, lakini utata wa Anthropic uliwakumbusha majaji kuwa kutumia data za kinyonyaji bado kunaweza kusababisha dhima ya kisheria.
Kote Ulaya, maoni yanatofautiana sana. Mahakama za Munich zimeamua kuwa kurudia mashairi yaliyomo ndani ya uzito wa modeli (model weights) ni ukiukaji, wakati baraza la London hivi karibuni lilifuta dai dhidi ya Stability AI kwa sababu zinazofanana. Uamuzi wa Mahakama Kuu ya Delhi unaongeza hoja nyingine: ikiwa mafunzo yanabaki kwenye vyanzo vya kisheria na matokeo si nakala ya neno kwa neno, shughuli hiyo inaweza kuangukia chini ya ubaguzi wa utafiti.
Yale ambayo wasanidi programu wanapaswa kuzingatia
- RAG dhidi ya mafunzo – Tofauti iliyotolewa na mahakama kati ya "kukumbuka" (mafunzo) na upatikanaji wa wakati halisi (RAG) inaashiria kuwa migogoro ya baadaye itajikita katika ikiwa jibu linatoka kwenye msingi wa maarifa uliotulia au linatolewa mubashara kutoka kwenye wavuti. Wasanidi programu wanaweza kuhitaji kufanya mstari huo kuwa wazi zaidi katika nyaraka za bidhaa.
- Asili ya chanzo – Hitaji la "vyanzo vya kisheria" linaweza kuzifanya kampuni kuimarisha mifumo ya uchujaji wa data, kwa kutumia mikataba au leseni zinazothibitisha kuwa kila sehemu ya maandishi ni halali.
- Matumizi ya ndani pekee – Kampuni zinazopanga kuuza matokeo ya modeli lazima zihifadhi data za mafunzo ndani pekee. Kushiriki data ghafi (raw corpora) na washirika au umma kunaweza kudhoofisha utetezi wa utafiti.
- Mtihani wa madhara ya kiuchumi – Kwa sababu mahakama ilisisitiza kutokuwepo kwa madhara ya kifedha ya moja kwa moja, wadai watahitaji kuonyesha hasara halisi, si tu kudhoofika kwa chapa kunakohisiwa.
- Hatua za kisheria – Wabunifu wa sheria nchini India wanachunguza mijadala ya hakimiliki inayohusiana na AI. Marekebisho yoyote yanayopunguza ubaguzi wa utafiti yanaweza kuathiri modeli ambazo tayari zimeshatumika kwa nyuma, jambo ambalo litaleta wimbi la ukaguzi wa uzingatiaji sheria.
Hoja ya upande wa pili inayozidi kuleta wasiwasi kwa AI
Malalamiko ya ANI yaliangazia wasiwasi wa kweli: kadiri LLM zinavyozidi kuwa mahiri katika kurudia misemo maalum, mstari kati ya matumizi ya "mabadiliko ya kimaudhui" na "nakala" unaweza kufifia. Wakosoaji wanahoji kuwa RAG, ingawa kiufundi ni kazi ya utafutaji, bado huonyesha maudhui yenye hakimiliki bila ruhusa, jambo ambalo linaweza kukiuka haki ya "kuwasilisha kwa umma".
Sababu ya kisheria yenye athari za kimataifa
Kwa kuainisha mafunzo ya modeli kama shughuli ya utafiti inayokubalika, Mahakama Kuu ya Delhi ilionyesha kuwa India haitazuia moja kwa moja maendeleo ya modeli kubwa za lugha (large language models) kwa sababu za hakimiliki, mradi watengenezaji waheshimu uhalali wa vyanzo na wafanye mafunzo hayo ndani ya kampuni. Tafsiri hiyo inaweza kuhimiza makampuni kupanua shughuli zao nchini India, wakijua kuwa kikwazo muhimu cha kisheria kimepungua.
Kwa wadhibiti wengine popote, uamuzi huo unatoa mfano: ainisha ubaguzi mwembamba wa utafiti uliowekwa vizuri, weka viwango vya wazi vya upatikanaji wa vyanzo, na hitaji ushughulikiaji wa data za mafunzo ndani ya kampuni pekee. Mataifa yatakayotumia lugha kama hiyo yanaweza kuipa mifumo yao ya ndani ya AI uhakika unaohitajika ili kuvutia uwekezaji.
Hitimisho: Uamuzi wa Mahakama Kuu ya Delhi hautoa uhuru kamili wa kukusanya maandishi yoyote kwa ajili ya mafunzo ya AI, lakini unaweka wazi kuwa, chini ya sheria ya India, mafunzo yenye nidhamu na yanayozingatia sheria huhesabiwa kama utafiti. Tafsiri hiyo inaweza kuwa kituo cha marejeo kwa mahakama kote ulimwenguni wanaposhughulikia ikiwa kufundisha mashine kuelewa lugha ni shughuli ya kitaaluma iliyolindwa au ni ukiukaji unaosubiri kutokea.
