ทำไมคดีนี้จึงต้องขึ้นสู่ศาล

ANI ได้ยื่นฟ้องหลังจากสังเกตเห็นว่าคำตอบของ ChatGPT ต่อคำถามเกี่ยวกับข่าวล่าสุดในอินเดีย มีความคล้ายคลึงกับบทความของตนเองที่ตีพิมพ์ในช่วงเดือนสิงหาคมและกันยายน 2024 สำนักข่าวอ้างว่าโมเดลภาษาขนาดใหญ่ (LLM) กำลังทำซ้ำข้อความที่มีลิขสิทธิ์ของตน ซึ่งหากข้อกล่าวหานี้ได้รับการรับรอง จะส่งผลให้ OpenAI ต้องระงับหรือจำกัดการใช้งานโมเดลของตนในอินเดียอย่างหนัก

OpenAI ตอบโต้ว่าโมเดลทั้งสองที่ถูกอ้างถึง ได้แก่ GPT-4 และ GPT-4o รุ่นใหม่กว่า ได้รับการฝึกฝนด้วยข้อมูลที่มีวันตัดยอด (cut-off dates) คือเดือนเมษายน 2022 และเมษายน 2024 บทความของ ANI ปรากฏขึ้นหลังจากวันดังกล่าว ดังนั้นจึงไม่น่าจะเป็นส่วนหนึ่งของชุดข้อมูลฝึกฝนดั้งเดิม ผู้พิพากษา Amit Bansal กล่าวว่าความคล้ายคลึงกันนี้น่าจะมาจาก Retrieval-Augmented Generation (RAG) ซึ่งเป็นการดึงเนื้อหาจากเว็บปัจจุบันมาใช้ในคำตอบแบบเรียลไทม์ ไม่ใช่การที่โมเดล "จดจำ" บทความเหล่านั้นได้

จุดเปลี่ยนทางกฎหมาย: การฝึกฝนในฐานะ "การวิจัย"

คดีนี้มีความสำคัญเนื่องจากศาลตีความข้อยกเว้นด้านลิขสิทธิ์ของอินเดียสำหรับ "การใช้งานส่วนตัวหรือเพื่อประโยชน์ส่วนบุคคล รวมถึงการวิจัย" อย่างกว้างขวาง ทั้งสองฝ่ายยอมรับว่า OpenAI ใช้เนื้อหาของ ANI ในช่วงระยะการฝึกฝนเริ่มต้น แต่ผู้พิพากษาถือว่าการใช้งานนั้นเป็นแบบ "transformative" (การสร้างสรรค์ใหม่) กล่าวคือ โมเดลสกัดออกมาเพียงไวยากรณ์ ไวยากรณ์เชิงโครงสร้าง (syntax) และรูปแบบทางสถิติ โดยไม่ได้แตะต้องเนื้อหาที่แสดงออกถึงความคิดสร้างสรรค์

ศาลได้กำหนดเงื่อนไขที่เข้มงวดไว้สองประการ:

  • สำเนาที่ใช้ในการฝึกฝนต้องมาจากแหล่งที่ถูกกฎหมาย ไม่ใช่จากคลังข้อมูลที่ละเมิดลิขสิทธิ์หรือระบบ Paywall ที่ผู้ใช้ไม่สามารถเข้าถึงได้
  • เนื้อหาต้องอยู่ภายในสภาพแวดล้อมของผู้พัฒนาเองเท่านั้น ไม่สามารถนำไปเผยแพร่หรือแจกจ่ายได้

จากการใช้การทดสอบความยุติธรรมแบบสามส่วน ผู้พิพากษาพบว่าการใช้งานของ OpenAI จำกัดอยู่เพียงแค่การฝึกฝน ไม่พบหลักฐานว่าโมเดลจดจำข้อความแบบคำต่อคำ และตั้งข้อสังเกตว่า ANI ไม่ได้รับความเสียหายทางเศรษฐกิจโดยตรง เนื่องจากทั้งสองบริษัทดำเนินธุรกิจในส่วนแบ่งตลาดที่แตกต่างกัน

ความเชื่อมโยงกับคำตัดสินต่างๆ ทั่วโลก

จุดยืนของอินเดียในขณะนี้สะท้อนถึงคดีหลายคดีในสหรัฐฯ ที่สนับสนุนมุมมองแบบ transformative ต่อผลลัพธ์ของ AI ในคดี Kadrey v. Meta ศาลตัดสินว่าข้อความที่สร้างขึ้นซึ่งไม่ได้คัดลอกถ้อยคำที่เหมือนกันทุกประการนั้นไม่ถือเป็นการละเมิด ในขณะที่คำตัดสินในคดี Google Books ที่มีมาอย่างยาวนาน ได้ยอมรับข้อยกเว้น "การค้นหาและแสดงผล" (search-and-display) ที่จำกัดสำหรับโครงการแปลงข้อมูลเป็นดิจิทัล ส่วนคดีอื่นๆ ในสหรัฐฯ เช่น คดี Raw Story ถูกยกฟ้องเนื่องจากขาดหลักฐานความเสียหายที่พิสูจน์ได้ แต่ข้อพิพาทของ Anthropic ก็เป็นสิ่งเตือนใจผู้พิพากษาว่าการใช้ข้อมูลที่ละเมิดลิขสิทธิ์ยังคงอาจนำไปสู่ความรับผิดทางกฎหมายได้

ในยุโรป ความเห็นมีความแตกต่างกันอย่างชัดเจน ศาลในมิวนิกตัดสินว่าการทำซ้ำเนื้อเพลงที่ฝังอยู่ในน้ำหนักของโมเดล (model weights) ถือเป็นการละเมิดลิขสิทธิ์ ในขณะที่ศาลในลอนดอนเพิ่งยกฟ้องคำร้องต่อ Stability AI ด้วยเหตุผลที่คล้ายคลึงกัน คำตัดสินของศาลสูงเดลีจึงเป็นการเพิ่มข้อมูลอีกด้านหนึ่งว่า หากการฝึกฝนจำกัดอยู่เพียงแหล่งข้อมูลที่ถูกกฎหมายและผลลัพธ์ไม่ใช่การคัดลอกแบบคำต่อคำ กิจกรรมดังกล่าวอาจเข้าข่ายข้อยกเว้นเพื่อการวิจัย

สิ่งที่นักพัฒนาควรจับตามอง

  • RAG เทียบกับการฝึกฝน (training) – การแยกแยะของศาลระหว่าง "การจดจำ" (การฝึกฝน) และการดึงข้อมูลแบบเรียลไทม์ (RAG) บ่งชี้ว่าข้อพิพาทในอนาคตจะมุ่งเน้นไปที่ว่าคำตอบมาจากฐานความรู้แบบคงที่หรือถูกดึงมาจากเว็บแบบสดๆ นักพัฒนาอาจจำเป็นต้องระบุเส้นแบ่งนี้ให้ชัดเจนยิ่งขึ้นในเอกสารประกอบผลิตภัณฑ์
  • ที่มาของแหล่งข้อมูล (Source provenance) – ข้อกำหนดเรื่อง "แหล่งข้อมูลที่ถูกกฎหมาย" อาจผลักดันให้บริษัทต่างๆ ต้องเข้มงวดกับกระบวนการคัดกรองข้อมูล (data-curation pipelines) มากขึ้น โดยใช้สัญญาหรือใบอนุญาตเพื่อพิสูจน์ว่าข้อความแต่ละส่วนนั้นถูกต้องตามกฎหมาย
  • การใช้งานภายในเท่านั้น – บริษัทที่มีแผนจะสร้างรายได้จากผลลัพธ์ของโมเดลต้องเก็บข้อมูลการฝึกฝนไว้เป็นความลับภายในอย่างเคร่งครัด การแบ่งปันชุดข้อมูลดิบ (raw corpora) กับพันธมิตรหรือสาธารณะอาจทำให้ข้อต่อสู้เรื่องการวิจัยอ่อนแอลง
  • การทดสอบความเสียหายทางเศรษฐกิจ – เนื่องจากศาลให้ความสำคัญกับการไม่มีความเสียหายทางการเงินโดยตรง ผู้ฟ้องจึงจำเป็นต้องแสดงให้เห็นถึงความสูญเสียที่เป็นรูปธรรม ไม่ใช่แค่ความรู้สึกว่าแบรนด์เสื่อมเสีย
  • การตอบสนองทางกฎหมาย – ผู้ออกกฎหมายของอินเดียกำลังเฝ้าติดตามการถกเถียงเรื่องลิขสิทธิ์ที่เกี่ยวข้องกับ AI การแก้ไขกฎหมายใดๆ ที่ทำให้ข้อยกเว้นเพื่อการวิจัยแคบลง อาจส่งผลย้อนหลังต่อโมเดลที่ถูกนำมาใช้งานแล้ว ซึ่งจะกระตุ้นให้เกิดการตรวจสอบการปฏิบัติตามกฎหมาย (compliance audits) เป็นวงกว้าง

ข้อโต้แย้งที่ยังคงตามหลอกหลอน AI

ข้อร้องเรียนของ ANI ได้เน้นย้ำถึงความกังวลที่แท้จริง: เมื่อ LLM มีความเชี่ยวชาญมากขึ้นในการเลียนแบบสำนวนเฉพาะตัว เส้นแบ่งระหว่างการใช้งานแบบ "transformative" และการ "คัดลอก" ก็อาจเลือนลางลง นักวิจารณ์โต้แย้งว่าแม้ RAG จะเป็นฟังก์ชันการค้นหาในทางเทคนิค แต่ก็ยังนำเสนอเนื้อหาที่มีลิขสิทธิ์โดยไม่ได้รับอนุญาต ซึ่งอาจเป็นการละเมิดสิทธิในการ "สื่อสารต่อสาธารณะ"

บรรทัดฐานที่มีผลกระทบต่อเนื่องไปทั่วโลก

การที่ศาลสูงเดลีจัดประเภทการฝึกฝนโมเดลให้เป็นกิจกรรมการวิจัยที่ได้รับอนุญาต เป็นการส่งสัญญาณว่าอินเดียจะไม่สั่งระงับการพัฒนาโมเดลภาษาขนาดใหญ่โดยอัตโนมัติด้วยเหตุผลด้านลิขสิทธิ์ ตราบใดที่ผู้พัฒนาเคารพความถูกต้องตามกฎหมายของแหล่งที่มาและดำเนินการฝึกฝนภายในองค์กรเท่านั้น การตีความเช่นนี้อาจช่วยกระตุ้นให้บริษัทต่างๆ ขยายการดำเนินงานในอินเดีย เนื่องจากทราบว่าอุปสรรคสำคัญทางกฎหมายได้รับการผ่อนปรนลงแล้ว

สำหรับหน่วยงานกำกับดูแลในที่อื่นๆ คำตัดสินนี้ถือเป็นต้นแบบ: คือการกำหนดข้อยกเว้นด้านการวิจัยให้มีขอบเขตที่จำกัดและมีหลักฐานชัดเจน กำหนดมาตรฐานการจัดหาแหล่งข้อมูลที่โปร่งใส และกำหนดให้มีการจัดการข้อมูลที่ใช้ฝึกฝนภายในองค์กรเท่านั้น ประเทศที่นำแนวทางที่คล้ายคลึงกันนี้ไปใช้ อาจช่วยสร้างความชัดเจนที่จำเป็นให้แก่ระบบนิเวศ AI ภายในประเทศ เพื่อดึงดูดการลงทุน

สรุปสาระสำคัญ: คำตัดสินของศาลสูงเดลีไม่ได้เป็นการให้สิทธิขาดในการดึงข้อมูลข้อความใดๆ มาใช้เพื่อการฝึกฝน AI แต่เป็นการวางบรรทัดฐานว่า ภายใต้กฎหมายอินเดีย การฝึกฝนที่มีระเบียบวินัยและปฏิบัติตามกฎหมายถือเป็นงานวิจัย การตีความดังกล่าวอาจกลายเป็นจุดอ้างอิงสำหรับศาลทั่วโลก ในขณะที่กำลังเผชิญกับคำถามที่ว่า การสอนให้เครื่องจักรเข้าใจภาษานั้นเป็นกิจกรรมทางวิชาการที่ได้รับความคุ้มครอง หรือเป็นการละเมิดลิขสิทธิ์ที่รอวันเกิดขึ้นกันแน่