Jabatan Kehakiman AS telah mengeluarkan campur tangan undang-undang yang signifikan dalam perang hak cipta yang sedang berlarutan antara gergasi media dan pembangun AI. Dengan berhujah bahawa melatih Model Bahasa Besar (LLM) menggunakan data berhak cipta merupakan "penggunaan adil", DOJ telah menyediakan perisai undang-undang yang besar bagi syarikat seperti OpenAI dan Microsoft.

Hujah DOJ: Latihan vs. Output

Di tengah-tengah saman gabungan yang melibatkan The New York Times adalah perbezaan asas antara cara AI belajar dan apa yang dihasilkannya. The New York Times mendakwa bahawa berjuta-juta artikelnya telah digunakan tanpa kebenaran untuk melatih model seperti GPT-4, menyebabkan kerugian berbilion dolar dan menghasilkan produk yang bersaing secara langsung dengan akhbar tersebut.

Walau bagaimanapun, pemfailan terbaru DOJ berhujah bahawa pelanggaran hak cipta berlaku pada peringkat output, bukan pada peringkat pengambilan data. Jabatan tersebut menegaskan bahawa walaupun keseluruhan karya disalin semasa fasa latihan, salinan ini tidak pernah tersedia untuk orang awam. Tambahan pula, DOJ menyatakan bahawa output model seperti GPT-4 "sering kali, jika tidak sentiasa, tidak mempunyai persamaan ketara" dengan bahan sumber asal. Dengan memisahkan proses latihan daripada kandungan yang dihasilkan, DOJ cuba memutuskan kaitan antara tindakan pembelajaran mesin dengan konsep undang-undang penggantian pasaran.

"Analogi Hemingway" dan Kreativiti Manusia

Untuk menjadikan konsep pembelajaran mesin lebih mudah difahami, DOJ menggunakan analogi sastera yang melibatkan penulis Joan Didion. Pemfailan tersebut menyatakan bahawa semasa remaja, Didion akan menyalin cerita Ernest Hemingway untuk menganalisis struktur ayatnya dan mempelajari kemahirannya. DOJ berhujah bahawa jika undang-undang menganggap latihan mesin sebagai pelanggaran, seorang penulis seperti Didion secara teorinya boleh menghadapi liabiliti setiap kali dia menerbitkan karya baharu, kerana proses pembelajarannya akan terikat secara tidak dapat dipisahkan dengan penulisan seterusnya.

Jabatan tersebut seterusnya berhujah bahawa mengenakan liabiliti ketat untuk latihan AI secara paradoks akan menyekat kreativiti yang sepatutnya dilindungi oleh undang-undang hak cipta. Memandangkan manusia semakin banyak menggunakan LLM untuk merangka dan menyunting karya asli, DOJ mencadangkan bahawa menjadikan latihan tidak dibenarkan tanpa skim pelesenan yang besar akan melumpuhkan inovasi dipacu AI.

Mencabar Pejabat Hak Cipta AS

Pendirian DOJ bercanggah secara langsung dengan penemuan terbaru daripada Pejabat Hak Cipta AS. Bekas Pendaftar Shira Perlmutter sebelum ini telah berhujah menentang pembelaan "penggunaan adil" secara menyeluruh, dengan menyatakan bahawa AI beroperasi pada skala dan kelajuan yang jauh melampaui keupayaan manusia dan sering menghasilkan produk komersial yang bersaing secara langsung dengan pencipta kandungan asal.

DOJ telah mengambil langkah ofensif terhadap penilaian ini, dengan menyatakan bahawa laporan Perlmutter tidak mempunyai autoriti undang-undang yang mengikat dan gagal mengambil kira undang-undang kes yang telah ditetapkan mengenai analisis kes demi kes. Jabatan tersebut memberi amaran bahawa mengenakan liabiliti yang luas secara berkesan akan mewajibkan rejim pelesenan yang akan menjadikan pembangunan model AI canggih mustahil dari segi undang-undang dan kewangan.

Ringkasan Utama

  • Pemisahan Latihan dan Output: DOJ berhujah bahawa menyalin teks untuk latihan tidak membentuk pelanggaran jika output model yang dihasilkan tidak menunjukkan "persamaan ketara" dengan karya asal.
  • Perlindungan Inovasi: Jabatan tersebut memberi amaran bahawa mewajibkan lesen untuk semua data latihan akan menyekat kreativiti dan menghalang pembangunan LLM yang membantu dalam penciptaan kandungan manusia.
  • Penanda Aras Undang-undang: Campur tangan ini mewujudkan konflik berisiko tinggi antara DOJ dan Pejabat Hak Cipta AS, menyediakan pentas untuk keputusan mahkamah yang muktamad mengenai masa depan AI generatif.

ARTIKEL: Jabatan Kehakiman AS telah memfailkan ringkasan amicus dalam saman hak cipta New York Times, dengan berhujah bahawa menyalin teks yang dilindungi untuk melatih model bahasa besar (LLM) layak sebagai penggunaan adil. Pemfailan tersebut memberi syarikat seperti OpenAI dan Microsoft perisai undang-undang yang boleh menjauhkan mereka daripada jumlah ganti rugi yang dianggarkan oleh akhbar tersebut mencecah berbilion dolar.

Mengapa kes ini penting sekarang

Saman tersebut menggabungkan beberapa tuntutan bahawa pembangun AI memasukkan berjuta-juta artikel akhbar ke dalam model mereka tanpa kebenaran, kemudian mengeluarkan produk yang bersaing secara langsung dengan laporan Times sendiri. Jika mahkamah menolak hujah penggunaan adil DOJ, firma AI boleh menghadapi bil pelesenan yang besar atau terpaksa menghentikan pembangunan ejen perbualan generasi seterusnya.

Hujah teras DOJ

Ringkasan tersebut membahagikan aliran kerja AI kepada dua peringkat yang berbeza. Pertama, model tersebut menyerap korpus teks yang besar; kedua, ia menjana respons kepada arahan pengguna. Jabatan tersebut menyatakan bahawa pelanggaran hak cipta hanya berlaku apabila karya berhak cipta dihasilkan semula dalam cara yang boleh diakses oleh orang awam. Oleh kerana salinan latihan tidak pernah meninggalkan pelayan pembangun, tindakan penyerapan tersebut tidak memenuhi ambang tersebut.

DOJ juga bersandarkan pada ujian "persamaan ketara" (substantial similarity), satu piawaian hak cipta yang telah lama wujud. Ia berhujah bahawa teks yang dihasilkan oleh model seperti GPT-4 "sering kali, jika tidak sentiasa" berbeza secukupnya daripada mana-mana sumber tunggal sehingga plaintif tidak dapat membuktikan persamaan yang diperlukan. Ringkasnya, ringkasan tersebut berhujah bahawa fokus undang-undang haruslah pada output akhir, bukannya pada proses pembelajaran dalaman.

Analogi sastera untuk menjelaskan perkara tersebut

Untuk menjadikan hujah teknikal tersebut lebih mudah difahami, pemfailan itu memetik sebuah cerita tentang seorang penulis remaja yang meniru cerita Ernest Hemingway untuk mempelajari gayanya. DOJ menyatakan bahawa jika undang-undang menganggap latihan pembelajaran itu sebagai pelanggaran, penulis tersebut boleh disaman setiap kali dia menerbitkan karya baharu, walaupun karyanya adalah asli. Jabatan itu memberi amaran bahawa meluaskan logik yang sama kepada AI akan "melumpuhkan kreativiti yang sepatutnya dilindungi oleh undang-undang hak cipta."

Pertaruhan bagi pembangun AI dan pencipta kandungan

  • Risiko inovasi: Mewajibkan lesen bagi setiap teks yang digunakan dalam latihan boleh meningkatkan kos dengan begitu tinggi sehingga pembinaan model tercanggih menjadi tidak mampan dari segi kewangan.
  • Aliran kerja kreatif: Penulis manusia semakin bergantung kepada LLM untuk merangka, menyunting, dan sumbang saran. Jika proses latihan dianggap menyalahi undang-undang, alatan tersebut boleh lenyap, sekali gus mengubah cara kandungan dihasilkan merentasi pelbagai industri.
  • Impak pasaran: Industri akhbar berhujah bahawa model AI yang boleh menjawab soalan atau menjana teks seperti berita menghakis nilai pelaporan asli, yang berpotensi menyedut hasil pengiklanan dan langganan.

Hujah balas Pejabat Hak Cipta

Laporan terbaharu daripada Pejabat Hak Cipta AS, yang ditulis di bawah pendaftar terdahulu Shira Perlmutter, menolak pembelaan penggunaan adil (fair-use) secara menyeluruh. Pejabat tersebut mengetengahkan tiga faktor yang membezakan AI daripada pembelajaran manusia: jumlah bahan yang disalin yang sangat besar, kepantasan ia diproses, dan hakikat bahawa model yang terhasil boleh dibungkus dan dijual sebagai produk komersial yang bersaing secara langsung dengan pencipta sumber.

DOJ menyangkal perkara tersebut, dengan menyatakan bahawa laporan itu tidak mempunyai kuasa undang-undang yang mengikat dan undang-undang sedia ada sudah pun memerlukan analisis fakta demi fakta bagi penggunaan adil. Ia memberi amaran bahawa mengenakan "liabiliti luas" secara berkesan akan memaksa industri ke dalam rejim pelesenan yang "akan menjadikan pembangunan model AI canggih mustahil dari segi undang-undang dan kewangan."

Apa yang mungkin berlaku seterusnya

Mahkamah daerah yang mengendalikan kes Times perlu menimbang kedudukan penggunaan adil DOJ berbanding penemuan Pejabat Hak Cipta. Keputusan yang memihak kepada DOJ akan menetapkan preseden bahawa data latihan boleh dituai tanpa kebenaran nyata, asalkan output model tersebut tidak mempunyai persamaan ketara. Keputusan yang menyebelahi pihak akhbar boleh mencetuskan gelombang rundingan pelesenan, yang berpotensi membentuk semula ekonomi penyelidikan AI.

Kesimpulan

Pemfailan DOJ menukarkan persoalan sama ada latihan AI adalah penggunaan adil kepada pertempuran mahkamah yang berisiko tinggi. Keputusannya akan menentukan sama ada pembangun boleh terus membina model bahasa yang berkuasa berdasarkan teks sedia ada atau mesti mendapatkan lesen yang mahal bagi setiap bahan yang mereka serap. Keputusan tersebut akan memberi kesan berantai kepada sektor teknologi, industri media, dan ekonomi kreatif yang lebih luas.