Bộ Tư pháp Hoa Kỳ đã đưa ra một sự can thiệp pháp lý quan trọng trong cuộc chiến bản quyền đang diễn ra giữa các gã khổng lồ truyền thông và các nhà phát triển AI. Bằng cách lập luận rằng việc huấn luyện các Mô hình Ngôn ngữ Lớn (LLM) trên dữ liệu có bản quyền cấu thành "sử dụng hợp lý" (fair use), Bộ Tư pháp đã cung cấp một lá chắn pháp lý khổng lồ cho các công ty như OpenAI và Microsoft.
Lập luận của Bộ Tư pháp: Huấn luyện so với Kết quả đầu ra
Trọng tâm của vụ kiện hợp nhất liên quan đến The New York Times là sự phân biệt cơ bản giữa cách một AI học và những gì nó tạo ra. The New York Times cáo buộc rằng hàng triệu bài báo của họ đã bị sử dụng mà không có sự cho phép để huấn luyện các mô hình như GPT-4, gây ra thiệt hại hàng tỷ đô la và tạo ra các sản phẩm cạnh tranh trực tiếp với tờ báo.
Tuy nhiên, hồ sơ gần đây của Bộ Tư pháp lập luận rằng hành vi vi phạm bản quyền xảy ra tại thời điểm đưa ra kết quả đầu ra (output), chứ không phải tại thời điểm nạp dữ liệu (ingestion). Bộ cho rằng mặc dù toàn bộ tác phẩm được sao chép trong giai đoạn huấn luyện, nhưng các bản sao này không bao giờ được công khai. Hơn nữa, Bộ Tư pháp khẳng định rằng kết quả đầu ra của các mô hình như GPT-4 "thường xuyên, nếu không muốn nói là luôn thiếu sự tương đồng đáng kể" với tài liệu nguồn gốc. Bằng cách tách biệt quá trình huấn luyện khỏi nội dung được tạo ra, Bộ Tư pháp đang cố gắng tách rời hành vi học máy khỏi khái niệm pháp lý về sự thay thế thị trường.
"Phép ẩn dụ Hemingway" và Sáng tạo của Con người
Để làm cho khái niệm học máy trở nên dễ hiểu hơn, Bộ Tư pháp đã đưa ra một phép ẩn dụ văn học liên quan đến tác giả Joan Didion. Hồ sơ lưu ý rằng khi còn là một thiếu niên, Didion thường sao chép các câu chuyện của Ernest Hemingway để phân tích cấu trúc câu và học hỏi kỹ năng của ông. Bộ Tư pháp lập luận rằng nếu luật pháp coi việc huấn luyện máy móc là hành vi vi phạm, thì một nhà văn như Didion về lý thuyết có thể phải đối mặt với trách nhiệm pháp lý mỗi khi bà xuất bản tác phẩm mới, vì quá trình học hỏi của bà gắn liền không thể tách rời với các bài viết sau đó.
Bộ lập luận thêm rằng việc áp đặt trách nhiệm pháp lý nghiêm ngặt đối với việc huấn luyện AI sẽ gây ra nghịch lý là kìm hãm chính sự sáng tạo mà luật bản quyền nhằm bảo vệ. Với việc con người ngày càng sử dụng LLM để soạn thảo và chỉnh sửa các tác phẩm gốc, Bộ Tư pháp gợi ý rằng việc coi huấn luyện là không được phép nếu không có các cơ chế cấp phép khổng lồ sẽ làm tê liệt sự đổi mới do AI thúc đẩy.
Thách thức Văn phòng Bản quyền Hoa Kỳ
Quan điểm của Bộ Tư pháp trực tiếp mâu thuẫn với những phát hiện gần đây từ Văn phòng Bản quyền Hoa Kỳ. Cựu Đăng ký Shira Perlmutter trước đó đã lập luận chống lại việc bảo vệ "sử dụng hợp lý" một cách tràn lan, lưu ý rằng AI hoạt động ở quy mô và tốc độ vượt xa khả năng của con người và thường tạo ra các sản phẩm thương mại cạnh tranh trực tiếp với các nhà sáng tạo nội dung gốc.
Bộ Tư pháp đã chuyển sang thế tấn công đối với đánh giá này, tuyên bố rằng báo cáo của Perlmutter không có thẩm quyền pháp lý ràng buộc và không tính đến các án lệ đã được thiết lập về việc phân tích theo từng trường hợp cụ thể. Bộ cảnh báo rằng việc áp đặt trách nhiệm pháp lý rộng rãi sẽ thực tế bắt buộc một chế độ cấp phép, điều này sẽ khiến việc phát triển các mô hình AI tiên tiến trở nên bất khả thi về mặt pháp lý và tài chính.
Các điểm chính rút ra
- Tách biệt Huấn luyện và Kết quả đầu ra: Bộ Tư pháp lập luận rằng việc sao chép văn bản để huấn luyện không cấu thành hành vi vi phạm nếu kết quả đầu ra của mô hình không cho thấy "sự tương đồng đáng kể" với các tác phẩm gốc.
- Bảo vệ Đổi mới: Bộ cảnh báo rằng việc yêu cầu giấy phép cho tất cả dữ liệu huấn luyện sẽ kìm hãm sự sáng tạo và ngăn cản sự phát triển của các LLM hỗ trợ con người trong việc sáng tạo nội dung.
- Một tiền lệ pháp lý quan trọng: Sự can thiệp này tạo ra một cuộc xung đột đầy rủi ro giữa Bộ Tư pháp và Văn phòng Bản quyền Hoa Kỳ, tạo tiền đề cho một phán quyết dứt khoát của tòa án về tương lai của AI tạo sinh.
ARTICLE: Bộ Tư pháp Hoa Kỳ đã nộp một bản ý kiến của bên thứ ba (amicus brief) trong vụ kiện bản quyền của New York Times, lập luận rằng việc sao chép văn bản được bảo hộ để huấn luyện các mô hình ngôn ngữ lớn (LLM) đủ điều kiện là sử dụng hợp lý. Hồ sơ này mang lại cho các công ty như OpenAI và Microsoft một lá chắn pháp lý có thể giúp họ tránh khỏi khoản bồi thường thiệt hại mà tờ báo ước tính lên đến hàng tỷ đô la.
Tại sao vụ kiện này lại quan trọng vào lúc này
Vụ kiện hợp nhất nhiều khiếu nại rằng các nhà phát triển AI đã đưa hàng triệu bài báo vào mô hình của họ mà không có sự cho phép, sau đó phát hành các sản phẩm cạnh tranh trực tiếp với các báo cáo của chính tờ Times. Nếu tòa án bác bỏ lập luận về sử dụng hợp lý của Bộ Tư pháp, các công ty AI có thể phải đối mặt với các hóa đơn cấp phép khổng lồ hoặc bị buộc phải ngừng phát triển thế hệ các tác nhân hội thoại tiếp theo.
Lập luận cốt lõi của Bộ Tư pháp
Bản tóm tắt chia quy trình làm việc của AI thành hai giai đoạn riêng biệt. Đầu tiên, mô hình nạp các kho ngữ liệu văn bản lớn; thứ hai, nó tạo ra các phản hồi cho các câu lệnh của người dùng. Bộ Tư pháp cho rằng hành vi vi phạm chỉ phát sinh khi một tác phẩm có bản quyền được sao chép theo cách mà công chúng có thể tiếp cận. Vì các bản sao dùng để huấn luyện không bao giờ rời khỏi máy chủ của nhà phát triển, nên hành vi nạp dữ liệu không đáp ứng ngưỡng đó.
DOJ cũng dựa vào bài kiểm tra "sự tương đồng đáng kể", một tiêu chuẩn bản quyền lâu đời. Bộ lập luận rằng văn bản đầu ra của các mô hình như GPT-4 "thường xuyên, nếu không muốn nói là luôn luôn" khác biệt đủ nhiều so với bất kỳ nguồn đơn lẻ nào để nguyên đơn không thể chứng minh được sự tương đồng cần thiết. Nói tóm lại, bản tóm tắt lập luận rằng trọng tâm pháp lý nên nằm ở kết quả đầu ra cuối cùng, chứ không phải ở quá trình học tập nội bộ.
Một phép ẩn dụ văn học để minh họa cho quan điểm này
Để làm cho lập luận kỹ thuật trở nên dễ hiểu hơn, văn bản đệ trình đã dẫn chứng một câu chuyện về một nhà văn tuổi teen đã sao chép các câu chuyện của Ernest Hemingway để nghiên cứu phong cách của ông. DOJ cho rằng nếu luật pháp coi hoạt động học tập đó là hành vi vi phạm, thì nhà văn đó có thể bị kiện mỗi khi cô ấy xuất bản một tác phẩm mới, ngay cả khi tác phẩm của cô ấy là nguyên bản. Bộ cảnh báo rằng việc áp dụng logic tương tự cho AI sẽ "làm tê liệt chính sự sáng tạo mà luật bản quyền được thiết kế để bảo vệ."
Những rủi ro đối với các nhà phát triển AI và những người sáng tạo nội dung
- Rủi ro đổi mới: Việc yêu cầu giấy phép cho mọi đoạn văn bản được sử dụng trong quá trình huấn luyện có thể đẩy chi phí lên cao đến mức việc xây dựng các mô hình tiên tiến nhất trở nên không khả thi về mặt tài chính.
- Quy trình sáng tạo: Các nhà văn con người ngày càng dựa vào LLM để soạn thảo, chỉnh sửa và lên ý tưởng. Nếu quá trình huấn luyện bị coi là bất hợp pháp, những công cụ đó có thể biến mất, làm thay đổi cách thức sản xuất nội dung trong mọi ngành công nghiệp.
- Tác động thị trường: Ngành công nghiệp báo chí lập luận rằng các mô hình AI có khả năng trả lời câu hỏi hoặc tạo ra văn bản giống như tin tức sẽ làm xói mòn giá trị của các báo cáo gốc, có khả năng hút mất doanh thu quảng cáo và đăng ký thuê bao.
Quan điểm phản bác của Văn phòng Bản quyền
Một báo cáo gần đây từ Văn phòng Bản quyền Hoa Kỳ, được soạn thảo dưới thời cựu Đăng ký viên Shira Perlmutter, đã phản đối lập luận về việc sử dụng hợp lý một cách bao quát. Văn phòng này đã nhấn mạnh ba yếu tố khiến AI khác biệt với việc học tập của con người: khối lượng tài liệu sao chép khổng lồ, tốc độ xử lý cực nhanh, và thực tế là các mô hình tạo ra có thể được đóng gói và bán như các sản phẩm thương mại cạnh tranh trực tiếp với các nhà sáng tạo nguồn.
DOJ bác bỏ những điểm này, lưu ý rằng báo cáo không có hiệu lực pháp lý ràng buộc và các án lệ hiện tại đã yêu cầu phân tích từng sự kiện cụ thể về việc sử dụng hợp lý. Bộ cảnh báo rằng việc áp đặt "trách nhiệm pháp lý rộng rãi" sẽ thực sự buộc ngành công nghiệp này vào một chế độ cấp phép mà "sẽ khiến việc phát triển các mô hình AI tiên tiến trở nên bất khả thi về mặt pháp lý và tài chính."
Điều gì có thể xảy ra tiếp theo
Tòa án quận đang thụ lý vụ kiện của tờ Times sẽ phải cân nhắc quan điểm về việc sử dụng hợp lý của DOJ so với các kết luận của Văn phòng Bản quyền. Một phán quyết có lợi cho DOJ sẽ tạo ra một tiền lệ rằng dữ liệu huấn luyện có thể được thu thập mà không cần sự cho phép rõ ràng, miễn là đầu ra của mô hình không vi phạm sự tương đồng đáng kể. Một quyết định đứng về phía tờ báo có thể kích hoạt một làn sóng đàm phán cấp phép, có khả năng định hình lại nền kinh tế của nghiên cứu AI.
Điểm mấu chốt
Văn bản đệ trình của DOJ đã biến câu hỏi liệu việc huấn luyện AI có phải là sử dụng hợp lý hay không thành một cuộc chiến pháp lý đầy rủi ro. Kết quả sẽ quyết định liệu các nhà phát triển có thể tiếp tục xây dựng các mô hình ngôn ngữ mạnh mẽ dựa trên văn bản hiện có hay phải tìm kiếm các giấy phép tốn kém cho mọi tài liệu mà họ nạp vào. Quyết định này sẽ có tác động lan tỏa đến lĩnh vực công nghệ, ngành truyền thông và nền kinh tế sáng tạo rộng lớn hơn.
