Tin tức TechFlow, ngày 22 tháng 7, nhiều tác giả đã khởi kiện tập thể vào năm 2024, cáo buộc Anthropic tải xuống hàng triệu cuốn sách điện tử lậu hàng loạt từ các "thư viện bóng tối" như LibGen, và đưa khoảng 482.000 tác phẩm được bảo vệ bản quyền trong số đó vào cơ sở dữ liệu huấn luyện của Claude. Tòa án sau đó đã tách riêng việc xác định "huấn luyện mô hình" và "thu thập dữ liệu": Việc AI đọc các cuốn sách có được hợp pháp để học tập có thể thuộc về sử dụng hợp lý; nhưng việc tải xuống và lưu trữ lâu dài các tác phẩm thông qua các trang web lậu tự nó cấu thành hành vi xâm phạm bản quyền. Anthropic cuối cùng đã đồng ý trả 1,5 tỷ USD để hòa giải, bồi thường trung bình khoảng 3.000 USD cho mỗi tác phẩm, và tiêu hủy các tệp lậu liên quan.
Tuy nhiên, trước đây Anthropic nhiều lần chỉ trích một số nhóm AI Trung Quốc trích xuất đầu ra của Claude thông qua API để thực hiện chưng cất mô hình, cho rằng hành động này phá vỡ các quy tắc sở hữu trí tuệ. Hai hành vi này không hoàn toàn giống nhau về mặt pháp lý, nhưng tạo nên sự tương phản rõ rệt: Đối mặt với các tác phẩm của con người, các công ty AI nhấn mạnh mô hình có quyền học hỏi; đối mặt với đầu ra của chính mô hình mình, lại yêu cầu sự bảo vệ độc quyền mạnh mẽ hơn. Vì vậy, ranh giới cốt lõi là: Huấn luyện AI chưa chắc đã vi phạm pháp luật, nhưng phương thức thu thập dữ liệu huấn luyện phải hợp pháp. (Jin10)



