
Trong vài tháng gần đây, các nhà bán sách cũ như Barter Books ở Northumberland, Anh, báo cáo một hiện tượng lạ: các đơn hàng khối lượng lớn đến mức một lần giao hàng có thể thay thế công suất bán trong một tuần. Chủ cửa hàng Stuart Manley cho biết chưa từng thấy mức độ bùng nổ như vậy trong suốt 30 năm hoạt động.
Nguyên nhân được đưa ra là các công ty AI đang mua sách để huấn luyện mô hình ngôn ngữ lớn (LLM). Năm 2025, một phán quyết của tòa án Mỹ cho phép việc sử dụng sách đã mua cho mục đích huấn luyện AI, dựa trên nguyên tắc “được chuyển đổi một cách đáng kể”. Vụ kiện giữa Anthropic và ba tác giả đã dẫn đến quyết định này, và các tài liệu tòa án tiết lộ dự án nội bộ của Anthropic mang tên “Project Panama”.
“Project Panama” nhằm quét phá hủy toàn bộ sách trên thế giới: sách được gửi đến các trung tâm để quét nhanh, sau đó xương sống bị loại bỏ và phần còn lại được tái chế. Mặc dù công ty khẳng định không mua sách hiếm hoặc cổ, nhưng việc thu thập khối lượng lớn các tựa sách hiếm và đặc biệt cho thấy nhu cầu dữ liệu đa dạng cho LLM.
Chuyên gia bản quyền Emily Hudson của Đại học Oxford nhấn mạnh, ở Anh, việc sao chép để tạo bộ dữ liệu huấn luyện vẫn cần có sự cho phép của chủ sở hữu bản quyền, khác với quy định ở Mỹ. Điều này tạo ra một khoảng trống pháp lý khiến các nhà bán sách lo ngại về việc sách của họ bị tiêu thụ mà không được bồi thường.
Với xu hướng này, cộng đồng AI và người tiêu dùng Việt Nam cần quan tâm đến vấn đề bản quyền và đạo đức trong việc thu thập dữ liệu. Nếu không có khung pháp lý rõ ràng, việc “tiêu thụ” sách cũ để đào tạo AI có thể gây ra tranh cãi và ảnh hưởng đến nguồn tài nguyên văn học toàn cầu.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com