Tài liệu nội bộ hé lộ Microsoft từng gọi việc thu thập dữ liệu AI là trộm cắp

Các tài liệu mới được bỏ niêm phong từ vụ kiện bản quyền kéo dài ba năm giữa tờ The New York Times và hai ông lớn OpenAI cùng Microsoft đã hé lộ nhiều tình tiết bất ngờ. Theo hồ sơ vụ kiện, một lãnh đạo cấp cao của Microsoft từng gọi các hoạt động huấn luyện AI bằng dữ liệu thu thập không phép là một hình thức “trộm cắp”, trong khi nội bộ OpenAI cũng thừa nhận các mô hình AI tạo ra “mối nguy hiểm hiện hữu” cho các nhà báo và nhà xuất bản.

Hồ sơ nêu chi tiết cách các công ty này thu thập nội dung bằng cách vượt qua tường phí (paywall), xây dựng tập dữ liệu quy mô lớn thông qua việc cào web (scraping) và chủ động loại bỏ thông tin bản quyền. Đáng chú ý, các tài liệu phản bác trực tiếp lập luận “sử dụng hợp lý” (fair use) của các hãng AI. Dữ liệu nội bộ của Microsoft cho thấy công cụ tìm kiếm Copilot đã khiến lượng truy cập vào trang của The New York Times giảm tới 93% so với tìm kiếm truyền thống, tạo ra một “vòng lặp diệt vong” ảnh hưởng xấu đến chính chất lượng web.

CEO Microsoft Satya Nadella trong phần lấy lời khai cũng thừa nhận rằng bất kỳ nội dung nào nằm sau tường phí đều cần phải có bản quyền khi dùng để huấn luyện model. Ông cho biết nếu biết OpenAI cào dữ liệu trả phí, ông sẽ yêu cầu họ tiến hành huấn luyện lại các mô hình từ đầu.

Vụ việc tiếp tục làm nổi bật cuộc khủng hoảng pháp lý và đạo đức xoay quanh vấn đề bản quyền trong kỷ nguyên LLM. Đối với cộng đồng công nghệ và sáng tạo nội dung tại Việt Nam, đây là bài học quan trọng về sự cân bằng giữa phát triển công nghệ AI tiên tiến và việc tôn trọng quyền sở hữu trí tuệ, định hình lại cách các bên thương lượng trong tương lai.

Business

Nguồn: TechCrunch — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account