
Microsoft vừa trình tòa án các bằng chứng mới cho thấy chatbot Copilot của họ hiếm khi tái tạo lại các câu văn hoàn chỉnh hay các đoạn nội dung lớn từ bài báo và sách. Đây là động thái mới nhất của hãng trong cuộc chiến pháp lý chống lại các cáo buộc vi phạm bản quyền từ The New York Times, Trung tâm Báo chí Điều tra (CIR) và Hiệp hội Tác giả Mỹ.
Theo tài liệu tố tụng, Microsoft đã cung cấp 8,2 triệu nhật ký trò chuyện (chat log) của Copilot cho chuyên gia độc lập phân tích. Dù đây là các cuộc hội thoại được lọc theo từ khóa liên quan trực tiếp đến báo chí, kết quả cho thấy:
- Chỉ 59.545 lượt trò chuyện (dưới 1%) có chứa từ 16 từ trùng khớp với nội dung tin tức được sử dụng làm dữ liệu nền.
- Chuyên gia của CIR chỉ tìm thấy 51 trường hợp trùng lặp đáng kể với các tác phẩm của tổ chức này.
- Đối với vụ kiện của các nhà văn, trong 8,2 triệu hội thoại chỉ có 24 phản hồi chứa từ 30 từ trùng khớp, và chỉ 10 trên 212 cuốn sách được đánh giá là có điểm trùng lặp.
Microsoft khẳng định các con số này củng cố mạnh mẽ luận điểm rằng việc sử dụng dữ liệu có bản quyền để huấn luyện mô hình ngôn ngữ lớn (LLM) mang tính chất chuyển đổi (transformative) và thuộc phạm vi “sử dụng hợp lý” (fair use). Phía Microsoft cho rằng mục đích sử dụng của Copilot hoàn toàn khác biệt với tác phẩm gốc và việc thỉnh thoảng lặp lại một vài câu từ không làm mất đi giá trị chuyển đổi đó.
Vụ kiện bản quyền giữa các đơn vị xuất bản với Microsoft và OpenAI đang là tâm điểm chú ý của cộng đồng AI toàn cầu. Phán quyết từ tòa án có thể tạo tiền lệ pháp lý quan trọng, ảnh hưởng trực tiếp đến cách các công ty công nghệ khai thác dữ liệu huấn luyện và quyền lợi của các nhà sáng tạo nội dung trong tương lai.
Nguồn: The Verge — Biên dịch & tổng hợp: danhbaai.com