
Công ty phát triển AI Anthropic vừa phát hành một báo cáo chi tiết cáo buộc các phòng thí nghiệm AI tại Trung Quốc, bao gồm Alibaba, Moonshot AI và DeepSeek, đã gia tăng các đợt tấn công trích xuất dữ liệu (distillation attacks) đối với các mô hình Claude. Theo Anthropic, các chiến dịch này nhằm mục đích vượt qua hàng rào bảo vệ để đánh cắp các năng lực cốt lõi như khả năng hoạt động dạng agent, sử dụng công cụ, lập trình và suy luận logic.
Báo cáo ghi nhận gần 200 triệu lượt tương tác liên quan đến 5 chiến dịch trích xuất dữ liệu riêng biệt. Trong đó, chiến dịch lớn nhất bắt nguồn từ Alibaba với khoảng 151 triệu lượt tương tác từ tháng 5 đến tháng 7, sử dụng hơn 3.500 tài khoản khác nhau để thu thập dữ liệu phục vụ huấn luyện dòng mô hình Qwen. Ngoài ra, một chiến dịch khác từ Moonshot AI đã gửi gần 300.000 yêu cầu qua 5.000 tài khoản trong vòng 10 ngày, tập trung khai thác mô hình Claude Opus.
Kỹ thuật “distillation attack” tập trung vào việc ép mô hình tiết lộ chuỗi suy luận (chain of thought), từ đó dùng dữ liệu thu được để tinh chỉnh các mô hình nhỏ hơn bằng phương pháp học có giám sát (supervised fine-tuning). Mặc dù Anthropic chỉ hiển thị bản tóm tắt suy luận cho người dùng cuối, các bên tấn công đã lợi dụng các kỹ thuật thiết kế prompt tinh vi — như yêu cầu dịch bộ nhớ làm việc sang ký tự Katakana — để buộc mô hình xuất ra dữ liệu thô.
Sự việc này phản ánh cuộc đua khốc liệt và những thách thức về an ninh bảo mật trong ngành công nghiệp AI toàn cầu. Đối với cộng đồng nghiên cứu và phát triển AI tại Việt Nam, đây là bài học quan trọng về tầm quan trọng của việc bảo vệ sở hữu trí tuệ cũng như các cơ chế kiểm soát truy cập khi thương mại hóa các mô hình AI cao cấp.
Nguồn: TechCrunch — Biên dịch & tổng hợp: danhbaai.com