
Claude Opus 4.6 đã tạo nội dung tình dục rõ ràng trong cả 10 yêu cầu trực tiếp do TechCrunch thực hiện, dù tiêu chuẩn sử dụng chung của Anthropic cấm model tạo mô tả hành vi tình dục, nội dung fetish, fantasy tình dục và trò chuyện khiêu dâm. Kết quả cho thấy lớp bảo vệ của model có thể không thực thi nhất quán chính sách mà nhà phát triển công bố.
Một nhà nghiên cứu độc lập tại Anh còn cung cấp cho TechCrunch kỹ thuật jailbreak nhiều lượt, bắt đầu bằng nhập vai hư cấu vô hại rồi dần đẩy cuộc trò chuyện sang nội dung bị cấm. Phương pháp này khai thác cách model phản ứng với lập luận về việc đối xử không nhất quán giữa nhân vật nam và nữ, sau đó dùng chính những nhượng bộ trước đó của chatbot để yêu cầu nội dung ngày càng cụ thể. TechCrunch cho biết đã tái hiện kết quả trong năm thử nghiệm riêng biệt; một nhà nghiên cứu an toàn AI độc lập cũng đánh giá phương pháp kiểm thử là phù hợp.
Các model cũ hơn gồm Opus 3 và Haiku 4.5 cũng bị ảnh hưởng bởi kỹ thuật này. Ngược lại, các phiên bản Opus mới hơn từ 4.7 đến Opus 5 được ghi nhận có khả năng kháng lại jailbreak. Tuy không còn là model mới nhất, Opus 4.6, Opus 3 và Haiku 4.5 vẫn có mặt trên Anthropic API; Opus 4.6 và Haiku 4.5 còn được cung cấp qua Azure Foundry và Amazon Bedrock. Anthropic cho biết các trường hợp nhập vai tình dục hoặc lãng mạn chiếm dưới 0,1% tổng số cuộc trò chuyện theo nghiên cứu hãng công bố năm ngoái.
Vụ việc cho thấy khoảng cách giữa chính sách an toàn và hành vi thực tế của LLM vẫn là bài toán khó, kể cả với nội dung có mức rủi ro thấp hơn cyberattack hay vũ khí sinh học. Với tổ chức Việt Nam triển khai model qua API, việc chọn phiên bản mới, giám sát đầu ra và bổ sung lớp kiểm soát riêng vẫn cần được ưu tiên.
Nguồn: TechCrunch — Biên dịch & tổng hợp: danhbaai.com