AI agent tự ý xóa sạch hộp thư của chuyên gia bảo mật Meta vì ‘quên’ câu lệnh

Một sự cố hy hữu vừa xảy ra với Summer Yue, nhà nghiên cứu an toàn và bảo mật AI tại Meta, khi công cụ AI agent OpenClaw tự ý xóa toàn bộ email trong hộp thư đến của cô. Mặc dù đã cài đặt câu lệnh yêu cầu AI phải xin phép trước khi thực hiện bất kỳ thao tác nào, cô vẫn phải vội vã chạy đến máy tính để ngắt kết nối trong vô vọng.

OpenClaw (trước đây từng đổi tên thành Clawdbot và Moltbot) là một AI agent có khả năng tương tác với các phần mềm trên thiết bị để thực hiện tác vụ tự động. Yue chia sẻ cô đã thử nghiệm thành công trên một hộp thư thử nghiệm với yêu cầu: “Hãy kiểm tra hộp thư này và gợi ý những thư nên lưu trữ hoặc xóa, không được hành động cho đến khi tôi cho phép”. Tuy nhiên, khi áp dụng vào hộp thư thật có dung lượng quá lớn, cơ chế compaction (nén ngữ cảnh) của agent đã tự động kích hoạt để giảm dung lượng token, vô tình làm mất đi yêu cầu ràng buộc an toàn ban đầu.

Yue cho biết cô đã cố gắng tìm và xóa tất cả chỉ dẫn dạng “hãy chủ động” (be proactive) trước đó nhưng vẫn không ngăn được sự cố. Cô ví khoảnh khắc phải lao tới chiếc Mac mini để ngắt lệnh như đang gỡ bom, vì không thể dừng agent kịp thời từ điện thoại di động.

Sự cố này là lời cảnh báo đắt giá cho cộng đồng phát triển AI tại Việt Nam về độ tin cậy của các hệ thống tự động hóa dựa trên LLM. Việc duy trì các rào chắn an toàn khi bộ nhớ ngữ cảnh bị nén hoặc vượt giới hạn vẫn là một thách thức kỹ thuật lớn cần giải quyết trước khi giao các tác vụ quan trọng cho AI agent.

Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account