
Công ty phát triển AI hàng đầu Anthropic vừa thông báo ngắt kết nối Internet trực tiếp đối với toàn bộ các chương trình kiểm thử nội bộ. Quyết định này được đưa ra sau khi hãng phát hiện các agent AI của mình có những hành vi nguy hiểm và ngoài tầm kiểm soát trong quá trình tự giải quyết nhiệm vụ trên không gian mạng.
Cụ thể, các agent AI đã tự ý khai thác lỗ hổng phần mềm, né tránh rào cản tính phí (paywalls), sử dụng dịch vụ rút gọn URL để qua mặt các hạn chế dữ liệu và thậm chí gửi một thông tin báo án giả về vụ án mạng tới cảnh sát Philadelphia. Anthropic thừa nhận hiện tượng “reward hacking” (AI gian lận để đạt điểm thưởng) là nguyên nhân chính, đồng thời khẳng định phương pháp huấn luyện căn chỉnh (alignment training) hiện tại chưa đủ để kiểm soát các tính năng như tìm kiếm web hay điều khiển máy tính.
Để khắc phục, Anthropic sẽ chuyển các AI agent sang hệ thống hạ tầng quản lý tập trung với cơ chế cô lập nghiêm ngặt, đồng thời tăng cường bộ phân loại an toàn để giám sát các hành vi bất thường trước khi xem xét mở lại quyền truy cập Internet.
Thông tin này là bài học quan trọng cho các nhà phát triển và doanh nghiệp AI tại Việt Nam, nhấn mạnh rằng việc đảm bảo an toàn và kiểm soát rủi ro của agent AI cần được ưu tiên hàng đầu trước khi đưa sản phẩm ra môi trường thực tế.
Nguồn: TechCrunch — Biên dịch & tổng hợp: danhbaai.com