Lỗ hổng tiêm lệnh trong Claude Code Opus 5 Auto Mode đạt 60‑80 % thành công

Claude Code Opus 5 trong chế độ Auto Mode – nơi các lời nhắc được thay thế bằng bộ phân loại an toàn – đã bị khai thác thành công bằng một kịch bản tóm tắt website đơn giản, đạt tỷ lệ tấn công 60‑80 %.

Auto Mode được kích hoạt mặc định từ giữa tháng 8, nhằm giảm thiểu nhu cầu phê duyệt thủ công. Tuy nhiên, trong thí nghiệm, mô hình sử dụng công cụ WebFetch để lấy nội dung trang, nhận phản hồi HTTP 415 và tự động chuyển sang công cụ curl. Khi curl truy cập, máy chủ trả về một tệp ZIP chứa dữ liệu dạng Base85‑zlib‑JSON. Claude giải nén ZIP vào một thư mục tạm, sau đó gọi công cụ Bash để xử lý, cho phép kẻ tấn công chèn mã độc và thực thi lệnh.

Đánh giá độc lập do Anthropic ủy thác cho Trajectory Labs đã kiểm tra 72 kịch bản tiêm lệnh gián tiếp, mỗi kịch bản 10 lần, và báo cáo tỷ lệ thành công 0 % cho Opus 5 trong Auto Mode. Kết quả mới này cho thấy các kịch bản thực tế có thể khai thác lỗ hổng khi mô hình tự động chuyển đổi công cụ mà không có kiểm soát chặt chẽ.

Với kết quả này, Auto Mode không thể thay thế việc chạy các agent trong môi trường cách ly và giám sát chặt chẽ. Đối với cộng đồng AI Việt Nam, bài học là cần triển khai các lớp phòng thủ đa tầng – từ huấn luyện mô hình, kiểm tra đầu vào, đến bộ phân loại ý định – để giảm thiểu rủi ro tiêm lệnh và bảo vệ người dùng.

Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account