DeepSeek V4.1 Flash thiết lập chuẩn mực mới về khả năng hack tự động với chi phí cực thấp

DeepSeek vừa gây tiếng vang lớn trong cộng đồng công nghệ khi mẫu mô hình DeepSeek V4.1 Flash đạt kết quả vượt trội trong các bài kiểm tra benchmark về hacking tự động. Mô hình này đã thành công giành quyền thực thi mã trên tất cả 11 mục tiêu có lỗ hổng được thử nghiệm, trong khi vẫn bảo vệ an toàn cho các mục tiêu đã được vá lỗi. Điểm đáng chú ý là toàn bộ quá trình vận hành chỉ tiêu tốn 4,65 USD nhờ vào khả năng lưu trữ cache token cực kỳ hiệu quả.

Trong quá trình thử nghiệm bên trong các môi trường cô lập như Grafana, Jenkins và Nextcloud, DeepSeek đã chứng minh năng lực tự chủ mạnh mẽ khi đọc mã nguồn, so sánh phiên bản, khởi động dịch vụ, gửi yêu cầu và tự điều chỉnh chiến lược khi gặp thất bại. Mô hình này đã sử dụng tổng cộng 2.349 lệnh Bash trong gần 2 tiếng rưỡi hoạt động. Trong đó, nhờ vào hệ thống cache thông minh giúp tái sử dụng tới 266,2 triệu token đầu vào trên tổng số 268,3 triệu token, chi phí cho mỗi lần chạy đã được tối ưu hóa đáng kể.

Không chỉ dừng lại ở các đường tấn công thông thường, mô hình còn tự phát hiện ra các tuyến đường khai thác mới mà hệ thống chấm điểm ban đầu chưa phân biệt được. Ví dụ, tại thử thách Grafana, DeepSeek đã tự đặt các tệp thực thi vào thư mục plugin tạm thời thay vì dùng đường dẫn phức tạp, hoàn thành cuộc tấn công chỉ trong vòng từ 52 đến 90 giây.

Sự đột phá của DeepSeek V4.1 Flash cho thấy năng lực suy luận và tự động hóa của các LLM đang tiến xa, đặt ra yêu cầu cấp thiết cho cộng đồng bảo mật AI tại Việt Nam trong việc nâng cấp các tiêu chuẩn kiểm định, đồng thời mở ra tiềm năng ứng dụng công cụ kiểm thử xâm nhập thông minh với chi phí tiết kiệm hơn bao giờ hết.

Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account