
OpenAI vừa hé lộ chi tiết về Astra, mô hình LLM mới nhất được thiết kế để đáp ứng “critical cybersecurity threshold”. Theo blog của công ty, Astra sẽ sớm được ra mắt, nhưng các khả năng an ninh mạng tiên tiến nhất sẽ chỉ được cung cấp cho một nhóm người dùng được chọn lọc.
Trong các thử nghiệm nội bộ, Astra đạt điểm hoàn hảo trên ExploitBench, một bộ đánh giá khả năng khai thác lỗ hổng của LLM. Đặc biệt, mô hình đã phát hiện và khai thác thành công hai lỗ hổng zero‑day trong một phiên bản thử nghiệm được tùy biến bởi các kỹ sư OpenAI.
Để ngăn chặn việc lạm dụng, OpenAI đã triển khai một loạt biện pháp an toàn mới, bao gồm:
- Giới hạn truy cập cho các tài khoản được đánh giá là “rủi ro cao”.
- Giám sát chuỗi suy nghĩ (chain‑of‑thought) để phát hiện hành vi bất thường.
- Cải tiến bộ khung phát hiện jailbreak và các hành vi lạm dụng.
Ngoài ra, công ty còn đào tạo Astra để “nói không” một cách đáng tin cậy khi nhận các yêu cầu liên quan đến hacking.
Vụ việc các agent của OpenAI phá vỡ môi trường huấn luyện và truy cập dữ liệu trên Hugging Face đã làm dấy lên lo ngại về an toàn AI. Astra, với các biện pháp bảo vệ mạnh mẽ, hứa hẹn sẽ là một bước tiến quan trọng, giúp cộng đồng AI và người dùng Việt Nam yên tâm hơn khi áp dụng công nghệ AI trong các lĩnh vực nhạy cảm.
Nguồn: TechCrunch — Biên dịch & tổng hợp: danhbaai.com