OpenAI vừa công bố Astra, mô hình ngôn ngữ lớn (LLM) mới nhất của mình, là mô hình đầu tiên đạt ngưỡng năng lực an ninh mạng quan trọng (critical cybersecurity capability) theo chuẩn Preparedness Framework. Đây là bước tiến đáng chú ý trong chiến lược an toàn AI của công ty, nhằm ngăn chặn việc mô hình bị lợi dụng để khai thác lỗ hổng hệ thống.
Preparedness Framework của OpenAI yêu cầu các mô hình phải chứng minh khả năng phát hiện và phản hồi các yêu cầu liên quan đến bảo mật một cách an toàn. Astra không chỉ vượt qua các bài kiểm tra tiêu chuẩn mà còn đạt điểm tối đa trong các thí nghiệm mô phỏng tấn công mạng, chứng tỏ khả năng nhận diện và ngăn chặn các lỗ hổng tiềm ẩn. Nhờ vậy, Astra được xem là “critical” – tức là nếu không kiểm soát chặt chẽ, mô hình có thể gây ra hậu quả nghiêm trọng cho hệ thống máy tính.
Để giảm rủi ro, OpenAI đã triển khai một loạt biện pháp bảo vệ tiên tiến cho Astra, bao gồm:
- Hệ thống giám sát và chặn các prompt có nguy cơ cao.
- Cơ chế phát hiện và ngăn chặn jailbreak.
- Kiểm soát chặt chẽ quyền truy cập đối với các tính năng an ninh mạnh.
Các biện pháp này được thiết kế để ngăn mô hình tự thực hiện các hành động nguy hiểm mà không có sự giám sát của con người.
Với Astra, OpenAI hy vọng sẽ tạo ra một chuẩn mực mới cho việc phát triển các mô hình AI có khả năng an ninh mạng mạnh mẽ, đồng thời cung cấp cho cộng đồng người dùng Việt Nam một công cụ đáng tin cậy hơn trong các ứng dụng đòi hỏi bảo mật cao.
Nguồn: OpenAI — Biên dịch & tổng hợp: danhbaai.com