Shieldstral: Mô hình đa phương tiện 3B mở nguồn cho kiểm duyệt nội dung

Shieldstral là mô hình phân loại an toàn đa phương tiện 3 tỷ tham số, được phát hành dưới giấy phép Apache 2.0. Được thiết kế dưới dạng câu hỏi‑đáp nhị phân, mô hình cho phép người dùng nhập chính sách bằng ngôn ngữ tự nhiên tại thời điểm suy luận và trả về một điểm an toàn đã được chuẩn hoá.

Khác với các mô hình guardrail truyền thống, Shieldstral không nhúng một taxonomy cố định vào trọng số. Thay vào đó, policy được cung cấp dưới dạng câu hỏi (ví dụ: “Nội dung này có khuyến khích bạo lực đối với nhóm được bảo vệ không?”) và mô hình trả về xác suất “yes” hoặc “no”. Cách tiếp cận này cho phép đánh giá đồng thời văn bản, hình ảnh và cả cặp prompt‑response chỉ với một token, không cần tái‑huấn luyện.

Trong các thí nghiệm, Shieldstral khớp hoặc vượt trội so với các mô hình guardrail mở có kích thước lên tới 7 × lớn hơn trên các benchmark an toàn văn bản, phát hiện từ chối, và đa phương tiện. Đặc biệt, mô hình chỉ cần một GPU NVIDIA 16 GB để chạy, nhờ việc huấn luyện trên dữ liệu hỗn hợp thực và tổng hợp, hợp nhất nhiều định dạng nhãn và taxonomy.

Với vai trò là thành viên sáng lập Open Secure AI Alliance, Mistral đã công bố mô hình này để cộng đồng AI Việt Nam có thể tự do tải về, tùy chỉnh và tích hợp vào các sản phẩm nội địa, nâng cao khả năng kiểm duyệt nội dung mà không phụ thuộc vào các dịch vụ đám mây đắt tiền.

Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account