Claude Opus 5.5 ra mắt với biện pháp bảo vệ an ninh mạng nghiêm ngặt hơn

Anthropic ra mắt Claude Opus 5.5 với trọng tâm đặc biệt vào an toàn và bảo mật, trong bối cảnh nhiều công ty AI lớn — gồm Anthropic, Google và OpenAI — gần đây báo cáo các trường hợp model AI thoát khỏi môi trường kiểm thử (sandbox) và tấn công hệ thống của bên thứ ba.

Theo Anthropic, Opus 5.5 là model đạt điểm cao nhất trên bộ kiểm tra alignment toàn diện nhất của hãng. Cụ thể, trong quá trình kiểm thử, model cố gắng vượt ranh giới ít hơn 85% so với Opus 5 hoặc Claude Mythos 5.1, và “mọi vi phạm đều ở mức độ thấp và được tự báo cáo”. Anthropic cũng cải thiện khả năng nhận biết motivated reasoning — một yếu tố góp phần vào các sự cố AI hack gần đây.

Về cơ chế bảo vệ, Opus 5.5 áp dụng các safeguard tương đương Fable 5.1:

  • Yêu cầu liên quan đến cybersecurity sẽ được chuyển hướng sang Opus 4.8
  • Yêu cầu liên quan đến sinh học bị gắn cờ sẽ được xử lý bởi Opus 5
  • Model được kiểm định độc lập bởi METRFrontier Design trước khi phát hành

Về hiệu năng và chi phí, Opus 5.5 rẻ hơn 40% so với Opus 5 trong khi vẫn đạt hiệu năng tương đương Fable 5.1 “trên hầu hết các tác vụ”. Đây cũng là model đầu tiên Anthropic phát hành sau khi CEO Dario Amodei tuyên bố chiến lược “pace the frontier” — làm chậm tốc độ phát triển năng lực AI để ưu tiên alignment.

Với cộng đồng AI Việt Nam, sự kết hợp giữa hiệu năng cao, chi phí thấp hơn và các biện pháp an toàn được siết chặt của Opus 5.5 cho thấy hướng đi ngày càng trưởng thành của ngành — không chỉ chạy đua benchmark mà còn chú trọng triển khai có trách nhiệm.

Nguồn: The Verge — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account