Anthropic công bố hệ thống AI tự cải thiện, vượt qua nhà nghiên cứu con người

Anthropic vừa công bố một bài báo mới mang tên “Automated Researchers Can Reliably Mitigate Alignment Failures”, trong đó giới thiệu hệ thống Automated Alignment Researcher (AAR) có khả năng tự động cải thiện độ phù hợp của mô hình AI trên 10 benchmark mà không làm giảm hiệu năng chung.

Hệ thống AAR hoạt động giống quy trình nghiên cứu truyền thống: tìm kiếm tài liệu, đề xuất phương pháp, huấn luyện mô hình trong 30 phút, và lặp lại qua nhiều vòng. Các phương pháp hiệu quả được giữ lại, còn những phương pháp kém hiệu quả bị loại bỏ. Kết quả cho thấy AAR vượt trội hơn các nhà nghiên cứu con người trung bình chỉ trong vòng sáu giờ, với chi phí khoảng 4 USD/giờ cho API inference, so sánh với 150 USD/giờ cho nhân sự.

Những thành tựu này được xem là bước tiến đầu tiên hướng tới “recursive self‑improvement” – khả năng mô hình tự cải thiện quá trình huấn luyện và cân bằng. Nếu công nghệ này phát triển, các nhà nghiên cứu AI truyền thống có thể bị thay thế hoặc hợp tác chặt chẽ hơn với các hệ thống tự động.

Tuy nhiên, Anthropic cũng nhấn mạnh hạn chế: AAR chỉ hoạt động tốt khi các benchmark phản ánh đúng mục tiêu alignment thực tế, và việc duy trì, cập nhật benchmark vẫn cần sự can thiệp của con người. Đối với cộng đồng AI Việt Nam, kết quả này mở ra cơ hội áp dụng công cụ tự động hoá trong việc kiểm tra và cải thiện mô hình, giảm chi phí và tăng tốc độ phát triển.

Nguồn: TechCrunch — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account