Nhóm nghiên cứu gồm các cộng tác viên từ NVIDIA và Flower Labs đã công bố một phương pháp mới cho các agent AI tự cải tiến, được gọi là “Red Queen Gödel Machine”. Phương pháp này cho phép agent và bộ đánh giá (evaluator) cùng tiến hóa, tránh việc bị kẹt ở mức độ tối đa mà một bộ kiểm tra cố định có thể đo lường.
Trong các hệ thống tự‑cải tiến hiện nay, agent chỉ có thể cải thiện mình dựa trên một bộ benchmark cố định. Khi agent đã học hết những gì bộ kiểm tra có thể phân biệt, tiến trình cải thiện sẽ chậm lại hoặc dừng lại. Như Alex Iacob, thành viên nhóm, nói: “Một agent tự‑cải tiến chỉ tốt như bài kiểm tra đánh giá nó”.
Giải pháp mới thay đổi cách tiếp cận bằng cách để evaluator cũng phát triển cùng agent. Khi agent mạnh hơn, evaluator được cập nhật thành phiên bản khó hơn, tạo ra một vòng lặp cải tiến liên tục. Quá trình này được thực hiện qua các giai đoạn, mỗi giai đoạn giữ evaluator cố định để đo lường chính xác, sau đó thay thế bằng evaluator mới nếu nó đạt hiệu suất tốt hơn trên các ví dụ chuẩn.
- Trong viết và đánh giá bài báo khoa học, các agent đồng tiến hóa đạt mức chấp nhận cao hơn 1,78‑1,86×.
- Trong chấm điểm các bài toán toán học cấp độ Olympiad, độ chính xác tăng 9%.
Những kết quả này không chỉ chứng minh tiềm năng tăng năng suất của AI mà còn giảm đáng kể chi phí tính toán, vì không cần duy trì một bộ benchmark tĩnh quá lớn. Đối với cộng đồng AI Việt Nam, công nghệ này mở ra cơ hội phát triển các hệ thống tự‑cải tiến hiệu quả, phù hợp với hạ tầng tính toán trong nước.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com