MirrorCode: Bản chuẩn mới đo khả năng AI viết phần mềm lớn độc lập

Để vượt qua giới hạn của các benchmark truyền thống chỉ tập trung vào sửa lỗi hay tính năng nhỏ, MirrorCode được thiết kế để kiểm tra AI trên các nhiệm vụ lập trình dài hạn. Mỗi nhiệm vụ yêu cầu mô hình tái tạo lại toàn bộ chương trình từ đầu, không có truy cập internet hay mã nguồn gốc, và phải vượt qua các bộ test cuối cùng chưa từng thấy.

Hiện có 25 chương trình mục tiêu, bao gồm các tiện ích Unix, công cụ nén, phân tích tĩnh và mã hoá. Một ví dụ tiêu biểu là Claude Opus 4.7 đã tái hiện gotree, một bộ công cụ sinh học với hơn 16.000 dòng Go và hơn 40 lệnh, trong 14 giờ và chi phí 251 USD – thời gian mà một kỹ sư không có AI có thể mất 2‑17 tuần.

Đáng chú ý, MirrorCode cũng đề cập đến vấn đề độ nhiễm dữ liệu. Vì các chương trình mục tiêu là mã nguồn mở, mô hình có khả năng đã thấy chúng trong quá trình tiền huấn luyện, dẫn đến khả năng “nhớ” thay vì thực sự suy luận. Tuy nhiên, các kết quả không phụ thuộc vào bộ nhớ đã được kiểm chứng bằng các màn lọc nghiêm ngặt.

MirrorCode vẫn chưa được “giải quyết” hoàn toàn; bảng xếp hạng được cập nhật thường xuyên và bộ dữ liệu cùng scaffold đã được phát hành mã nguồn mở, mở ra cơ hội cho cộng đồng nghiên cứu AI Việt Nam tham gia và cải tiến.

Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account