
Một nhóm nghiên cứu của Đại học Stanford vừa công bố Terminal-Bench-Science, benchmark mới nhằm đánh giá khả năng hoạt động của các AI agent trên các quy trình nghiên cứu khoa học thực tế, khác với các bài kiểm tra lý thuyết hay bài tập chuẩn hóa thường thấy trước đây.
Benchmark này được xây dựng bởi đội ngũ phát triển Terminal-Bench – bộ công cụ từng thúc đẩy tiến bộ của AI agent trong lĩnh vực kỹ thuật phần mềm – phối hợp với các chuyên gia khoa học từ nhiều lĩnh vực và cơ sở nghiên cứu trên toàn thế giới. Phiên bản đầu tiên Terminal-Bench-Science 0.1 bao gồm 70 tác vụ thuộc các lĩnh vực khoa học sự sống, vật lý, Trái Đất, toán học và kỹ thuật, bao quát các hoạt động như phân tích dữ liệu khoa học, suy luận thống kê, mô phỏng, chứng minh định lý, xử lý tín hiệu và hiệu chỉnh cảm biến.
Khác với các benchmark khoa học thường chỉ được phát hành một lần rồi bị bỏ quên khi AI phát triển, Terminal-Bench-Science là bộ đánh giá liên tục, được cập nhật thường xuyên để phù hợp với tiến bộ của AI tiên tiến. Các tác vụ trong benchmark được chấm điểm dựa trên các sản phẩm cụ thể có thể kiểm chứng được như phân tích, mô phỏng, chứng minh, mã nguồn và sản phẩm dữ liệu, thông qua các bài kiểm tra có thể tái lập cho từng tác vụ. Trong đợt đánh giá đầu tiên, mô hình Claude Opus 5 là mô hình mạnh nhất với tỷ lệ giải quyết tác vụ đạt 30%.
Đối với cộng đồng AI và các nhà nghiên cứu Việt Nam, sự ra mắt của Terminal-Bench-Science mở ra hướng phát triển AI agent phù hợp với nhu cầu nghiên cứu thực tế, thay vì chỉ tập trung vào các bài kiểm tra lý thuyết. Nền tảng này cũng tạo điều kiện cho các nhà khoa học Việt tham gia đóng góp tác vụ đánh giá, góp phần định hướng tiêu chuẩn khả năng khoa học của AI phù hợp với bối cảnh nghiên cứu trong nước.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com