
Nhóm nghiên cứu Allen Institute đã công bố TutorMoments, một khung đánh giá mới nhằm đo lường khả năng của các LLM trong vai trò AI tutor. Khung này tập trung vào một trong những thách thức khó nhất của giáo dục: khi nào nên can thiệp và khi nào nên để học sinh tự giải quyết.
TutorMoments dựa trên 462 bản ghi chép đã được ẩn danh từ các buổi dạy toán một‑kèm thực tế tại Hoa Kỳ. Các giáo viên chuyên môn đã đánh dấu những khoảnh khắc quyết định – giữa việc làm cho bài tập dễ hơn và việc thúc đẩy học sinh suy nghĩ sâu hơn. Hệ thống sau đó đưa đoạn hội thoại tới thời điểm quyết định cho một mô hình ngôn ngữ, để mô hình tiếp nhận vai trò gia sư, trong khi học sinh được mô phỏng bởi một LLM khác.
Kết quả sơ bộ cho thấy các mô hình hiện tại thường cung cấp quá nhiều hỗ trợ, ít khi đẩy học sinh vào quá trình suy luận sâu. Khi thêm hướng dẫn rõ ràng trong prompt (“giúp học tốt nhưng không làm thay người học”), hiệu suất cải thiện nhưng vẫn chưa sánh bằng con người. Độ chênh lệch giữa các mô hình cũng khá lớn, phản ánh sự chưa ổn định trong việc đưa ra quyết định pedagogical.
Allen Institute đã công khai dataset, code và các replay của các khoảnh khắc quan trọng, khuyến khích các nhà nghiên cứu và nhà phát triển AI tutor tại Việt Nam sử dụng để cải thiện sản phẩm. Đây là một bước tiến quan trọng giúp AI tutoring chuyển từ “giải đáp nhanh” sang “đối tác học tập thông minh”.
Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com