Một nhóm nghiên cứu vừa cho ra mắt LittleCurriculum và LittleLearner – bộ mô hình được huấn luyện từ đầu trên 88 tỷ token, lọc theo chuẩn giáo trình tiểu học Hoa Kỳ (K–5). Mục tiêu là trả lời: điều gì xảy ra khi LLM chưa từng thấy tài liệu nào vượt quá lớp 5?
Kho dữ liệu LittleCurriculum được chưng cất từ FineWeb-Edu bằng pipeline lọc 5 giai đoạn, bám sát Common Core. Các khái niệm, sự kiện, từ vựng dạy trên lớp 5 bị loại. Nhóm huấn luyện ba mô hình 0,6B / 1,3B / 5B tham số, mỗi mô hình có bản đối chứng “Unfiltered” cùng kiến trúc và token.
Kết quả thử nghiệm cho thấy:
- Scaling giúp cải thiện năng lực trong phạm vi đã học, nhưng gần như không mở rộng sang bài toán ngoài phạm vi.
- Hậu huấn luyện GRPO tăng mạnh khả năng K–5 nhưng không vượt được ngoài K–5, dù có dùng dữ liệu ngoài phạm vi.
- In-context learning không tạo ra khả năng lý luận mới ngoài K–5.
Nghĩa là scaling, RL và in-context learning chỉ khuếch đại những gì dữ liệu đã dạy; bộ lọc dữ liệu tiền huấn luyện đóng vai trò như trần năng lực của mô hình. Nhóm nghiên cứu cũng đề xuất dùng LittleLearner để đo khi chèn thêm khái niệm mới, hoặc so sánh cách mô hình và trẻ em học phân số.
Với cộng đồng AI Việt Nam, đây là minh chứng quan trọng rằng dữ liệu huấn luyện quyết định trần năng lực, còn hậu huấn luyện chỉ phát huy trong giới hạn đó. Việc đầu tư xây dựng kho dữ liệu tiếng Việt sạch, có kiểm soát có thể đem lại giá trị lớn hơn là chỉ tăng kích thước model.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com