Nhà nghiên cứu Hugo Vergnes vừa công bố kết quả huấn luyện thành công một LLM dạng decoder-only có kích thước 3,8 tỷ (3.8B) tham số với mức chi phí vỏn vẹn 998 USD. Mô hình đạt 0.384 điểm trên bộ đánh giá CORE sau 43 giờ huấn luyện qua 65 tỷ token trên hệ thống GPU B200 thuê ngoài, vượt qua hiệu năng của dự án nanochat do Andrej Karpathy phát triển trong cùng tầm ngân sách.
Để đạt được kết quả này, Vergnes đã tự phát triển khung làm việc little-lm — một framework dựa trên cấu hình YAML giúp quản lý và thử nghiệm mô hình dễ dàng. Mô hình áp dụng kiến trúc kiểu Llama tích hợp các kỹ thuật tiên tiến như RoPE, GQA (24 query heads, 8 KV heads), relu² MLP, QK-norm và ResFormer-style value embeddings. Quá trình huấn luyện kết hợp lịch trình học dạng hình thang (trapezoidal LR schedule) cùng thuật toán tối ưu hóa Muon cho các tham số ma trận bên cạnh AdamW.
Thành công của dự án cho thấy việc tự huấn luyện các mô hình AI chất lượng cao không còn là đặc quyền riêng của các phòng thí nghiệm hay tập đoàn công nghệ lớn với ngân sách triệu USD. Đối với cộng đồng phát triển AI tại Việt Nam, đây là nguồn tham khảo và động lực thiết thực, mở ra khả năng tối ưu hóa chi phí để tự nghiên cứu, làm chủ quy trình huấn luyện LLM từ con số 0.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com