Transformer siêu nhẹ được huấn luyện trong 1.5h, vượt qua nhiều LLM và đạt điểm tương đương TRM/HRM

Một transformer nhỏ được huấn luyện trong 1.5 giờ trên card RTX 4090 (model 5090) đã đạt điểm số tương đương TRM/HRM và vượt qua nhiều mô hình LLM lớn hơn. Tác giả cho biết đây là phiên bản nâng cấp của mô hình trước, với tốc độ, chất lượng và chi phí tốt hơn, đồng thời vẫn giữ mã nguồn mở.

Để cải thiện sample efficiency, tác giả đã thay đổi cách tính loss: không còn tính trên token đầu vào mà chỉ tính trên token đầu ra, biến quá trình thành dạng supervised. Kết quả cho thấy độ chính xác tăng từ 40 % lên 44 %, dù lý do chưa rõ ràng. Ngoài ra, dữ liệu huấn luyện được mở rộng bằng cách thêm các bài tập không chồng lấn từ bộ ARC‑2, sau khi lọc kỹ 773 câu hỏi trùng lặp để tránh rò rỉ dữ liệu.

Các cải tiến khác bao gồm sử dụng 3D RoPE và embedding theo nhiệm vụ, cùng optimizer mới NorMuon giúp mô hình hội tụ nhanh hơn so với AdamW. Tác giả còn đề xuất rằng chi phí có thể giảm tới 10 lần nếu viết code GPU thủ công và loại bỏ các augmentations không cần thiết.

Với mã nguồn mở, bất kỳ ai cũng có thể tải về, tùy chỉnh và thử nghiệm để nâng cao hiệu suất hoặc giảm chi phí. Điều này mở ra cơ hội cho các nhà nghiên cứu và startup AI tại Việt Nam tiếp cận công nghệ tiên tiến mà không cần đầu tư hạ tầng đắt đỏ.

Những tiến bộ này không chỉ chứng minh khả năng tối ưu hoá mẫu dữ liệu mà còn khuyến khích cộng đồng phát triển mô hình AI hiệu quả, tiết kiệm và dễ tiếp cận hơn.

Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account