
Các nhà nghiên cứu tại Hugging Face vừa công bố phương pháp nén mô hình ngôn ngữ lớn (LLM) mới bằng kỹ thuật cắt tỉa chiều sâu (depth pruning/block removal). Bài báo khoa học đã biến bài toán lựa chọn block cần xóa thành bài toán tối ưu nhị phân có điều kiện (CBO), ánh xạ trực tiếp lên mô hình thủy tinh Ising (Ising glass) trong vật lý thống kê.
Khác với các phương pháp cũ chỉ đánh giá từng block độc lập, nghiên cứu này tính đến sự tương tác cặp (pairwise couplings) giữa các block với nhau bằng cách sử dụng khai triển Taylor bậc hai trên hàm mất mát của mô hình để tạo ma trận Hessian. Việc tính toán chính xác mối liên hệ phụ thuộc này giúp loại bỏ nhiều block cùng lúc mà không làm suy giảm nghiêm trọng năng lực của mô hình.
Kết quả thử nghiệm đạt hiệu suất vượt trội trong kịch bản nén sâu:
- Hiệu năng ấn tượng: Khi nén 50% mô hình Llama-3.3-70B-Instruct, phương pháp này đạt điểm số MMLU cao hơn tới gần 23 điểm phần trăm so với phương pháp cắt tỉa block tốt nhất hiện nay.
- Tối ưu phần cứng: Giảm đáng kể dung lượng RAM tiêu thụ và tăng tốc độ suy luận (inference) đáng kể.
Đột phá nghiên cứu này mang lại ý nghĩa lớn cho cộng đồng nghiên cứu và triển khai AI tại Việt Nam, giúp tối ưu hóa các LLM mã nguồn mở kích thước lớn để chạy hiệu quả trên hạ tầng phần cứng giới hạn.
Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com