
Một nghiên cứu mới mang tên Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs giới thiệu Quantization-Aware Healing (QAH), phương pháp phục hồi năng lực cho LLM đã bị nén cấu trúc và lượng tử hóa. Với GPT-OSS 120B được nén xuống 60B tham số rồi chuyển sang MXFP4, model 4-bit tạo ra bằng QAH vượt phiên bản bfloat16 của kiến trúc đã nén trên 7 trong 9 benchmark.
Quy trình triển khai LLM hiệu quả thường gồm ba bước: loại bỏ layer, attention head hoặc neuron để giảm số tham số; lượng tử hóa trọng số xuống 4-bit; sau đó “healing” nhằm khôi phục năng lực suy luận, toán học và sinh code. Cách phổ biến là quantization-aware training (QAT), đưa fake-quantization vào forward pass rồi tiếp tục fine-tuning theo task loss. Tuy nhiên, phương án này phải lặp lại quá trình post-training tốn kém như supervised fine-tuning, RLHF và agentic tuning trong điều kiện số học nhiễu hơn, đồng thời có thể mất ổn định nếu huấn luyện quá lâu.
Quantization-aware distillation (QAD) nhẹ hơn khi dùng KL-divergence để truyền output logits từ teacher full-precision sang student đã lượng tử hóa. Nhưng sau nén cấu trúc, không tồn tại một model full-precision được huấn luyện độc lập có cùng kiến trúc nhỏ hơn. Nếu dùng checkpoint bfloat16 đã phục hồi làm teacher, student sẽ bị giới hạn bởi chất lượng của chính checkpoint trung gian này.
QAH thay đổi điểm đó bằng cách distill trực tiếp từ model gốc trước khi nén, dù teacher và student không cùng kiến trúc. Kết quả cho thấy model 4-bit có thể đồng thời nhỏ hơn, rẻ hơn khi vận hành và chính xác hơn checkpoint dùng làm điểm xuất phát cho lượng tử hóa. Đây là hướng đáng chú ý với cộng đồng open-weight và các nhóm AI Việt Nam cần tối ưu LLM cho GPU có bộ nhớ hạn chế.
Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com