
AirLLM là thư viện Python mới cho phép thực hiện inference các mô hình ngôn ngữ lớn (LLM) trên một card GPU chỉ 4GB, mà không cần áp dụng các kỹ thuật giảm kích thước như quantization, distillation hay pruning.
Nhờ cơ chế sparse MoE streaming, AirLLM chỉ tải một expert tại một thời điểm, giảm tải bộ nhớ VRAM xuống mức chỉ vài gigabyte. Với phiên bản 3.0, thư viện hỗ trợ FP8 và cho phép chạy DeepSeek‑V3 (671B) trên khoảng 12GB, Qwen3‑235B trên ~3GB, và thậm chí Kimi K3 (2.8T) trên 3.72GB VRAM của RTX 6000 Ada. Để sử dụng, người dùng chỉ cần cài đặt pip install airllm và khởi tạo AutoModel.from_pretrained với ID mô hình trên HuggingFace.
AirLLM còn tích hợp các tính năng mới như hỗ trợ CPU inference, prefetching để tăng tốc 10 %, và tự động phát hiện loại mô hình. Các yêu cầu phần mềm bao gồm compressed-tensors, flash-attn, CUDA 12 và Transformers 4.56.x. Tài liệu chi tiết và notebook mẫu được cung cấp để người dùng nhanh chóng thử nghiệm.
Với khả năng chạy các mô hình khổng lồ trên phần cứng tiêu chuẩn, AirLLM mở ra cơ hội cho các nhà nghiên cứu và doanh nghiệp Việt Nam tiếp cận công nghệ LLM tiên tiến mà không cần đầu tư hạ tầng GPU đắt tiền.
Nguồn: GitHub Trending — Biên dịch & tổng hợp: danhbaai.com