
Hugging Face vừa công bố tích hợp hỗ trợ chạy các model định dạng GGUF — định dạng phổ biến nhất của llama.cpp — trực tiếp trong thư viện Transformers. Với bản cập nhật này, người dùng có thể load các checkpoint GGUF từ Hugging Face Hub bằng API from_pretrained quen thuộc và bắt đầu generate ngay trên máy cá nhân mà không cần cấu hình phức tạp.
GGUF là định dạng do đội ngũ llama.cpp phát triển, được sử dụng rộng rãi trong các công cụ inference cục bộ như Ollama, LM Studio và Jan. Trên Hub, các nhà phát hành như Unsloth, LM Studio Community và bartowski cung cấp sẵn checkpoint GGUF ở nhiều mức quantization khác nhau, giúp người dùng chọn phiên bản phù hợp với cấu hình máy. Các model GGUF đã được tải xuống hàng triệu lần trên nền tảng này.
Để đạt hiệu năng gần với llama.cpp gốc, Hugging Face tái sử dụng các ggml kernel thông qua thư viện kernels và tối ưu overhead trong quá trình generate. Trọng tâm ban đầu là inference trên Apple Silicon, bắt đầu với kiến trúc Qwen3.5. Khi weights được giữ nguyên dạng packed trên Metal, Transformers tự động load các kernel ggml/Metal tương thích và sử dụng ggml-org/ggml-attn làm attention implementation.
Về quantization, đội ngũ khuyến nghị bắt đầu với Q4_K_M — biến thể kết hợp chủ yếu weight 4-bit nhưng giữ các tensor nhạy cảm ở precision cao hơn. Nếu máy có nhiều RAM hơn, có thể thử Q5_K_M hoặc Q6_K. Việc cài đặt chỉ cần một dòng lệnh pip install và load model bằng tham số gguf_file trong from_pretrained, mọi thao tác sau đó hoàn toàn theo API chuẩn của Transformers.
Đây là bước tiến quan trọng giúp thu hẹp khoảng cách giữa hệ sinh thái llama.cpp và Transformers, mang lại sự tiện lợi lớn cho cộng đồng AI Việt Nam — đặc biệt những ai đang chạy model trên laptop cá nhân mà vẫn muốn tận dụng toàn bộ pipeline quen thuộc của Hugging Face.
Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com