
Liquid AI chính thức giới thiệu các checkpoint Q4_0 GGUF mới cho dòng mô hình LFM2.5, bao gồm các phiên bản 230M, 350M, 1.2B và 2.6B. Điểm đột phá của đợt phát hành này là việc sử dụng kỹ thuật Quantization-Aware Distillation (QAD), cho phép nén mô hình xuống định dạng 4-bit mà không làm suy giảm chất lượng đáng kể như các phương pháp nén truyền thống.
Kết quả kiểm thử trên các bộ benchmark khắt khe như MMLU-Pro, IFEval và BFCLv4 cho thấy các mô hình QAD giữ được từ 96.5% đến 97.4% hiệu suất so với bản gốc BF16. Đặc biệt, các phiên bản 230M và 350M đạt chất lượng tương đương với chuẩn Q5_K_M nhưng với tốc độ giải mã (decode throughput) nhanh hơn từ 4-33% trên các thiết bị từ MacBook Pro đến Raspberry Pi 5.
- Tối ưu hóa mạnh mẽ cho cả GPU và CPU Arm.
- Đạt hiệu suất cao hơn các phương pháp post-training quantization (PTQ) thông thường.
- Hỗ trợ triển khai linh hoạt trên các thiết bị Edge mà không cần phần cứng chuyên dụng đắt tiền.
Việc tối ưu hóa các mô hình ngôn ngữ nhỏ (SLM) để chạy mượt mà trên thiết bị cá nhân là bước tiến quan trọng cho cộng đồng AI Việt Nam. Điều này mở ra cơ hội lớn cho các nhà phát triển trong nước xây dựng các ứng dụng AI riêng tư, hoạt động offline mà không phụ thuộc vào cloud, giúp tiết kiệm chi phí vận hành và tăng cường bảo mật dữ liệu người dùng.
Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com