
LFM2.5‑2.6B được thiết kế để chạy agent trực tiếp trên thiết bị, từ laptop cho tới smartphone, nhờ kiến trúc LFM2 tối ưu và kích thước chỉ 2.5‑2.6 B tham số. Model được tiền‑huấn luyện trên khoảng 34 T token, sau đó mở rộng cửa sổ ngữ cảnh lên 128 K và trải qua bốn giai đoạn đào tạo RL Agentic.
Quy trình RL tách riêng phần tối ưu hoá mô hình, inference và môi trường thực thi. Training Engine tối ưu trọng số, Rollout Engine sinh hành động dựa trên policy mới, trong khi Sandbox Service và Blackbox Harness quản lý tương tác với môi trường mà không cần sửa đổi mã nguồn agent.
- Benchmark: LFM2.5‑2.6B dẫn đầu trên mọi benchmark instruction‑following và hầu hết benchmark tool‑use, chỉ thua Qwen‑9.7B trong BFCLv4.
- Agentic tasks: Đánh bại Gemma và sánh ngang Qwen; kiến thức và toán học gần bằng các model lớn hơn.
- Inference CPU: 220 tok/s trên Apple M5 Max, 113 tok/s trên Ryzen AI Max+ 395.
- Inference GPU: gần 15 K tok/s trên H100, tương đương 1.3 tỷ token/ngày.
Model có sẵn trên hầu hết hệ sinh thái inference – llama.cpp, MLX, vLLM, SGLang và ONNX. Để sử dụng, chỉ cần cài đặt transformers>=5.0.0 và tải model LiquidAI/LFM2.5-2.6B như sau:
from transformers import AutoModelForCausalLM, AutoTokenizer model_id = "LiquidAI/LFM2.5-2.6B" model = AutoModelForCausalLM.from_pretrained(model_id, device_map="auto", dtype="bfloat16") tokenizer = AutoTokenizer.from_pretrained(model_id)
Với khả năng chạy agent mạnh mẽ trên phần cứng tiêu chuẩn, LFM2.5‑2.6B hứa hẹn mở rộng việc triển khai AI tự động hoá trong các doanh nghiệp và dự án nghiên cứu tại Việt Nam mà không cần chi phí cloud cao.
Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com