LFM2.5‑VL‑3B: Mô hình thị giác‑ngôn ngữ nhanh, mạnh, chạy trên thiết bị

LFM2.5‑VL‑3B là phiên bản mạnh nhất trong dòng vision‑language của LiquidAI, được thiết kế để chạy trực tiếp trên phần cứng người dùng. Model kết hợp encoder SigLIP2 400M NaFlex với backbone văn bản LFM2.5‑2.6B, được tiền‑huấn luyện trên khoảng 34 tỷ token, bao gồm 4 lần dữ liệu hình ảnh hơn so với phiên bản trước.

Quá trình huấn luyện gồm hai giai đoạn: Supervised Fine‑Tuning (SFT) với kiến thức được truyền từ teacher model lớn hơn và Multi‑reward Reinforcement Learning. Nhờ mở rộng từ điển lên 128 K ký tự, mô hình hỗ trợ tốt các ngôn ngữ không Latin. Kết quả benchmark cho thấy LFM2.5‑VL‑3B dẫn đầu lớp kích thước trên các nhiệm vụ thực tế như hiểu tài liệu, nhận diện đối tượng, và đọc màn hình UI.

Về hiệu năng, model đạt tốc độ giải mã 228 token/s trên M5 Max và 116 token/s trên Ryzen AI Max+ 395, chỉ tốn khoảng 3 GB RAM. Trên GPU H100, tốc độ lên tới 11 000 token/s, gấp đôi các mô hình 4 B và nhanh hơn các mô hình 2 B, cho phép xử lý gần 1 tỷ token mỗi ngày trên một card.

Model được phát hành kèm hỗ trợ ngay ngày đầu trên các khung như llama.cpp, MLX, vLLM, SGLang và ONNX, giúp các nhà phát triển nhanh chóng tích hợp vào ứng dụng di động hoặc server nội bộ. Với khả năng chạy trên‑device và chi phí phần cứng thấp, LFM2.5‑VL‑3B mở ra cơ hội cho cộng đồng AI Việt Nam triển khai các giải pháp AI thị giác nhanh, bảo mật dữ liệu và không phụ thuộc vào đám mây.

Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account