LFM2.5 DSpark tăng tốc suy luận tới 3,2× cho các mô hình 1,2B‑2,6B‑8B

LiquidAI hôm nay phát hành các checkpoint mô hình dự thảo DSpark cho ba mô hình trong họ LFM2.5: LFM2.5-1.2B-Instruct, LFM2.5-2.6B và LFM2.5-8B-A1B. Các mô hình dự thảo này có khoảng 300 triệu tham số và được huấn luyện 15 epoch trên tập dữ liệu đa dạng bao gồm SFT, chat, code và function‑calling.

Speculative decoding hoạt động bằng cách để mô hình dự thảo tạo ra các token ứng cử, sau đó mô hình mục tiêu xác nhận chúng trong một lần forward, giảm tải việc tải trọng trọng lượng từ DRAM sang SRAM. Khi token bị từ chối, mô hình mục tiêu sẽ thay thế bằng token của mình, do đó chuỗi đầu ra hoàn toàn giống với greedy decoding truyền thống và không làm giảm độ chính xác (pass@1 hay exact match).

Thử nghiệm trên MacBook Pro M4 Max (Metal, FP16 GGUF) và GPU H100 80 GB (BF16, SGLang) cho thấy:

  • Đối với LFM2.5‑2.6B, tốc độ tăng tới ~140 token/giây, giảm độ trễ 57 % trung bình.
  • LFM2.5‑1.2B‑Instruct đạt tốc độ tăng 52 % tùy dữ liệu.
  • LFM2.5‑8B‑A1B chỉ cải thiện 18 % trên thiết bị do hạn chế của MoE trong backend Metal.

DSpark được tích hợp ngay từ ngày đầu với llama.cpp và SGLang, cho phép người dùng khởi chạy mô hình bằng lệnh Python đơn giản. Đối với cộng đồng AI Việt Nam, việc có sẵn công cụ tăng tốc inference mở ra khả năng triển khai mô hình LLM lớn trên máy cá nhân và máy chủ chi phí thấp, thúc đẩy nghiên cứu và ứng dụng thực tiễn.

Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account