Engine nội bộ chạy DeepSeek V4 Flash, PRO trên Metal, CUDA và ROCm

DwarfStar là một engine inference nhỏ gọn, được viết bằng ngôn ngữ C và tối ưu đầu tiên cho DeepSeek V4 Flash. Ngoài ra, nó còn hỗ trợ DeepSeek V4 PRO trên các máy có bộ nhớ lớn và GLM 5.2. Repository hiện có 20.379 sao+384 sao hôm nay, chứng tỏ sự quan tâm mạnh mẽ của cộng đồng AI.

Engine không phải là một trình chạy GGUF đa năng mà chỉ tập trung vào các mô hình DeepSeek V4 và GLM 5.2 đã được kiểm chứng. Nó cung cấp các bản quantization 2‑bit với cấu trúc bất đối xứng: các chuyên gia MoE được quantize ở mức IQ2_XXS, còn phần còn lại giữ nguyên để bảo đảm chất lượng. Người dùng có thể tải các mô hình qua các script như download_model.sh q2-imatrix (dành cho máy 96‑128 GB RAM) hoặc download_model.sh pro-q4-layers00-30 (cho workstation 512 GB RAM).

Dự án dựa trên llama.cppGGML, và giữ lại một số thành phần mã nguồn dưới giấy phép MIT, bao gồm các layout GGUF và một số kernel CPU. Mặc dù hiện đang ở trạng thái beta, mỗi bản phát hành đều trải qua quy trình QA nghiêm ngặt, tuy nhiên vẫn có khả năng gặp một số bất ổn.

Với khả năng chạy nhanh trên Metal, CUDAROCm, DwarfStar mở ra cơ hội cho các nhà phát triển và nhà nghiên cứu Việt Nam triển khai mô hình LLM lớn trên máy cá nhân mà không cần phụ thuộc vào dịch vụ đám mây. Điều này giúp giảm chi phí, tăng tính tự chủ và thúc đẩy sự phát triển của hệ sinh thái AI mở tại Việt Nam.

Nguồn: GitHub Trending — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account