DeepSeek ra mắt DeepGEMM: Thư viện CUDA kernel hiệu năng cao cho tính toán LLM trên GPU

Nhóm nghiên cứu DeepSeek vừa phát hành DeepGEMM, một thư viện CUDA kernel hiệu năng cao giúp hợp nhất các phép tính cốt lõi trong các mô hình ngôn ngữ lớn (LLM) hiện đại. Thư viện này hỗ trợ các toán tử quan trọng như GEMM (FP8, FP4, BF16), MoE kết hợp truyền thông (Mega MoE), và tính điểm MQA cho bộ chỉ mục Lightning Indexer. Điểm đặc biệt của DeepGEMM là tất cả kernel đều được biên dịch tại thời điểm chạy (runtime) thông qua DeepJIT, loại bỏ hoàn toàn bước biên dịch CUDA phức tạp khi cài đặt.

Thiết kế của DeepGEMM kế thừa một số khái niệm từ CUTLASS và CuTe nhưng tối giản hóa các khuôn mẫu (template) rườm rà. Thư viện tập trung vào số lượng hàm kernel nòng cốt hạn chế, giúp các kỹ sư dễ dàng tiếp cận và học hỏi kỹ thuật tối ưu hóa GPU trên kiến trúc NVIDIA (từ SM90 đến SM100). Dù có thiết kế siêu nhẹ, hiệu năng của DeepGEMM vẫn tương đương hoặc vượt qua các thư viện được tinh chỉnh thủ công trên nhiều kích thước ma trận khác nhau.

Đáng chú ý, DeepGEMM được thiết kế riêng cho các kịch bản thực tế của mô hình MoE (Mixture-of-Experts), cho phép gom nhóm trục M (M-axis grouped GEMM) để xử lý hiệu quả số lượng token biến động giữa các chuyên gia trong quá trình huấn luyện và suy luận. Thư viện cũng hỗ trợ masked grouped GEMM cho giai đoạn suy luận decoding khi kết hợp với CUDA graph, giúp tối ưu hóa độ trễ tính toán.

Đối với cộng đồng phát triển AI và các kỹ sư tối ưu hóa phần mềm tại Việt Nam, DeepGEMM là nguồn tài liệu mã nguồn mở vô cùng giá trị. Việc DeepSeek chia sẻ công nghệ tối ưu phần cứng hạ tầng giúp các nhóm nghiên cứu trong nước dễ dàng tiếp cận các kỹ thuật tăng tốc tính toán GPU tiên tiến mà không tốn chi phí tài nguyên lớn.

Nguồn: GitHub Trending — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account