
Đội ngũ phát triển dự án Olmo vừa chính thức phát hành Olmo-core 3, bản nâng cấp lớn cho hạ tầng huấn luyện mô hình ngôn ngữ lớn (LLM) mã nguồn mở. Hệ thống này sở hữu thiết kế kiến trúc Mixture-of-Experts (MoE) cải tiến, cho phép mở rộng quy mô huấn luyện lên tới hàng nghìn tỷ tham số mà vẫn duy trì hiệu suất tính toán tối ưu.
Trong các thử nghiệm thực tế, Olmo-core 3 đã chứng minh khả năng mở rộng vượt trội. Khi mở rộng số lượng expert từ 8 lên 128 (chọn 4 expert cho mỗi token, giữ tham số kích hoạt ở mức 3,2 tỷ), tổng số tham số của mô hình tăng từ 4,6 tỷ lên 47 tỷ nhưng thông lượng huấn luyện chỉ giảm chưa đến 5%. Đáng chú ý, hệ thống đã chuyển đổi từ cơ chế FSDP sang Distributed Data Parallelism (DDP), giữ cố định các expert trên GPU để giảm chi phí truyền tải dữ liệu.
Kết quả thử nghiệm sơ bộ trên 8 GPU NVIDIA B300 cho thấy mô hình MoE 47 tỷ tham số đạt tốc độ xử lý 52.000 token/giây trên mỗi GPU, nhanh gấp 2,7 lần so với phiên bản trước (19.400 token/giây). Các điểm cải tiến cốt lõi gồm:
- Tối ưu hóa cơ chế định tuyến dữ liệu trực tiếp vào bộ đệm của expert.
- Giữ nguyên dữ liệu định tuyến trên bộ nhớ GPU nhằm giảm độ trễ tính toán.
- Hỗ trợ mở rộng hạ tầng huấn luyện vượt mốc 1.000 tỷ tham số.
Sự ra đời của Olmo-core 3 là tin vui lớn cho cộng đồng nghiên cứu AI mã nguồn mở, bao gồm các phòng nghiên cứu và doanh nghiệp tại Việt Nam. Công cụ này giúp hạ thấp chi phí phần cứng và mở ra cơ hội tự huấn luyện các mô hình MoE cỡ lớn với chi phí tối ưu hơn.
Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com