
Phòng thí nghiệm AI PrismML vừa chính thức ra mắt Bonsai 2 27B, mẫu LLM mới nhất trong dòng sản phẩm nén mô hình của họ. Model này nén thành công Qwen 3.8 27B – một mô hình mã nguồn mở phổ biến từ Alibaba – xuống dung tích chỉ 5.9 GB, tương đương mức giảm dung lượng bộ nhớ từ 9 đến 10 lần so với bản gốc.
Được thành lập bởi nhóm các nhà nghiên cứu từ Caltech và dẫn dắt bởi GS. Babak Hassibi, PrismML ứng dụng kỹ thuật nén lượng tử gọi là “weights ba giá trị” (ternary weights), đơn giản hóa các tham số từ 16 bit xuống chỉ còn ba giá trị +1, -1 hoặc 0. Nhờ vậy, Bonsai 2 27B có kích thước đủ nhỏ gọn để chạy trực tiếp trên các dòng PC phổ thông và smartphone cao cấp mà gần như không suy giảm hiệu năng, đạt tới 98% điểm số chuẩn (benchmark) so với mô hình gốc.
Thành tựu này mở ra hướng đi mới cho công nghệ Edge AI, giúp việc triển khai các LLM có khả năng suy luận mạnh mẽ trở nên khả thi trên các thiết bị phần cứng cá nhân có tài nguyên hạn chế. Startup này hiện đặt mục tiêu tiếp tục áp dụng kỹ thuật nén tương tự lên các mô hình có quy mô hàng trăm tỷ tham số trong thời gian tới.
Công nghệ nén model đột phá này mang lại ý nghĩa thiết thực cho cộng đồng phát triển AI tại Việt Nam, đặc biệt là các doanh nghiệp muốn tự chủ triển khai ứng dụng AI cục bộ (on-premise) trên thiết bị phần cứng tiết kiệm chi phí. Việc đưa các model suy luận lớn chạy mượt mà trên thiết bị cá nhân sẽ giúp giải quyết bài toán bảo mật dữ liệu và hạ tầng GPU đắt đỏ.
Nguồn: TechCrunch — Biên dịch & tổng hợp: danhbaai.com