
Dòng mô hình mã hóa mã nguồn mở NeoMME vừa chính thức ra mắt trên Hugging Face với hai phiên bản 260M và 800M tham số. Không giống các mô hình ngôn ngữ thị giác (VLM) truyền thống phải kết hợp bộ mã hóa hình ảnh riêng biệt với mô hình ngôn ngữ nhân quả, NeoMME sử dụng một kiến trúc Transformer hai chiều duy nhất để xử lý trực tiếp cả chuỗi văn bản và các mảnh ảnh (image patches).
Mô hình được huấn luyện từ đầu bằng mục tiêu khuếch tán ẩn khẩu trang (masked discrete-diffusion) trên tập dữ liệu 524 tỷ token đa ngôn ngữ, mã nguồn và hình ảnh tài liệu. Khi tinh chỉnh cho tác vụ truy vấn tài liệu thị giác theo phương pháp ColPali, NeoMME đạt hiệu năng vượt trội trên tiêu chuẩn ViDoRe v3. Phiên bản 260M có khả năng mã hóa khoảng 51 trang tài liệu mỗi giây trên GPU NVIDIA L40S ở độ phân giải 2048×2048, nhanh gấp đôi so với ColModernVBERT. Thêm vào đó, kỹ thuật gộp token phân cấp và định lượng bất đối xứng giúp giảm dung lượng lưu trữ chỉ số từ 1,5 MB xuống chỉ còn 6 kB mỗi trang (giảm 255 lần) nhưng vẫn giữ được hơn 95% độ chính xác tìm kiếm.
Toàn bộ trọng số của NeoMME được phát hành miễn phí theo giấy phép Apache 2.0. Đây là công cụ đắc lực cho các nhà phát triển tại Việt Nam muốn xây dựng các hệ thống tìm kiếm tài liệu thông minh (RAG) đa ngôn ngữ, tối ưu hóa bộ nhớ và chi phí phần cứng khi triển khai thực tế.
Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com