
Sentence Transformers – thư viện Python nổi tiếng cho embedding và reranking – vừa ra mắt phiên bản 6.0 với loại mô hình mới: MultiVectorEncoder. Loại mô hình này áp dụng kiến trúc late‑interaction kiểu ColBERT, cho phép lưu trữ một vector nhỏ cho mỗi token và tính điểm bằng phép MaxSim, mang lại khả năng khớp token‑to‑token chi tiết hơn so với mô hình dense truyền thống.
Quá trình finetune mô hình đa‑vector bao gồm các thành phần: mô hình, dataset, loss, training arguments, evaluator và trainer. Tác giả đã thực hiện một ví dụ thực tế, đào tạo mô hình multi‑vector‑encoder/mLateOn‑medical trên một GPU RTX 3090 trong 14,5 giờ, và kết quả cho thấy mô hình này vượt trội so với mọi mô hình retrieval chung – dense, sparse, lexical và thậm chí các mô hình đa‑vector khác – trên bộ đánh giá y tế.
Khác với mô hình dense chỉ nén toàn bộ văn bản thành một vector duy nhất, mô hình đa‑vector giữ lại thông tin ở mức token, giúp bảo toàn các tín hiệu tinh vi mà vector duy nhất thường bỏ qua. Nhờ vậy, khi finetune trên dữ liệu miền cụ thể (pháp lý, mã nguồn, tài liệu khoa học…), mô hình nhanh chóng nắm bắt ngôn ngữ và cách diễn đạt đặc thù, cải thiện đáng kể độ chính xác truy xuất.
Đối với cộng đồng AI Việt Nam, việc có sẵn công cụ mở nguồn để tự đào tạo mô hình đa‑vector mở ra cơ hội xây dựng các công cụ tìm kiếm nội bộ, hệ thống hỏi‑đáp chuyên ngành và các ứng dụng RAG (Retrieval‑Augmented Generation) phù hợp với dữ liệu tiếng Việt. Khi kết hợp với các vector database như Milvus hay Pinecone, các doanh nghiệp và nhà nghiên cứu có thể nhanh chóng triển khai giải pháp tìm kiếm mạnh mẽ, giảm phụ thuộc vào các mô hình nước ngoài.
Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com