Sentence Transformers v6.0 hỗ trợ mô hình embedding đa vector

Sentence Transformers v6.0 vừa ra mắt với một tính năng mới quan trọng: hỗ trợ mô hình embedding đa vector (MultiVectorEncoder). Thư viện Python này, vốn được sử dụng rộng rãi cho các ứng dụng như tìm kiếm ngữ nghĩa và RAG (Retrieval-Augmented Generation), giờ đây có thể tải trực tiếp các checkpoint từ PyLate và Stanford-NLP ColBERT, cũng như các model colpali-engine用于 truy xuất tài liệu hình ảnh.

Sự khác biệt cốt lõi nằm ở cách xử lý thông tin. Một mô hình embedding dày đặc (dense embedding) thông thường nén toàn bộ văn bản thành một vector duy nhất. Điều này có thể làm mất thông tin chi tiết về token. Mô hình đa vector, còn gọi là mô hình “tương tác muộn”, giữ lại một vector cho mỗi token. Ví dụ, một tài liệu 9 token sẽ thành một ma trận 9×128 thay vì một vector 1×128. Khi chấm điểm, kỹ thuật MaxSim so sánh từng token trong truy vấn với tất cả token trong tài liệu, giúp nắm bắt thông tin tương thích ở cấp độ token một cách chính xác hơn.

Kỹ thuật này đặc biệt hiệu quả cho việc truy xuất tài liệu hình ảnh, nơi văn bản truy vấn được so sánh trực tiếp với hình ảnh trang mà không cần bước OCR trung gian. Mặc dù chỉ số index lớn hơn, nhưng hiệu quả retrieval được cải thiện đáng kể. Việc tích hợp vào API quen thuộc của Sentence Transformers giúp việc áp dụng kỹ thuật mới này trở nên dễ dàng hơn cho các nhà phát triển.

Với việc hỗ trợ đa vector embedding, Sentence Transformers v6.0 cung cấp một công cụ mạnh mẽ hơn để xây dựng các hệ thống tìm kiếm thông tin chính xác hơn, đặc biệt trong bối cảnh các ứng dụng AI ngày càng đòi hỏi khả năng truy xuất ngữ cảnh chi tiết và phức tạp.

Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account