
Nhóm nghiên cứu đứng sau dự án LingBot-Map vừa chính thức chia sẻ mã nguồn mô hình Geometric Context Transformer dành cho tác vụ tái tạo không gian 3D dạng luồng (Streaming 3D Reconstruction). Đây là công trình được đánh giá là ứng viên sáng giá cho giải thưởng Bài báo xuất sắc nhất (Best Paper Award Candidate) tại hội nghị thị giác máy tính danh giá ECCV 2026.
LingBot-Map giải quyết bài toán dựng lại đám mây điểm (point cloud) và hình học 3D từ các khung hình video liên tục mà không đòi hỏi xử lý cầu kỳ trước đó. Mô hình kết hợp kỹ thuật FlashInfer tối ưu cơ chế paged KV cache attention, cho phép xử lý mượt mà cả các chuỗi dữ liệu cực dài như video đi bộ trong nhà kéo dài 13 phút với hơn 25.000 khung hình. Người dùng có thể trực quan hóa không gian 3D tương tác ngay trên trình duyệt web thông qua công cụ viser viewer đi kèm.
Kiến trúc mới này cũng tối ưu hóa khả năng khép vòng hành trình (loop closure) và khử nhiễu môi trường như bầu trời hay đối tượng động, giúp ước tính quỹ đạo camera một cách chính xác. Các thử nghiệm trên nhiều tập dữ liệu cho thấy mô hình đạt được sự cân bằng tuyệt vời giữa hiệu năng tính toán và độ chi tiết của bản đồ 3D.
Đối với cộng đồng nghiên cứu AI và thị giác máy tính tại Việt Nam, LingBot-Map cung cấp một bộ công cụ nguồn mở mạnh mẽ để phát triển các ứng dụng trong lĩnh vực xe tự lái, robot di động và thực tế ảo (VR/AR). Việc dễ dàng cài đặt và tích hợp với PyTorch giúp các kỹ sư trong nước tiếp cận nhanh chóng với công nghệ dựng hình 3D tiên tiến nhất.
Nguồn: GitHub Trending — Biên dịch & tổng hợp: danhbaai.com