ProvenanceGuard: Xác minh nguồn gốc thông tin cho AI agent dùng MCP

Một nghiên cứu mới công bố trên Hugging Face giới thiệu ProvenanceGuard — lớp xác minh hậu sinh (post-generation verification) giúp kiểm tra xem các LLM agent sử dụng Model Context Protocol (MCP) có trích dẫn đúng nguồn thông tin hay không. Đây là bước tiến quan trọng so với các hệ thống kiểm tra tính chính xác truyền thống như RAGAS, MiniCheck hay AlignScore vốn chỉ gộp chung toàn bộ bằng chứng mà không phân biệt nguồn.

Vấn đề cốt lõi mà ProvenanceGuard giải quyết được gọi là cross-source conflation (nhầm lẫn chéo nguồn): một thông tin có thể đúng trong tập bằng chứng tổng hợp, nhưng bị gán sai nguồn. Ví dụ, một agent hỗ trợ khách hàng trả lời “theo hồ sơ tài khoản, gói này có chính sách hoàn tiền 30 ngày” — trong khi thông tin hoàn tiền thực tế nằm trong tài liệu chính sách chứ không phải hồ sơ tài khoản. Trong lĩnh vực y tế, sai nguồn có thể nguy hiểm không kém sai sự thật.

ProvenanceGuard hoạt động qua 5 bước tuần tự:

  • Phân tách câu trả lời thành các claim cụ thể
  • Tìm nguồn MCP liên quan nhất cho mỗi claim
  • Kiểm tra nguồn đó có hỗ trợ claim không
  • So sánh nguồn thực tế với nguồn mà câu trả lời trích dẫn
  • Đưa ra phán quyết cho từng claim và quyết định cho phép hoặc chặn toàn bộ câu trả lời

Hệ thống hoạt động như một lớp bọc bên ngoài agent, đọc trace MCP mà không cần huấn luyện lại model. Các câu trả lời bị chặn có thể được sửa chữa theo phương pháp RARR rồi xác minh lại.

Với xu hướng agent AI ngày càng tích hợp nhiều công cụ qua MCP, ProvenanceGuard mở ra hướng tiếp cận quan trọng để đảm bảo độ tin cậy — đặc biệt hữu ích cho các ứng dụng agent trong tài chính, y tế và dịch vụ khách hàng tại Việt Nam.

Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account