
Microsoft vừa chính thức phát hành bộ đánh giá ThinkingBox trên nền tảng Hugging Face, mang đến một phương pháp thử nghiệm mới cho các hệ thống agent AI. Thay vì chỉ kiểm tra câu trả lời văn bản hay các lệnh gọi công cụ (tool call), ThinkingBox đánh giá agent dựa trên trạng thái cơ sở dữ liệu cuối cùng và các hiệu ứng phụ (side effects) mà agent để lại trên hệ thống backend sau khi thực thi 507 quy trình công việc thực tế.
Nghiên cứu trên 121.680 lượt thử nghiệm thuộc 12 model LLM cho thấy khoảng cách lớn giữa phản hồi của AI và thực tế dữ liệu. Trong số 79.853 lượt thử nghiệm thất bại khi kiểm tra thực thi, có đến 67,24% trường hợp agent kết thúc tác vụ trơn tru và không báo lỗi, nhưng kiểm tra cơ sở dữ liệu lại phát hiện 77,61% bị sai giá trị trường dữ liệu, 43,30% tạo ra tác động thừa không mong muốn và 25,36% bỏ sót thao tác bắt buộc. Mỗi nhiệm vụ đều được chạy độc lập 20 lần để đo lường độ ổn định thực sự thay vì chỉ tính điểm một lần duy nhất.
ThinkingBox mang lại góc nhìn quan trọng cho các kỹ sư AI tại Việt Nam khi phát triển ứng dụng agent doanh nghiệp. Bộ công cụ khẳng định độ chính xác của cơ sở dữ liệu và sự nhất quán của hệ thống backend mới là thước đo cốt lõi để năng lực agent được tin tưởng đưa vào vận hành thực tế.
Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com