Nvidia khẳng định ‘harness’ – khung hỗ trợ – là yếu tố quyết định cho AI agent

Vào thứ Sáu tuần qua, Nvidia công bố một nghiên cứu mới cho thấy “harness” – khung hỗ trợ xung quanh mô hình – là yếu tố quyết định khi biến một LLM thành một AI agent thực thụ. Bằng cách tùy chỉnh harness để quản lý bộ nhớ và thêm một thành phần “supervisor” giống như CEO, nhóm nghiên cứu đã đưa Claude Opus 5 lên 100 % điểm trên benchmark tương tác ARC‑AGI‑3.

Không có harness, Claude Opus 5 chỉ đạt 30 % – mức cao nhất trong số các mô hình được thử nghiệm. Điều này chứng tỏ rằng, dù mô hình gốc mạnh mẽ, nếu không có một khung hỗ trợ thích hợp, agent sẽ khó thực hiện các nhiệm vụ dài hạn mà không “lạc lối”.

Benchmark ARC‑AGI‑3 bao gồm một loạt các trò chơi 2‑D không có hướng dẫn, yêu cầu agent phải tự khám phá luật chơi và chiến thắng. Đạt 100 % đồng nghĩa với việc agent có thể suy luận và hành động như con người. Nvidia cũng lưu ý rằng OpenAI đã thử nghiệm tương tự và chỉ cải thiện gấp ba lần khi điều chỉnh một vài thiết lập trong harness, vẫn chưa đạt được kết quả tuyệt đối.

Những phát hiện này mở ra một hướng đi mới cho cộng đồng AI Việt Nam: thay vì chỉ tập trung vào việc cải thiện mô hình, các nhà phát triển nên đầu tư vào việc xây dựng và tối ưu hoá harness, bao gồm bộ nhớ, ngữ cảnh và cơ chế giám sát, để tạo ra các agent thực sự ổn định và hiệu quả trong các dự án thực tiễn.

Nguồn: TechCrunch — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account