
Một thử nghiệm đánh giá độc lập vừa công bố kết quả so sánh hiệu năng giữa mô hình GPT-6 Astra từ OpenAI với Claude Fable 5 và Fable 5.1 trong bài kiểm tra điều khiển cánh tay robot YAM. Thông qua chính sách agent Inspect Robots, các mô hình được thử thách qua hai bài kiểm tra thao tác vật lý thực tế.
Trong nhiệm vụ gắp khối tròn thả vào bát, GPT-6 Astra thể hiện sự vượt trội tuyệt đối khi hoàn thành 19 trên 20 lần thử. Để so sánh, Claude Fable 5.1 chỉ đạt 8/20 lần và Fable 5 đạt vỏn vẹn 1/20 lần. Không chỉ đạt độ chính xác cao hơn, GPT-6 Astra còn rút ngắn thời gian xử lý xuống còn 2,5 phút mỗi lần thử (so với 6,8 phút của Fable 5.1), đồng thời giảm chi phí vận hành xuống 0,94 USD/lượt so với 2,12 USD của đối thủ.
Dù vậy, thử nghiệm ghép mảnh đố vào rãnh lại mang đến bài toán hóc chuẩn hơn cho cả hai bên. Cả GPT-6 Astra và Fable 5.1 đều chỉ hoàn thành thành công 2 trên 20 lần thử và cùng bị khựng lại ở giai đoạn lắp ghép cuối cùng. Tuy nhiên, Astra vẫn tối ưu về mặt chi phí với 1,36 USD cho mỗi lượt chạy so với 2,18 USD của Fable 5.1.
Kết quả từ thử nghiệm này minh chứng cho bước tiến nhanh chóng của các agent AI trong lĩnh vực điều khiển thiết bị phần cứng thực tế. Đối với cộng đồng nghiên cứu robotics và AI tại Việt Nam, sự cải thiện về cả hiệu suất lẫn chi phí vận hành này cho thấy tiềm năng thương mại hóa rộng rãi của các hệ thống tự động hóa thông minh trong tương lai không xa.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com