
Ngày ra mắt Claude Fable 5.1, Anthropic tự tin khẳng định mô hình “đặt chuẩn mới cho lập trình, công việc tri thức và các nhiệm vụ giải quyết vấn đề dài hạn”. Đánh giá thực tế được thực hiện bằng cách yêu cầu mô hình tạo một SVG của chim bồ câu cưỡi xe đạp, đồng thời ghi lại số token, thời gian và chi phí ở mỗi mức độ suy luận.
Fable 5.1 cung cấp năm mức độ suy luận: low, medium, high, xhigh, max. Kết quả thu được:
- Low: 1 998 token, 23.8 s, 10.0 ¢ – không có đoạn suy luận hiển thị.
- Medium: 1 977 token, 23 s, 9.9 ¢ – cũng không có suy luận.
- High: (không được nêu chi tiết trong bài).
- Xhigh: 36 767 token, 7 phút 51 giây, 1.83 $ – chi tiết phong phú, thêm mắt, cánh, chân.
- Max: 65 927 token, 13 phút 54 giây, 3.30 $ – hình ảnh hoàn chỉnh với mũ xanh, giỏ cá, và các chi tiết phụ.
So với các benchmark, Fable 5.1 đạt 52.6 % trên Terminal‑Bench‑Science 0.1, vượt xa các phiên bản trước và các đối thủ như Opus 5 hay GPT‑5.6. Tuy chưa đạt mức “flair” của Gemini 3.7 Flash, nhưng mô hình đã cung cấp SVG chính xác theo yêu cầu, chứng tỏ khả năng tạo nội dung đồ họa chi tiết.
Đối với cộng đồng lập trình viên và nhà sáng tạo nội dung tại Việt Nam, việc có thể điều chỉnh mức độ suy luận giúp cân bằng giữa chi phí và chất lượng đầu ra, mở ra cơ hội sử dụng AI cho thiết kế đồ họa nhanh chóng mà không cần đầu tư vào phần mềm chuyên nghiệp.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com