
Mới đây, một thử nghiệm chi tiết đã được thực hiện để so sánh hiệu quả giữa hai model LLM là GPT-5.6 Luna và GPT-6 Astra trong nhiệm vụ review mã nguồn. Cụ thể, GPT-5.6 Luna có giá đầu vào chỉ 0,20 USD và đầu ra 1,20 USD cho mỗi triệu token, trong khi GPT-6 Astra đắt hơn đáng kể với mức giá lần lượt là 10 USD và 50 USD. Bài kiểm tra dựa trên 50 pull request công khai từ các dự án lớn như Sentry, Keycloak và Grafana nhằm tìm ra các lỗi về logic, bảo mật và tính đúng đắn.
Kết quả cho thấy GPT-6 Astra tìm được 92 lỗi đã được xác thực với chi phí tổng cộng 5,66 USD cho toàn bộ quá trình, trong khi GPT-5.6 Luna tìm được 69 lỗi nhưng tổng chi phí chỉ vỏn vẹn 0,20 USD – rẻ hơn tới 28 lần trên mỗi pull request. Tuy nhiên, model Luna có tỷ lệ nhận định sai cao hơn, với khoảng 1 trong 4 bình luận bị từ chối trong quá trình kiểm tra, đồng thời gặp khó khăn rõ rệt ở các phần mã nguồn bảo mật phức tạp như Keycloak.
Dù có độ chính xác thấp hơn và bỏ sót một số lỗi bảo mật quan trọng, GPT-5.6 Luna vẫn tỏ ra rất hữu ích cho việc phát hiện các lỗi logic cơ bản hằng ngày nhờ tốc độ nhanh và chi phí tối ưu. Đối với cộng đồng lập trình viên và các doanh nghiệp công nghệ tại Việt Nam, kết quả này gợi mở giải pháp tối ưu hóa ngân sách khi tích hợp AI vào quy trình CI/CD, giúp tiết kiệm chi phí vận hành đáng kể mà vẫn đảm bảo chất lượng mã nguồn ở mức chấp nhận được.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com