
Một nhóm nhà phát triển đã công bố phương pháp huấn luyện mô hình ngôn ngữ (LLM) để tạo hình ảnh nghệ thuật bằng cách viết mã thay vì sử dụng prompt thông thường, giải quyết hạn chế về khả năng chỉnh sửa chi tiết của các công cụ tạo ảnh AI hiện có.
Theo đó, khi nhận prompt yêu cầu vẽ một bông hoa phù hợp với phong cách nhất định, mô hình sẽ viết mã JavaScript hoàn chỉnh bằng thư viện p5.brush, sau đó mã được chạy trong môi trường Puppeteer cách ly để tạo ra file PNG. Điểm khác biệt là kết quả đầu ra là mã có thể chỉnh sửa trực tiếp, giúp người dùng điều chỉnh chi tiết từng phần của hình ảnh mà không cần viết lại prompt từ đầu.
Để áp dụng học tăng cường (RL) cho tác vụ sáng tạo có tính thẩm mỹ, nhóm đã giải quyết bài toán đánh giá chất lượng bằng cách thay thế thang điểm tuyệt đối bằng đánh giá đôi: mô hình trọng tài sẽ so sánh kết quả tạo ra với hai hình ảnh tham khảo được chọn ngẫu nhiên từ bộ dữ liệu 1.664 hình đã được con người đánh giá trước, chọn ra hình phù hợp hơn với prompt và phong cách yêu cầu. Trước đó, họ từng thử rubric đánh giá với 9 tiêu chí khác nhau nhưng mô hình bị bão hòa phần thưởng và không cải thiện chất lượng, do nhiều tiêu chí đo lường cùng một yếu tố.
Phương pháp này mở ra hướng phát triển mới cho các công cụ tạo ảnh AI linh hoạt hơn, đặc biệt phù hợp với các nhà thiết kế cần kiểm soát chi tiết kết quả. Đối với cộng đồng AI Việt Nam, nghiên cứu này cũng gợi mở hướng áp dụng học tăng cường cho các tác vụ sáng tạo thẩm mỹ mà trước đây thường gặp khó khăn về việc xây dựng hàm phần thưởng đáng tin cậy.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com