Nvidia tinh chỉnh thành công mô hình Nemotron đạt huy chương vàng IMO và IOI

Các nhà nghiên cứu đã chứng minh tính hiệu quả của dòng mô hình nền tảng Nemotron 3 khi tinh chỉnh thành công hai hệ thống đạt thành tích tương đương huy chương vàng tại Kỳ thi Olympiad Tin học Quốc tế (IOI) và Olympiad Toán học Quốc tế (IMO). Thay vì xây dựng lại mô hình từ đầu, đội ngũ phát triển đã sử dụng phương pháp tinh chỉnh có giám sát (SFT) kết hợp học tăng cường (RL) để tối ưu hóa cho từng lĩnh vực chuyên sâu.

Ở nội dung lập trình thi đấu IOI, mô hình Nemotron-3-Ultra-CC với 550 tỷ tham số đạt 535,4 trên 600 điểm nhờ chiến lược GenCorrect giúp tự động phát sinh, đánh giá và sửa lỗi mã nguồn theo chu trình. Đối với nội dung toán học IMO, mô hình được huấn luyện trên tập dữ liệu SFT gồm hơn 414.000 ví dụ minh họa lập luận đa bước, giúp AI không chỉ đưa ra đáp án cuối cùng mà còn biết xây dựng lời giải bài toán chặt chẽ, phát hiện lỗ hổng logic và tự phản hồi phản biện.

Kết quả này khẳng định rằng một mô hình nền tảng đủ mạnh có thể thích ứng xuất sắc với các nhiệm vụ học thuật phức tạp thông qua quy trình hậu huấn luyện chuẩn hóa. Đây là nguồn thông tin tham khảo giá trị cho các nhóm nghiên cứu và kỹ sư AI tại Việt Nam trong việc áp dụng SFT và RL để chuyên môn hóa các LLM mã nguồn mở cho các bài toán đặc thù của doanh nghiệp.

Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account