Mô hình ngôn ngữ khuếch tán liên tục (CDLM) trở lại: xu hướng mới trong nghiên cứu AI

Mô hình ngôn ngữ khuếch tán liên tục (Continuous Diffusion Language Models – CDLM) đang có dấu hiệu hồi sinh mạnh mẽ sau một thời gian tương đối yên tĩnh. Các bài báo mới và dự án nghiên cứu xuất hiện liên tiếp, cho thấy cộng đồng AI đang xem xét lại tiềm năng của cách tiếp cận này so với các mô hình tự hồi quy truyền thống.

Trong thập kỷ qua, hầu hết các LLM lớn như GPT‑3, GPT‑4 đều dựa trên kiến trúc tự hồi quy, tạo token từng bước một. Mặc dù phương pháp này cho phép huấn luyện song song hiệu quả, nhưng vẫn tồn tại những hạn chế như bias do teacher forcing và khó khăn trong các tác vụ infilling hay generation có ràng buộc. Ngay từ năm 2021, các nhà nghiên cứu đã thử áp dụng khuếch tán rời rạc (multinomial diffusion, D3PM, SUNDAE) để khắc phục một số vấn đề này.

Năm 2022, xu hướng chuyển sang khuếch tán liên tục bắt đầu nổi lên với mô hình Diffusion‑LM. Thay vì xử lý dữ liệu dạng rời rạc, mô hình này biểu diễn các token bằng vector embedding liên tục, cho phép áp dụng nhiễu Gaussian – cơ chế đã thành công rực rỡ trong tạo ảnh. Các nghiên cứu tiếp theo mở rộng ý tưởng này, cải thiện độ ổn định và chất lượng văn bản sinh ra.

Những điểm nổi bật của CDLM hiện nay:

  • Khả năng tạo văn bản song song, giảm thời gian inference.
  • Giảm exposure bias nhờ quá trình diffusion ngược.
  • Dễ dàng mở rộng cho các tác vụ infilling và constrained generation.

Với sự trở lại của CDLM, cộng đồng AI Việt Nam có cơ hội khám phá các mô hình không dựa vào tự hồi quy, tạo nền tảng cho các ứng dụng sáng tạo và tối ưu hoá chi phí tính toán. Nếu được phát triển và mở nguồn, công nghệ này có thể góp phần đa dạng hoá hệ sinh thái LLM trong nước.

Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account