
Soup là một công cụ dòng lệnh (CLI) giúp thực hiện quá trình fine‑tune các mô hình LLM lớn chỉ bằng một file cấu hình YAML duy nhất. Với tùy chọn stream_layers: true, Soup truyền các lớp của mô hình gốc từ RAM hoặc NVMe vào GPU từng lớp một, giảm nhu cầu VRAM xuống chỉ 3.32 GB, đủ cho một laptop GPU 4 GB.
Trên một RTX 3050 Laptop 4 GB, mô hình Llama‑3.1‑8B‑Instruct + quantization NF4 đạt tốc độ 119.6 token/s, tiêu thụ 3.32 GB VRAM và cho kết quả bit‑exact so với chạy không streaming. Các thí nghiệm cũng được tái tạo trên H100, cho tốc độ 113 token/s, chứng minh tính ổn định của phương pháp. Phiên bản mới nhất v0.73.2 cải thiện cơ chế gate, tự động kiểm tra xem mô hình có thực sự cải thiện sau fine‑tune hay không.
Soup hỗ trợ Python 3.10‑3.12 và yêu cầu cài đặt pip install "soup-cli[train]" để bật tính năng training. Ngoài SFT, phiên bản 0.72.4 mở rộng hỗ trợ các loss dạng preference, cho phép thực hiện DPO mà không cần sao chép toàn bộ mô hình gốc, giảm thêm 730 MB VRAM.
Với khả năng fine‑tune mô hình 8B trên máy tính xách tay, Soup hứa hẹn giảm rào cản tài nguyên cho các nhà nghiên cứu và startup AI tại Việt Nam, giúp họ nhanh chóng thử nghiệm và triển khai mô hình mà không cần đầu tư vào máy chủ GPU cao cấp.
Nguồn: GitHub Trending — Biên dịch & tổng hợp: danhbaai.com