
Dự án MiniMind (Apache‑2.0) được thiết kế để hạ thấp rào cản tiếp cận LLM, cho phép người dùng tự tay huấn luyện một mô hình từ 0 mà không cần đến các mô hình hàng trăm tỷ tham số. Thời gian “2 giờ” đề cập tới giai đoạn SFT chạy 1 epoch trên một NVIDIA 3090, trong khi “3 USD” là chi phí thuê GPU thực tế.
MiniMind hỗ trợ cả pre‑training và full‑parameter fine‑tuning qua các script train_pretrain.py và train_full_sft.py. Người dùng chỉ cần tải về các tập dữ liệu pretrain_t2t_mini.jsonl và sft_t2t_mini.jsonl, sau đó khởi chạy lệnh huấn luyện. Dự án cũng tích hợp SwanLab (thay thế WandB) để theo dõi quá trình huấn luyện, đồng thời cung cấp tokenizer 6400 từ vựng phù hợp cho mô hình nhỏ.
Về triển khai, MiniMind cho phép chạy mô hình qua ollama, vllm hoặc sử dụng giao diện WebUI dựa trên Streamlit. Các mô hình được lưu dưới dạng .pth và có thể tải về từ HuggingFace hoặc ModelScope. Dự án cũng đưa ra hướng dẫn chi tiết cho môi trường CUDA, CPU hoặc MPS.
Với chi phí và thời gian huấn luyện thấp, MiniMind mở ra cơ hội cho các nhà nghiên cứu và nhà phát triển Việt Nam khám phá sâu hơn về kiến trúc LLM, thay vì chỉ dùng các mô hình đã được tinh chỉnh sẵn.
Nguồn: GitHub Trending — Biên dịch & tổng hợp: danhbaai.com