
Trong một bài viết trên Substack, Shrivu Shankar trình bày phương pháp “Incompressible Knowledge Probes” để ước tính knowledge cutoff và thời gian tiền huấn luyện của các mô hình LLM tiên tiến như GPT‑5 và Claude. Bằng cách đưa ra các câu hỏi về sự kiện ngày cụ thể, ông đo lường mức độ lỗi của mô hình theo thời gian, từ đó suy ra ngày mà dữ liệu huấn luyện ngừng cập nhật.
Đồng thời, ông sử dụng “Data Mixture Inference” để phân tích cách các token được phân tách, giúp phán đoán thành phần dữ liệu (web, sách, mã nguồn…) mà mô hình đã được huấn luyện. Kết quả cho thấy GPT‑5.4 có knowledge cutoff khớp gần với thời gian công bố của OpenAI, và xu hướng lỗi giảm dần khi mô hình dự đoán các sự kiện gần hơn.
Shankar cũng mô tả ba giai đoạn chính trong quá trình huấn luyện: pre‑training trên dữ liệu tổng quát, domain‑specific fine‑tuning với dữ liệu chất lượng cao, và cuối cùng là assistant persona để tinh chỉnh tính cách và khả năng gọi công cụ. Các giai đoạn này thường kéo dài nhiều tháng và tiêu tốn tài nguyên tính toán lớn.
Phân tích này cung cấp cho các nhà nghiên cứu và doanh nghiệp AI một công cụ để suy đoán “đằng sau màn hình” của các mô hình đen, giúp đưa ra quyết định về lựa chọn mô hình phù hợp với nhu cầu thời gian thực.
Đối với cộng đồng AI Việt Nam, việc hiểu rõ knowledge cutoff và lịch trình tiền huấn luyện giúp các nhà phát triển lựa chọn mô hình phù hợp cho các dự án yêu cầu dữ liệu cập nhật, đồng thời tăng cường khả năng kiểm chứng và minh bạch.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com