
Trong cuộc đua tốc độ inference AI, Kog – một startup công nghệ của Pháp – tin rằng các GPU hiện có trong trung tâm dữ liệu vẫn còn tiềm năng chưa được khai thác hết. Công ty đã trình diễn khả năng “giải mã nhanh” trên các GPU datacenter như AMD MI300X và NVIDIA H200, đạt 3.000 token mỗi giây trên mô hình Laneformer 2B (2 tỷ tham số).
CEO Gaël Delalleau cho biết, Kog đã nhận được hơn 200 lead kinh doanh thực tế và tập trung vào các trường hợp sử dụng phần mềm kỹ thuật, nơi các nhà phát triển Claude Code thường phải chờ hàng giờ để có kết quả. Với Kog Inference Engine (KIE), thời gian chờ giảm đáng kể, giúp các công ty tăng năng suất và giảm chi phí điện năng.
Đội ngũ Kog cũng hợp tác với các đối tác thiết kế game và ứng dụng, cho phép người dùng tạo nội dung nhanh hơn nhờ tốc độ inference cao. Mặc dù hiện tại họ tập trung vào các mô hình lớn, công ty tin rằng phương pháp tối ưu phần mềm có thể áp dụng cho các LLM có quy mô lên tới hàng chục tỷ tham số.
Thành công này cho thấy phần mềm vẫn có thể “đánh bại” phần cứng trong bối cảnh GPU ngày càng mạnh mẽ với băng thông bộ nhớ cao. Nếu Kog thực hiện được lời hứa 30x nhanh hơn, cộng đồng AI Việt Nam sẽ có thêm lựa chọn để tận dụng hạ tầng GPU hiện có mà không cần đầu tư vào chip chuyên dụng.
Nguồn: TechCrunch — Biên dịch & tổng hợp: danhbaai.com