
Trong thời gian gần đây, Intel đã đưa ra một quan điểm mới về việc phân chia tải giữa CPU và GPU khi triển khai suy luận LLM. Khi ba năm trước GPU chiếm ưu thế vì khả năng thực hiện các phép nhân ma trận khổng lồ, hiện nay nhu cầu các mô hình công cụ, reasoning đa bước và orchestration đang làm thay đổi bản đồ tính toán.
GPU vẫn mạnh trong các tác vụ tính toán mật độ cao (FLOPS) như forward pass của transformer, nhưng CPU lại có ưu thế trong các công việc tuần tự, logic phức tạp: xử lý JSON, quản lý I/O, chạy môi trường Python, sandbox và vòng lặp điều khiển agent. Nhờ truy cập trực tiếp vào bộ nhớ hệ thống, CPU trở thành nền tảng tự nhiên cho lớp orchestration bao bọc mô hình.
Intel cho biết tỷ lệ CPU‑GPU trong các workload inference đã chuyển từ 1:8 (đào tạo) lên 1:1, và trong một số triển khai agent thậm chí đạt 4:1. Dữ liệu thực tế cho thấy các hệ thống sử dụng CPU để xử lý phần lớn logic và chỉ chuyển sang GPU khi cần thực hiện các phép tính ma trận lớn, giúp giảm chi phí và tăng hiệu suất tổng thể.
- CPU: tối ưu cho latency, logic phi tuyến, và truy cập bộ nhớ nhanh.
- GPU: tối ưu cho throughput, tính toán ma trận đồng thời.
- Kết hợp CPU‑GPU: giảm chi phí token‑per‑second (TPS) và cải thiện thời gian phản hồi.
Việc tái cân bằng lại vai trò của CPU và GPU sẽ mở ra cơ hội cho các nhà cung cấp dịch vụ AI tại Việt Nam tối ưu chi phí hạ tầng và phát triển các giải pháp agent‑centric, đáp ứng nhu cầu ngày càng đa dạng của người dùng.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com