
Trong các sản phẩm dựa trên LLM thời gian thực, độ trễ kéo dài có thể làm mất khách hàng. Tại HOAi, mỗi lượt hội thoại với khách hàng qua điện thoại yêu cầu một lời gọi tới LLM. Mặc dù đa số phản hồi về 1,5 giây, nhưng khoảng 1% yêu cầu lại mất 10‑20 giây, gây khoảng im lặng đáng kể.
Để kiểm chứng, đội ngũ HOAi đã chạy 50 yêu cầu thực tế bằng hai cách: (1) sử dụng tier ưu tiên của nhà cung cấp LLM; (2) gửi mỗi yêu cầu hai lần đồng thời và chờ phản hồi nhanh hơn. Kết quả cho thấy cách thứ hai giảm thời gian phản hồi tối đa từ 9,8 giây xuống 3,5 giây và thời gian tới token đầu tiên từ 4,2 giây xuống 1,2 giây. Trung vị thời gian phản hồi thậm chí bằng cả tier ưu tiên, trong khi chi phí vẫn giữ ở mức tiêu chuẩn.
Phương pháp này hiệu quả khi các phản hồi chậm xuất hiện hiếm và độc lập; khả năng cả hai bản sao đều chậm cùng lúc là rất thấp. Nhờ vậy, tỉ lệ cuộc gọi bị im lặng kéo dài 10 giây giảm mạnh, nâng trải nghiệm người dùng.
Với các nhà phát triển AI tại Việt Nam, đây là một gợi ý thực tiễn: trước khi chi trả cho gói dịch vụ cao cấp, hãy thử nghiệm gửi yêu cầu đôi để tối ưu độ trễ mà không tăng chi phí. Đây có thể là bước đệm quan trọng để các sản phẩm AI thời gian thực trở nên ổn định và cạnh tranh hơn trên thị trường.
Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com