OpenAI vừa giới thiệu tier dịch vụ API mới có tên Ultrafast, hứa hẹn tăng tốc độ suy luận của mô hình GPT‑5.6 Sol lên đến 14 lần so với chế độ thông thường. Đây là bước tiến quan trọng giúp các nhà phát triển giảm độ trễ khi tích hợp mô hình ngôn ngữ lớn vào sản phẩm.
Ultrafast được xây dựng trên phần cứng của Cerebras, một trong những nhà cung cấp chip AI hiệu năng cao. Theo OpenAI, dịch vụ mới có thể tạo ra tới 750 token mỗi giây, tương đương khả năng sinh ra một đoạn văn dài khoảng 5‑6 câu trong một giây. Tốc độ này đủ để hỗ trợ các kịch bản yêu cầu phản hồi gần như ngay lập tức, như chatbot thời gian thực, hệ thống hỗ trợ khách hàng hay các công cụ sáng tạo nội dung.
- Giảm độ trễ từ vài giây xuống dưới 0,5 giây cho các truy vấn phức tạp.
- Khả năng mở rộng linh hoạt, cho phép khách hàng lựa chọn mức phí dựa trên tốc độ và số lượng token.
- Tích hợp sẵn các công cụ tối ưu hoá prompt để khai thác tối đa hiệu năng.
Với tốc độ mới, Ultrafast không chỉ nâng cao trải nghiệm người dùng mà còn mở rộng phạm vi áp dụng của LLM trong các ngành công nghiệp yêu cầu thời gian phản hồi nhanh. Đối với cộng đồng AI Việt Nam, đây là cơ hội để thử nghiệm các giải pháp AI thời gian thực mà không cần đầu tư hạ tầng phần cứng đắt đỏ.
Nguồn: OpenAI — Biên dịch & tổng hợp: danhbaai.com