VibeVoice‑ASR‑BitNet: Mô hình nhận dạng giọng nói chạy trên CPU thời gian thực, mở nguồn trên GitHub

Microsoft vừa ra mắt VibeVoice‑ASR‑BitNet, một engine inference cho mô hình VibeVoice‑ASR được tối ưu cho CPU. Nhờ kỹ thuật heterogeneous quantization (I8_S + I2_S), kích thước mô hình giảm từ 4.62 GB xuống còn 1.58 GB, cho phép chạy thời gian thực (RTF < 1) trên hơn 3 luồng CPU mà không cần GPU.

VibeVoice‑ASR là mô hình nhận dạng giọng nói thống nhất, có khả năng xử lý âm thanh dài tới 60 phút trong một lần truyền, tạo ra bản ghi có cấu trúc Who‑When‑What (người nói, thời gian, nội dung) và hỗ trợ customized hotwords để cải thiện độ chính xác trong các lĩnh vực chuyên môn. Mô hình đã được tích hợp vào Azure AI Foundry Labs và có sẵn qua thư viện Hugging Face Transformers, giúp các nhà phát triển dễ dàng triển khai trong dự án của mình.

Trong chuỗi cập nhật, Microsoft cũng mở nguồn VibeVoice‑Realtime‑0.5B (text‑to‑speech thời gian thực) và VibeVoice‑TTS (sinh giọng đa speaker lên tới 90 phút). Tuy nhiên, do phát hiện việc lạm dụng, mã nguồn TTS đã bị gỡ bỏ khỏi repo vào tháng 9/2025, phản ánh cam kết của Microsoft về việc sử dụng AI có trách nhiệm.

Với việc cung cấp các mô hình âm thanh tiên tiến dưới dạng mã nguồn mở, VibeVoice mở ra cơ hội cho cộng đồng AI Việt Nam phát triển các ứng dụng nhận dạng và tổng hợp giọng nói địa phương, giảm phụ thuộc vào dịch vụ thương mại và thúc đẩy đổi mới sáng tạo trong lĩnh vực ngôn ngữ.

Nguồn: GitHub Trending — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account