Falcon-ASR: Model nhận dạng tiếng nói 1,6 tỷ tham số từ TII

Viện Đổi mới Công nghệ (TII) tại Abu Dhabi vừa công bố Falcon-ASR, mô hình nhận dạng tiếng nói tự động (ASR) với 1,6 tỷ tham số. Được thiết kế tối ưu cho tiếng Ả Rập, đặc biệt là giọng địa phương Emirati, mô hình này đồng thời hỗ trợ đa ngôn ngữ bao gồm tiếng Anh, tiếng Pháp, tiếng Tây Ban Nha và tiếng Bồ Đào Nha trên cùng một bộ trọng số (weights) mà không cần gắn cờ ngôn ngữ.

Về hiệu suất, Falcon-ASR ghi nhận mức tỷ lệ lỗi từ (WER) trung bình 20,92% trên 6 tập dữ liệu thử nghiệm tiếng Ả Rập chuẩn, vượt qua kỷ lục tốt nhất trước đó là 23,17%. Trong bài đánh giá nội bộ với giọng Emirati dưới các điều kiện thực tế như nhiễu nền, tiếng vang và cuộc gọi điện thoại, model đạt WER 22,73% và CER (tỷ lệ lỗi ký tự) 10,19% — thấp hơn 4,07% so với Qwen3-Omni. Ngoài ra, Falcon-ASR còn đạt WER trung bình 5,74% trên 7 tập test tiếng Anh của Hugging Face Open ASR Leaderboard và hỗ trợ gán nhãn thời gian theo từng từ (word-level timestamps).

Falcon-ASR đánh dấu bước tiến quan trọng trong việc xử lý ngôn ngữ tự nhiên cho các ngôn ngữ và biến thể ít tài liệu chuẩn như giọng địa phương Ả Rập. Đây là tài nguyên tham khảo giá trị cho cộng đồng nghiên cứu AI Việt Nam khi phát triển các mô hình ASR đa ngôn ngữ và xử lý giọng nói vùng miền phức tạp.

Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account