Hugging Face ra mắt Open TTS Leaderboard đánh giá các mô hình tạo giọng nói

Hugging Face vừa giới thiệu bảng xếp hạng Open TTS Leaderboard, giải pháp đánh giá chuẩn hóa cho các mô hình Text-to-Speech (TTS) và voice cloning đa ngôn ngữ. Hiện có hơn 8.000 mô hình TTS trên Hugging Face Hub, nhưng việc đánh giá trước đây chủ yếu dựa vào bình chọn thủ công từ con người (Elo score), vốn tốn nhiều tuần và không theo kịp tốc độ ra đời của các mô hình open-source.

Bảng xếp hạng mới sử dụng các chỉ số khách quan như chỉ số lỗi từ WER (Word Error Rate) thông qua mô hình ASR để đo độ rõ tiếng, cùng độ tương đồng người nói (speaker similarity) để kiểm tra khả năng giữ đặc trưng giọng. Nhờ đó, thời gian đánh giá một model giảm từ vài tuần xuống chỉ còn vài giờ. Dữ liệu đánh giá dựa trên các bộ benchmark như Seed TTS Eval và CV3 Eval, kết hợp đo lường tốc độ suy luận (RTFx) và kích thước mô hình.

Trong bảng xếp hạng hiện tại ở tác vụ tiếng Anh, các mô hình như Kokoro-82M, supertonic-3 và s2-pro đang dẫn đầu về chỉ số WER. Đối với đa ngôn ngữ, các mô hình như OmniVoice và Fun-CosyVoice3-0.5B thể hiện hiệu năng rất ấn tượng.

Sự xuất hiện của Open TTS Leaderboard giúp cộng đồng nghiên cứu và phát triển AI tại Việt Nam dễ dàng lựa chọn, so sánh và ứng dụng các model TTS nguồn mở chất lượng cao vào các giải pháp trợ lý ảo và sản xuất nội dung tiếng Việt.

Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account