
Voice Arena và Hugging Face đã công bố việc thêm hai bộ đánh giá mới – Monsoon en‑IN và Monsoon hi‑IN – vào Open ASR Leaderboard. Hai bộ dữ liệu này đánh giá khả năng nhận dạng tiếng Anh Ấn Độ và tiếng Hindi, ngôn ngữ được nói bởi hơn nửa tỷ người, đánh dấu bước tiến đầu tiên của leaderboard trong việc bao phủ các ngôn ngữ của Global South.
Bộ dữ liệu bao gồm 4.888 người nói với 12 thuộc tính được ghi lại cho mỗi giọng, như tuổi, giới tính, nghề nghiệp, thu nhập, thương hiệu điện thoại, thành phố hiện tại và năm sinh sống tại khu vực. Các tập công khai và riêng tư được thiết kế sao cho các mẫu âm thanh không trùng lặp về người nói, giúp giảm tối đa việc tối ưu hoá riêng cho benchmark. Monsoon được xây dựng dựa trên chín trục đa dạng: địa lý, tuổi, giới tính, từ vựng, thiết bị ghi âm, môi trường âm thanh, loại lời nói, tốc độ nói và khả năng có nhiều bản ghi đúng cho cùng một đoạn âm.
Đặc điểm nổi bật là lattice spelling cho tiếng Hindi, cho phép chấp nhận nhiều dạng viết khác nhau của cùng một từ, trong khi tiếng Anh Ấn Độ sử dụng chuẩn hoá chuỗi ký tự. Các bản ghi được cắt từ các cuộc hội thoại tự nhiên, mỗi clip chỉ chứa một người nói, và hơn một nửa số người nói chỉ xuất hiện một lần, giúp WER phản ánh thực tế đa dạng hơn là chỉ dựa trên một nhóm nhỏ người dùng.
Với việc mở rộng sang Hindi và Ấn Độ Anh, Open ASR Leaderboard không chỉ cung cấp dữ liệu phong phú cho các nhà nghiên cứu mà còn tạo cơ hội cho cộng đồng AI Việt Nam thử nghiệm và cải thiện mô hình ASR cho các ngôn ngữ ít được hỗ trợ. Điều này hứa hẹn thúc đẩy sự công bằng và đa dạng trong công nghệ nhận dạng giọng nói, đồng thời khuyến khích phát triển các giải pháp phù hợp với người dùng ở các khu vực đang phát triển.
Nguồn: Hugging Face — Biên dịch & tổng hợp: danhbaai.com