Google ra mắt Gemini 3.5 Transcribe: Model chuyển giọng nói thành văn bản chính xác nhất từ trước đến nay

Google vừa chính thức giới thiệu Gemini 3.5 Transcribe, model chuyển giọng nói thành văn bản (speech-to-text) mới nhất của hãng, được quảng cáo là có độ chính xác cao nhất từ trước đến nay, tối ưu cho các tương tác giọng nói thông minh trong thời gian thực.

Khác với các model nhận dạng giọng nói thông thường thường gặp khó khăn với nhiễu nền, thuật ngữ chuyên ngành phức tạp và lỗi lắp bắp khi nói, Gemini 3.5 Transcribe có thể chuyển đổi trực tiếp âm thanh thô thành văn bản hoàn chỉnh, đã được chỉnh sửa lỗi và định dạng sẵn. Model này cũng hỗ trợ chuyển đổi ngôn ngữ tự động trong quá trình ghi âm, ghi nhận người nói khác nhau, cung cấp dấu thời gian ở mức từng từ và xử lý tốt từ vựng tùy chỉnh của người dùng.

Theo thông tin từ Google, Gemini 3.5 Transcribe cải thiện đáng kể so với đời trước là Chirp 3, với tỷ lệ lỗi từ (WER) chỉ còn 5,50% ở chế độ streaming và 5,04% ở chế độ không streaming trên bộ benchmark FLEURS đa ngôn ngữ. Thời gian trả về kết quả ghi chép cuối cùng cũng giảm 70% so với đời cũ, theo đánh giá của Artificial Analysis. Hiện model đã được tích hợp sẵn vào các sản phẩm như Gboard, ứng dụng Gemini, trình duyệt Chrome và nền tảng Antigravity của Google, đồng thời có sẵn trên Gemini API trong Google AI Studio và Gemini Enterprise Agent Platform cho các nhà phát triển xây dựng công cụ ghi chú thời gian thực, phân tích sau cuộc gọi hay agent giọng nói.

Với cộng đồng phát triển và người dùng Việt Nam, việc có thêm một model chuyển giọng nói sang văn bản chính xác, hỗ trợ tốt tiếng Việt và tích hợp dễ dàng vào các ứng dụng hiện có sẽ giúp đơn giản hóa quy trình ghi chép cuộc họp, tạo phụ đề tự động hay xây dựng các công cụ tương tác giọng nói phù hợp với thói quen sử dụng của người dùng địa phương.

Nguồn: Hacker News — Biên dịch & tổng hợp: danhbaai.com

Danh Bạ AI
Logo
Register New Account