
Bạn muốn clone giọng, lồng tiếng video hay đọc sách bằng AI mà không phải gửi dữ liệu lên mây? VoiceStudio ra đời để giải quyết đúng bài toán đó. Đây là dự án mã nguồn mở, hoạt động local-first, được giới thiệu như một bản thay thế ElevenLabs chạy ngay trên máy của bạn.
Với hơn 11.000 sao GitHub và cộng đồng Discord sôi động, VoiceStudio đang là một trong những dự án voice AI tự host được quan tâm nhất hiện nay. Nó gói gọn 16 engine TTS, 11 engine ASR và danh mục 646 ngôn ngữ vào một ứng dụng desktop đa nền tảng, phù hợp cả người mới lẫn chuyên gia.
VoiceStudio là bộ công cụ giọng nói AI mã nguồn mở, chạy hoàn toàn trên máy, tích hợp 16 engine TTS và 11 engine ASR. Nó cho phép clone giọng, thiết kế giọng mới, lồng tiếng video, làm audiobook và chép lời trong 646 ngôn ngữ. Đây là lựa chọn thay thế trực tiếp cho ElevenLabs mà không cần tài khoản, API key hay trả phí theo lượng dùng. Phù hợp với người cần xử lý giọng nói riêng tư, dung lượng lớn hoặc hoàn toàn offline.
Thông tin tổng quan
| Repo | debpalash/VoiceStudio |
|---|---|
| Stars / Forks | ⭐ 11,129 / 1,768 |
| Ngôn ngữ | Python (60%), JavaScript (28%), Rust (4%) |
| License | AGPL-3.0 |
| Contributors | 36 |
| Release mới nhất | v0.5.0 |
| Cập nhật cuối | 22/08/2026 |
| Website | https://voicestudio.sh |
VoiceStudio là gì?
VoiceStudio (trước đây tên là OmniVoice-Studio) là một ứng dụng desktop mã nguồn mở, giúp bạn tạo giọng nói AI ngay trên máy tính mà không cần đăng ký dịch vụ trả phí. Nói cách khác, nó là “phiên bản ElevenLabs chạy tại nhà”: bạn cài một lần, tải model về là dùng được, không có API key, không có subscription, không bị tính phí theo ký tự.
Dự án được tạo ra vì nhu cầu xử lý giọng nói riêng tư ngày càng lớn: người sáng tạo nội dung, tác giả audiobook, nhóm làm phim hay thậm chí doanh nghiệp cần clone giọng, lồng tiếng đa ngôn ngữ nhưng không muốn dữ liệu rời khỏi máy. VoiceStudio gói toàn bộ quy trình — từ clone giọng, chép lời, dịch, tách giọng nói, đến xuất video — vào một giao diện thống nhất, chạy trên macOS, Windows và Linux.
Tính năng chính
- Voice Cloning — Tạo giọng mới chỉ từ 3–15 giây mẫu, hỗ trợ zero-shot synthesis với nhiều engine.
- Voice Design — Thiết kế giọng theo tuổi, giọng vùng, cao độ, phong cách và chỉ dẫn diễn xuất.
- Video Dubbing — Tự động chép lời, dịch, giữ nguyên người nói, tổng hợp giọng và xuất video hoàn chỉnh.
- Stories & Audiobook — Kịch bản đa giọng, nhập EPUB/PDF, xuất file .m4b theo chương.
- Dictation Widget — Phím tắt toàn hệ thống, chép lời trực tiếp, tùy chọn dọn văn bản bằng local LLM.
- Model Catalogue — Cài, gỡ, chọn và định tuyến các model TTS/ASR/LLM từ một giao diện duy nhất.
- GPU Auto-Detect — Tự nhận CUDA, MPS (Apple Silicon), ROCm và CPU, kèm kiểm tra theo từng engine.
- MCP Server & OpenAI-compatible API — Cung cấp endpoint local tương thích OpenAI, tích hợp với MCP client và các tool tự động hóa.
Yêu cầu phần cứng & hệ thống
| Thành phần | Yêu cầu |
|---|---|
| OS | macOS 13.3+ Apple Silicon, Windows 10/11 x64, Linux x86_64 với glibc 2.39+ |
| RAM | Tối thiểu 8 GB, khuyến nghị 16 GB trở lên |
| CPU | Hỗ trợ chế độ CPU; Apple Silicon hoặc CPU x86_64 đời mới đều chạy được |
| GPU | Tùy chọn; khuyến nghị NVIDIA CUDA hoặc Apple Silicon MPS/MLX |
| VRAM | 4 GB khi dùng GPU, khuyến nghị 8 GB+ cho engine nặng |
| Ổ cứng | Tối thiểu 10 GB trống, khuyến nghị 20 GB+ SSD |
| Phần mềm nền | Python 3.11+ (khi build từ source), Bun, Docker tùy chọn cho ROCm/CUDA/CPU |
Cách cài đặt và sử dụng
Cách đơn giản nhất là tải gói cài sẵn cho hệ điều hành của bạn từ trang Release. VoiceStudio hỗ trợ DMG cho macOS (Apple Silicon), MSI cho Windows và AppImage cho Linux. Lần đầu chạy, ứng dụng tự tạo môi trường Python quản lý và tải model mặc định; các lần sau tái sử dụng nên rất nhanh.
Nếu muốn chạy từ source để phát triển hoặc tùy biến, dùng Bun và làm theo hướng dẫn trong .github/CONTRIBUTING.md:
git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktopGặp lỗi khi cài có thể chạy uv run python backend/main.py --diagnose --deep hoặc mở Settings → About → Run self-check trong app để xuất gói chẩn đoán gửi kèm khi mở issue.
Phù hợp với ai?
VoiceStudio phù hợp với người sáng tạo nội dung, podcaster, tác giả audiobook, nhóm làm video đa ngôn ngữ, lập trình viên muốn tích hợp TTS/STT vào sản phẩm mà không phụ thuộc cloud, cùng doanh nghiệp cần xử lý giọng nói nội bộ vì lý do bảo mật. Nếu bạn cần một giải pháp cài một lần, chạy offline, không lo bill hàng tháng, đây là lựa chọn rất đáng cân nhắc.
Ngược lại, nếu bạn không có máy đủ mạnh (đặc biệt thiếu GPU), không muốn mất thời gian cài đặt model, hoặc chỉ cần vài phút audio mỗi tháng thì dịch vụ cloud như ElevenLabs hay PlayHT vẫn tiện hơn. VoiceStudio cũng không dành cho người muốn dùng ngay trên iPad/Android vì hiện chỉ có desktop.
Ứng dụng thực tế
- Lồng tiếng video YouTube hoặc khóa học sang nhiều ngôn ngữ mà vẫn giữ giọng gốc của tác giả.
- Sản xuất audiobook từ file EPUB/PDF với nhiều nhân vật, xuất thẳng định dạng .m4b.
- Clone giọng streamer hoặc MC để tạo intro, quảng cáo, voice-over hàng loạt.
- Tích hợp vào pipeline nội bộ qua API tương thích OpenAI hoặc MCP Server để tự động sinh audio.
- Chép lời cuộc họp, phỏng vấn, podcast với diarization (phân biệt người nói) hoàn toàn offline.
Các repo tương tự đáng chú ý
Gợi ý để so sánh: Các dự án dưới đây cùng chủ đề và nằm trong nhóm có lượng stars nổi bật trên GitHub.
- RVC-Boss/GPT-SoVITS ⭐ 61,130 stars · Python1 min voice data can also be used to train a good TTS model! (few shot voice cloning)
- CorentinJ/Real-Time-Voice-Cloning ⭐ 60,100 stars · PythonClone a voice in 5 seconds to generate arbitrary speech in real-time
- myshell-ai/OpenVoice ⭐ 37,167 stars · PythonInstant voice cloning by MIT and MyShell. Audio foundation model.
- OpenBMB/VoxCPM ⭐ 35,961 stars · PythonVoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning
- DrewThomasson/ebook2audiobook ⭐ 20,000 stars · PythonGenerate audiobooks from e-books, voice cloning & 1158+ languages!
Đánh giá của danhbaai.com
Điểm mạnh lớn nhất của VoiceStudio là triết lý local-first rất rõ ràng: dữ liệu giọng nói và văn bản mặc định ở lại máy, không có phí ẩn, không khóa tính năng cốt lõi sau paywall. Việc tích hợp tới 16 engine TTS và 11 engine ASR trong một giao diện duy nhất giúp người dùng linh hoạt chuyển đổi theo ngôn ngữ, phần cứng hoặc yêu cầu bản quyền. Tài liệu README khá đầy đủ, có bảng so sánh với dịch vụ cloud, hướng dẫn cài riêng cho từng OS và benchmark hiệu năng.
Tuy nhiên, dự án vẫn ở trạng thái beta, một số engine nặng yêu cầu VRAM lớn và danh sách 646 ngôn ngữ chủ yếu đến từ engine mặc định OmniVoice — chất lượng thực tế còn phụ thuộc engine bạn chọn. So với các lựa chọn như Coqui TTS hay GPT-SoVITS, VoiceStudio thắng ở giao diện desktop thân thiện và hệ sinh thái plugin, nhưng Coqui TTS lại sâu hơn cho nghiên cứu còn GPT-SoVITS mạnh hơn về clone tiếng Trung/Anh.
Nhìn chung, đây là lựa chọn rất đáng thử cho bất kỳ ai muốn rời bỏ dịch vụ voice cloud mà vẫn có trải nghiệm gần giống một sản phẩm thương mại. Với cộng đồng 11k+ sao, Discord riêng và lộ trình cập nhật đều đặn, VoiceStudio xứng đáng có một vị trí trong bộ công cụ AI của bạn.
- Hoàn toàn local, không cần tài khoản hay API key
- Hỗ trợ tới 16 engine TTS và 11 engine ASR trong một app
- Danh mục 646 ngôn ngữ, bao phủ nhiều ngữ cảnh
- Giao diện desktop đa nền tảng (macOS, Windows, Linux)
- Có API tương thích OpenAI và MCP Server để tích hợp
- Tài liệu README chi tiết, có bảng so sánh và benchmark
- Vẫn ở trạng thái beta, có thể gặp bug
- Một số engine nặng yêu cầu GPU/VRAM mạnh
- Chất lượng từng ngôn ngữ phụ thuộc engine được chọn
- Không hỗ trợ thiết bị di động (iOS/Android)
- License AGPL-3.0 có thể gây khó khăn nếu muốn thương mại hóa đóng gói
Câu hỏi thường gặp
VoiceStudio có thay thế hoàn toàn ElevenLabs không?
Cần cấu hình máy tối thiểu thế nào để chạy VoiceStudio?
VoiceStudio có dùng được hoàn toàn offline không?
License AGPL-3.0 có ý nghĩa gì khi dùng VoiceStudio?
Làm sao đóng góp hoặc báo lỗi cho dự án?
Nguồn: github.com/debpalash/VoiceStudio — Bài phân tích bởi danhbaai.com.