VoiceStudio: bản sao ElevenLabs chạy hoàn toàn local, hỗ trợ 646 ngôn ngữ

Bạn muốn clone giọng, lồng tiếng video hay đọc sách bằng AI mà không phải gửi dữ liệu lên mây? VoiceStudio ra đời để giải quyết đúng bài toán đó. Đây là dự án mã nguồn mở, hoạt động local-first, được giới thiệu như một bản thay thế ElevenLabs chạy ngay trên máy của bạn.

Với hơn 11.000 sao GitHub và cộng đồng Discord sôi động, VoiceStudio đang là một trong những dự án voice AI tự host được quan tâm nhất hiện nay. Nó gói gọn 16 engine TTS, 11 engine ASR và danh mục 646 ngôn ngữ vào một ứng dụng desktop đa nền tảng, phù hợp cả người mới lẫn chuyên gia.

Tóm tắt nhanh

VoiceStudio là bộ công cụ giọng nói AI mã nguồn mở, chạy hoàn toàn trên máy, tích hợp 16 engine TTS và 11 engine ASR. Nó cho phép clone giọng, thiết kế giọng mới, lồng tiếng video, làm audiobook và chép lời trong 646 ngôn ngữ. Đây là lựa chọn thay thế trực tiếp cho ElevenLabs mà không cần tài khoản, API key hay trả phí theo lượng dùng. Phù hợp với người cần xử lý giọng nói riêng tư, dung lượng lớn hoặc hoàn toàn offline.

Thông tin tổng quan

Repodebpalash/VoiceStudio
Stars / Forks⭐ 11,129 / 1,768
Ngôn ngữPython (60%), JavaScript (28%), Rust (4%)
LicenseAGPL-3.0
Contributors36
Release mới nhấtv0.5.0
Cập nhật cuối22/08/2026
Websitehttps://voicestudio.sh

VoiceStudio là gì?

VoiceStudio (trước đây tên là OmniVoice-Studio) là một ứng dụng desktop mã nguồn mở, giúp bạn tạo giọng nói AI ngay trên máy tính mà không cần đăng ký dịch vụ trả phí. Nói cách khác, nó là “phiên bản ElevenLabs chạy tại nhà”: bạn cài một lần, tải model về là dùng được, không có API key, không có subscription, không bị tính phí theo ký tự.

Dự án được tạo ra vì nhu cầu xử lý giọng nói riêng tư ngày càng lớn: người sáng tạo nội dung, tác giả audiobook, nhóm làm phim hay thậm chí doanh nghiệp cần clone giọng, lồng tiếng đa ngôn ngữ nhưng không muốn dữ liệu rời khỏi máy. VoiceStudio gói toàn bộ quy trình — từ clone giọng, chép lời, dịch, tách giọng nói, đến xuất video — vào một giao diện thống nhất, chạy trên macOS, Windows và Linux.

Tính năng chính

  • Voice Cloning — Tạo giọng mới chỉ từ 3–15 giây mẫu, hỗ trợ zero-shot synthesis với nhiều engine.
  • Voice Design — Thiết kế giọng theo tuổi, giọng vùng, cao độ, phong cách và chỉ dẫn diễn xuất.
  • Video Dubbing — Tự động chép lời, dịch, giữ nguyên người nói, tổng hợp giọng và xuất video hoàn chỉnh.
  • Stories & Audiobook — Kịch bản đa giọng, nhập EPUB/PDF, xuất file .m4b theo chương.
  • Dictation Widget — Phím tắt toàn hệ thống, chép lời trực tiếp, tùy chọn dọn văn bản bằng local LLM.
  • Model Catalogue — Cài, gỡ, chọn và định tuyến các model TTS/ASR/LLM từ một giao diện duy nhất.
  • GPU Auto-Detect — Tự nhận CUDA, MPS (Apple Silicon), ROCm và CPU, kèm kiểm tra theo từng engine.
  • MCP Server & OpenAI-compatible API — Cung cấp endpoint local tương thích OpenAI, tích hợp với MCP client và các tool tự động hóa.

Yêu cầu phần cứng & hệ thống

Thành phầnYêu cầu
OSmacOS 13.3+ Apple Silicon, Windows 10/11 x64, Linux x86_64 với glibc 2.39+
RAMTối thiểu 8 GB, khuyến nghị 16 GB trở lên
CPUHỗ trợ chế độ CPU; Apple Silicon hoặc CPU x86_64 đời mới đều chạy được
GPUTùy chọn; khuyến nghị NVIDIA CUDA hoặc Apple Silicon MPS/MLX
VRAM4 GB khi dùng GPU, khuyến nghị 8 GB+ cho engine nặng
Ổ cứngTối thiểu 10 GB trống, khuyến nghị 20 GB+ SSD
Phần mềm nềnPython 3.11+ (khi build từ source), Bun, Docker tùy chọn cho ROCm/CUDA/CPU

Cách cài đặt và sử dụng

Cách đơn giản nhất là tải gói cài sẵn cho hệ điều hành của bạn từ trang Release. VoiceStudio hỗ trợ DMG cho macOS (Apple Silicon), MSI cho Windows và AppImage cho Linux. Lần đầu chạy, ứng dụng tự tạo môi trường Python quản lý và tải model mặc định; các lần sau tái sử dụng nên rất nhanh.

Nếu muốn chạy từ source để phát triển hoặc tùy biến, dùng Bun và làm theo hướng dẫn trong .github/CONTRIBUTING.md:

git clone https://github.com/debpalash/VoiceStudio.git
cd VoiceStudio
bun install
bun run desktop

Gặp lỗi khi cài có thể chạy uv run python backend/main.py --diagnose --deep hoặc mở Settings → About → Run self-check trong app để xuất gói chẩn đoán gửi kèm khi mở issue.

Phù hợp với ai?

VoiceStudio phù hợp với người sáng tạo nội dung, podcaster, tác giả audiobook, nhóm làm video đa ngôn ngữ, lập trình viên muốn tích hợp TTS/STT vào sản phẩm mà không phụ thuộc cloud, cùng doanh nghiệp cần xử lý giọng nói nội bộ vì lý do bảo mật. Nếu bạn cần một giải pháp cài một lần, chạy offline, không lo bill hàng tháng, đây là lựa chọn rất đáng cân nhắc.

Ngược lại, nếu bạn không có máy đủ mạnh (đặc biệt thiếu GPU), không muốn mất thời gian cài đặt model, hoặc chỉ cần vài phút audio mỗi tháng thì dịch vụ cloud như ElevenLabs hay PlayHT vẫn tiện hơn. VoiceStudio cũng không dành cho người muốn dùng ngay trên iPad/Android vì hiện chỉ có desktop.

Ứng dụng thực tế

  • Lồng tiếng video YouTube hoặc khóa học sang nhiều ngôn ngữ mà vẫn giữ giọng gốc của tác giả.
  • Sản xuất audiobook từ file EPUB/PDF với nhiều nhân vật, xuất thẳng định dạng .m4b.
  • Clone giọng streamer hoặc MC để tạo intro, quảng cáo, voice-over hàng loạt.
  • Tích hợp vào pipeline nội bộ qua API tương thích OpenAI hoặc MCP Server để tự động sinh audio.
  • Chép lời cuộc họp, phỏng vấn, podcast với diarization (phân biệt người nói) hoàn toàn offline.

Các repo tương tự đáng chú ý

Gợi ý để so sánh: Các dự án dưới đây cùng chủ đề và nằm trong nhóm có lượng stars nổi bật trên GitHub.



Đánh giá của danhbaai.com

Điểm mạnh lớn nhất của VoiceStudio là triết lý local-first rất rõ ràng: dữ liệu giọng nói và văn bản mặc định ở lại máy, không có phí ẩn, không khóa tính năng cốt lõi sau paywall. Việc tích hợp tới 16 engine TTS và 11 engine ASR trong một giao diện duy nhất giúp người dùng linh hoạt chuyển đổi theo ngôn ngữ, phần cứng hoặc yêu cầu bản quyền. Tài liệu README khá đầy đủ, có bảng so sánh với dịch vụ cloud, hướng dẫn cài riêng cho từng OS và benchmark hiệu năng.

Tuy nhiên, dự án vẫn ở trạng thái beta, một số engine nặng yêu cầu VRAM lớn và danh sách 646 ngôn ngữ chủ yếu đến từ engine mặc định OmniVoice — chất lượng thực tế còn phụ thuộc engine bạn chọn. So với các lựa chọn như Coqui TTS hay GPT-SoVITS, VoiceStudio thắng ở giao diện desktop thân thiện và hệ sinh thái plugin, nhưng Coqui TTS lại sâu hơn cho nghiên cứu còn GPT-SoVITS mạnh hơn về clone tiếng Trung/Anh.

Nhìn chung, đây là lựa chọn rất đáng thử cho bất kỳ ai muốn rời bỏ dịch vụ voice cloud mà vẫn có trải nghiệm gần giống một sản phẩm thương mại. Với cộng đồng 11k+ sao, Discord riêng và lộ trình cập nhật đều đặn, VoiceStudio xứng đáng có một vị trí trong bộ công cụ AI của bạn.

ƯU ĐIỂM

  • Hoàn toàn local, không cần tài khoản hay API key
  • Hỗ trợ tới 16 engine TTS và 11 engine ASR trong một app
  • Danh mục 646 ngôn ngữ, bao phủ nhiều ngữ cảnh
  • Giao diện desktop đa nền tảng (macOS, Windows, Linux)
  • Có API tương thích OpenAI và MCP Server để tích hợp
  • Tài liệu README chi tiết, có bảng so sánh và benchmark

NHƯỢC ĐIỂM

  • Vẫn ở trạng thái beta, có thể gặp bug
  • Một số engine nặng yêu cầu GPU/VRAM mạnh
  • Chất lượng từng ngôn ngữ phụ thuộc engine được chọn
  • Không hỗ trợ thiết bị di động (iOS/Android)
  • License AGPL-3.0 có thể gây khó khăn nếu muốn thương mại hóa đóng gói

Câu hỏi thường gặp

VoiceStudio có thay thế hoàn toàn ElevenLabs không?

Về tính năng cốt lõi (clone giọng, TTS, STT, dubbing) VoiceStudio đáp ứng được phần lớn nhu cầu. Tuy nhiên ElevenLabs vẫn có lợi thế ở chất lượng giọng tiếng Anh được tinh chỉnh thủ công và hệ sinh thái voice marketplace lớn hơn.

Cần cấu hình máy tối thiểu thế nào để chạy VoiceStudio?

Bạn cần ít nhất 8 GB RAM, 10 GB ổ trống và có thể chạy CPU-only. Nếu dùng GPU, khuyến nghị card NVIDIA với 8 GB VRAM trở lên hoặc máy Mac Apple Silicon để tận dụng MPS/MLX.

VoiceStudio có dùng được hoàn toàn offline không?

Có, sau khi tải model về lần đầu, các workflow cốt lõi như clone giọng, TTS, STT và dubbing đều chạy offline. Chỉ những tính năng remote worker hoặc OpenAI-compatible ASR mới cần mạng và phải bật opt-in.

License AGPL-3.0 có ý nghĩa gì khi dùng VoiceStudio?

Bạn hoàn toàn tự do dùng cho mục đích cá nhân, nghiên cứu hoặc nội bộ. Nếu sửa đổi và phân phối lại dưới dạng dịch vụ, bạn phải mở mã nguồn theo AGPL. Các model bên thứ ba đi kèm giữ license riêng của chúng.

Làm sao đóng góp hoặc báo lỗi cho dự án?

Bạn có thể mở issue trên GitHub kèm gói chẩn đoán (Settings → About → Run self-check), tham gia Discord cộng đồng, hoặc gửi pull request theo hướng dẫn trong file .github/CONTRIBUTING.md.

8.1Expert Score
Rất tốt
VoiceStudio là bộ công cụ giọng nói AI mã nguồn mở, chạy hoàn toàn trên máy, tích hợp 16 engine TTS và 11 engine ASR. Nó cho phép clone giọng, thiết kế giọng mới, lồng tiếng video, làm audiobook và chép lời trong 646 ngôn ngữ. Đây là lựa chọn thay thế trực tiếp cho ElevenLabs mà không cần tài khoản, API key hay trả phí theo lượng dùng. Phù hợp với người cần xử lý giọng nói riêng tư, dung lượng lớn hoặc hoàn toàn offline.
Tính năng
9
Dễ cài đặt
7.5
Tài liệu
8.5
Cộng đồng
8.5
Độ ổn định
7
PROS
  • Hoàn toàn local, không cần tài khoản hay API key
  • Hỗ trợ tới 16 engine TTS và 11 engine ASR trong một app
  • Danh mục 646 ngôn ngữ, bao phủ nhiều ngữ cảnh
  • Giao diện desktop đa nền tảng (macOS, Windows, Linux)
  • Có API tương thích OpenAI và MCP Server để tích hợp
  • Tài liệu README chi tiết, có bảng so sánh và benchmark
CONS
  • Vẫn ở trạng thái beta, có thể gặp bug
  • Một số engine nặng yêu cầu GPU/VRAM mạnh
  • Chất lượng từng ngôn ngữ phụ thuộc engine được chọn
  • Không hỗ trợ thiết bị di động (iOS/Android)
  • License AGPL-3.0 có thể gây khó khăn nếu muốn thương mại hóa đóng gói

Nguồn: github.com/debpalash/VoiceStudio — Bài phân tích bởi danhbaai.com.

Subscribe
Notify of
guest

0 Comments
Oldest
Newest
Danh Bạ AI
Logo
Register New Account