
speech-to-speech là một pipeline voice‑agent độ trễ thấp, gồm bốn khối VAD → STT → LLM → TTS, được mở rộng dưới dạng thư viện Python và giao diện WebSocket tương thích OpenAI Realtime. Người dùng có thể hoán đổi bất kỳ thành phần nào bằng các mô hình có sẵn trên Hugging Face Hub hoặc tự chạy trên phần cứng cá nhân.
Pipeline chạy trên từng luồng riêng, kết nối qua các queue, cho phép đồng thời xử lý âm thanh và văn bản. Mặc định sử dụng Parakeet TDT cho STT, một LLM tương thích OpenAI và Qwen3‑TTS cho TTS. Người dùng có thể thay thế LLM bằng Gemma‑4 chạy trên llama.cpp, hoặc dùng các backend TTS khác như Kokoro‑82M, Pocket, ChatTTS, MMS. Đối với GPU, dự án cung cấp các wheel CUDA phù hợp (12.8, 13.x) và tùy chọn CPU‑only.
Việc cài đặt chỉ cần một lệnh pip install speech-to-speech, sau đó khởi chạy lệnh speech-to-speech để mở server WebSocket tại ws://localhost:8765/v1/realtime. Tài liệu chi tiết các flag CLI, các phụ thuộc hệ thống và cách cài đặt backend Qwen3‑TTS cho CUDA/CPU được cung cấp trong README.
Với khả năng chạy hoàn toàn nội địa và mở rộng linh hoạt, speech-to-speech giúp các nhà phát triển Việt Nam xây dựng voice‑assistant, robot giao tiếp hoặc các ứng dụng thoại mà không phụ thuộc vào dịch vụ đám mây, giảm chi phí và tăng bảo mật dữ liệu.
Nguồn: GitHub Trending — Biên dịch & tổng hợp: danhbaai.com