OmniVoice: TTS 600+ ngôn ngữ chạy local, miễn phí
Test thật OmniVoice (Xiaomi + k2-fsa): clone giọng tiếng Việt 24kHz chạy GPU 8GB, RTF 0.025. Verdict cho người làm video cần TTS local.
OmniVoice: TTS 600+ ngôn ngữ chạy local, miễn phí
Cần giọng đọc tiếng Việt tự nhiên cho video nhưng không muốn trả phí theo tháng kiểu ElevenLabs? Tôi dùng OmniVoice (Xiaomi Research + k2-fsa) lồng tiếng 2 bộ visual novel thật, chạy local ngay trên GPU 8GB. Bài này là test thật, số liệu từ máy tôi.
Vấn đề
TTS tiếng Việt trên thị trường rơi vào 2 cực:
- Online (ElevenLabs, Google): giọng tốt nhưng trả phí theo ký tự, text bắt buộc upload lên cloud.
- Local (Coqui, Piper...): miễn phí nhưng tiếng Việt nhiều bản là tái đóng gói, giọng máy móc, không clone được giọng gốc.
Tôi cần thứ ở giữa: local, miễn phí, tiếng Việt tự nhiên, có clone giọng.
Setup
| Thành phần | Giá trị |
|---|---|
| Model | k2-fsa/OmniVoice (v0.2.1, Apache 2.0) |
| Hardware | RTX 2060 8GB, CUDA 13.3 |
| Dependencies | torch 2.8, torchaudio 2.8, transformers 5.3+ |
| Output | WAV 24,000 Hz |
| ASR phụ trợ | openai/whisper-large-v3-turbo (tự transcribe ref audio) |
Cài nhanh:
python -m venv .venv && .venv/Scripts/activate
pip install "torch==2.8.0" "torchaudio==2.8.0"
pip install omnivoice
Kết quả test
Tốc độ
Thông số nhà phát hành: RTF 0.025 trên H100 (40x realtime), có FlashInfer là 0.0115. Trên RTX 2060 (không FlashInfer) chậm hơn nhưng vẫn nhanh — render 10 phút đối thoại chỉ mất vài phút.
Config tôi đang dùng (từ pipeline):
| Config | Giá trị |
|---|---|
| Device | cuda:0, dtype float16 |
| Speed | 0.9 |
| Sample rate | 24,000 Hz |
| Đã render thật | 2 series visual novel, 5-7 giọng/series |
651 ngôn ngữ — đếm thật trong source
File lang_map.py của dự án có 651 entry ánh xạ ISO 639-3. Nhà phát hành ghi 600+,
đếm lại đúng thật.
3 chế độ sinh giọng
- Voice cloning — đưa ref audio 5-15 giây + text (hoặc để Whisper tự transcribe), nó clone giọng. Tôi dùng nhiều nhất.
- Voice design — mô tả "nữ, trẻ, nhẹ nhàng", không cần ref audio.
- Auto voice — model tự chọn giọng theo text.
Chất lượng tiếng Việt
Clone giọng để lồng tiếng visual novel — tự nhiên hơn hẳn Piper tiếng Việt. Có nhãn
cảm xúc [laughter], [sigh], [question-ah]..., chỉnh được tốc độ. Giọng nam trầm +
speed 0.9 ra chất đọc kể chuyện khá ổn.
Chi phí
- Phần mềm: 0 VND. Apache 2.0, chạy local, không giới hạn ký tự, không gửi dữ liệu lên cloud.
- GPU: RTX 2060 8GB đủ. Không có GPU thì Apple Silicon (MPS) / Intel Arc (XPU) dùng được — chậm hơn.
- So sánh: ElevenLabs trả theo gói + theo ký tự; tự host OmniVoice coi như 0đ nếu đã có GPU — đổi lại tự setup, tự bảo trì.
Giới hạn
- Setup có ngưỡng: cài đúng CUDA, model nhiều GB, cần máy đủ VRAM — không phải bấm nút là xong.
- Ref audio bẩn (nhiều tạp âm) → giọng clone kém. Cần chỉnh ref trước.
- Tiếng Việt là 1 trong 651 ngôn ngữ chung, không có pipeline riêng "chuyên VN" như TTS thương mại — nhưng đủ tốt cho video, kể chuyện.
- Chưa test kỹ đọc dài liên tục (1 giờ); mới dùng cho đối thoại ngắt quãng.
- RTF 0.025 là số của H100, đừng kỳ vọng trên máy 8GB.
Verdict
Nên dùng nếu bạn làm video/có GPU ≥ 8GB, muốn TTS tiếng Việt + clone giọng free không lệ thuộc cloud. Đây là lựa chọn duy nhất mình thấy cân bằng đủ 3 trục: tự nhiên / miễn phí / có clone giọng.
Không nên dùng nếu bạn không có GPU và ngại cài CUDA — lúc đó TTS online đỡ đau hơn.
Cài thử bản HF Space trước khi nhảy vào setup nặng: search k2-fsa/OmniVoice trên
HuggingFace Spaces.
Cùng hạ tầng GPU, anh em mình có ComfyUI MiniMax H3 chạy trên 8GB — xem bài bên cạnh nếu chưa. `