
150倍实时速度,48kHz高清音质,3秒参考音频克隆声音,Apache 2.0免费商用
LuxTTS 是一个基于 ZipVoice 架构蒸馏的轻量级文本转语音(TTS)声音克隆模型,只需 1GB 显存即可运行,生成速度达到 150 倍实时。
核心亮点
- 极致轻量:仅需 1GB 显存,任何本地 GPU 都能跑,CPU 也能实时生成
- 150x 实时速度:单 GPU 上 4 步采样即可完成生成
- 48kHz 高清音质:相比大多数 TTS 模型的 24kHz,LuxTTS 输出清晰 48kHz 音频
- 声音克隆:提供 3 秒参考音频即可克隆声音,效果媲美 10 倍大模型
- Apache 2.0 许可:商用免费,无任何限制
- 多平台支持:GPU(CUDA)、CPU、Mac(MPS)均可运行
快速开始
git clone https://github.com/ysharma3501/LuxTTS.git
cd LuxTTS
pip install -r requirements.txt
from zipvoice.luxvoice import LuxTTS
import soundfile as sf
# 加载模型(Mac 用 device='mps')
lux_tts = LuxTTS('YatharthS/LuxTTS', device='cuda')
# 准备参考音频(至少3秒)
encoded_prompt = lux_tts.encode_prompt('reference.wav', rms=0.01)
# 生成语音
wav = lux_tts.generate_speech("你好,这是一段测试语音。", encoded_prompt, num_steps=4)
sf.write('output.wav', wav.numpy().squeeze(), 48000)
采样参数调节
| 参数 | 默认值 | 说明 |
|---|---|---|
num_steps | 4 | 采样步数,越高音质越好但越慢(3-4 最优) |
t_shift | 0.9 | 越高音质越好但发音可能出错 |
speed | 1.0 | 语速控制,越低越慢 |
rms | 0.01 | 音量,越高越响 |
return_smooth | False | 金属感消除,开启后更平滑但清晰度降低 |
ref_duration | 5 | 参考音频时长,降低可加速,出现伪影则设 1000 |
社区生态
- LuxTTS-Gradio — Gradio Web UI
- OptiClone — 精美 UI 应用
- LuxTTS-ComfyUI — ComfyUI 节点
- Lux-TTS ONNX — ONNX 推理版本
- FalAI — 在线试用
与同类模型对比
| 模型 | 显存需求 | 音质 | 速度 | 声音克隆 |
|---|---|---|---|---|
| LuxTTS | ~1GB | 48kHz | 150x | ✅ 3秒参考 |
| Qwen3-TTS | 较大 | 高 | 97ms流式 | ✅ 3秒克隆 |
| XTTS v2 | ~4GB | 24kHz | ~10x | ✅ 3秒参考 |
| Bark | ~4GB | 24kHz | ~5x | ❌ 无精确克隆 |
适合场景
- 本地低资源部署(笔记本/轻薄本即可)
- 批量语音生成(150x 速度优势明显)
- 需要声音克隆但 GPU 资源有限的项目
- 嵌入到应用中作为 TTS 后端
暂无评论
