LuxTTS - 1GB显存的极速TTS声音克隆

LuxTTS - 1GB显存的极速TTS声音克隆


150倍实时速度,48kHz高清音质,3秒参考音频克隆声音,Apache 2.0免费商用

LuxTTS 是一个基于 ZipVoice 架构蒸馏的轻量级文本转语音(TTS)声音克隆模型,只需 1GB 显存即可运行,生成速度达到 150 倍实时。

核心亮点

  • 极致轻量:仅需 1GB 显存,任何本地 GPU 都能跑,CPU 也能实时生成
  • 150x 实时速度:单 GPU 上 4 步采样即可完成生成
  • 48kHz 高清音质:相比大多数 TTS 模型的 24kHz,LuxTTS 输出清晰 48kHz 音频
  • 声音克隆:提供 3 秒参考音频即可克隆声音,效果媲美 10 倍大模型
  • Apache 2.0 许可:商用免费,无任何限制
  • 多平台支持:GPU(CUDA)、CPU、Mac(MPS)均可运行

快速开始

git clone https://github.com/ysharma3501/LuxTTS.git
cd LuxTTS
pip install -r requirements.txt
from zipvoice.luxvoice import LuxTTS
import soundfile as sf

# 加载模型(Mac 用 device='mps')
lux_tts = LuxTTS('YatharthS/LuxTTS', device='cuda')

# 准备参考音频(至少3秒)
encoded_prompt = lux_tts.encode_prompt('reference.wav', rms=0.01)

# 生成语音
wav = lux_tts.generate_speech("你好,这是一段测试语音。", encoded_prompt, num_steps=4)
sf.write('output.wav', wav.numpy().squeeze(), 48000)

采样参数调节

参数默认值说明
num_steps4采样步数,越高音质越好但越慢(3-4 最优)
t_shift0.9越高音质越好但发音可能出错
speed1.0语速控制,越低越慢
rms0.01音量,越高越响
return_smoothFalse金属感消除,开启后更平滑但清晰度降低
ref_duration5参考音频时长,降低可加速,出现伪影则设 1000

社区生态

与同类模型对比

模型显存需求音质速度声音克隆
LuxTTS~1GB48kHz150x✅ 3秒参考
Qwen3-TTS较大97ms流式✅ 3秒克隆
XTTS v2~4GB24kHz~10x✅ 3秒参考
Bark~4GB24kHz~5x❌ 无精确克隆

适合场景

  • 本地低资源部署(笔记本/轻薄本即可)
  • 批量语音生成(150x 速度优势明显)
  • 需要声音克隆但 GPU 资源有限的项目
  • 嵌入到应用中作为 TTS 后端
7900举报0Xiao.Xi1个月前
点击获取 ^_^
被收录:

暂无评论