# LuxTTS - 1GB显存的极速TTS声音克隆 > 150倍实时速度,48kHz高清音质,3秒参考音频克隆声音,Apache 2.0免费商用 LuxTTS 是一个基于 ZipVoice 架构蒸馏的轻量级文本转语音(TTS)声音克隆模型,只需 1GB 显存即可运行,生成速度达到 150 倍实时。 ## 核心亮点 - **极致轻量**:仅需 1GB 显存,任何本地 GPU 都能跑,CPU 也能实时生成 - **150x 实时速度**:单 GPU 上 4 步采样即可完成生成 - **48kHz 高清音质**:相比大多数 TTS 模型的 24kHz,LuxTTS 输出清晰 48kHz 音频 - **声音克隆**:提供 3 秒参考音频即可克隆声音,效果媲美 10 倍大模型 - **Apache 2.0 许可**:商用免费,无任何限制 - **多平台支持**:GPU(CUDA)、CPU、Mac(MPS)均可运行 ## 快速开始 ```bash git clone https://github.com/ysharma3501/LuxTTS.git cd LuxTTS pip install -r requirements.txt ``` ```python from zipvoice.luxvoice import LuxTTS import soundfile as sf # 加载模型(Mac 用 device='mps') lux_tts = LuxTTS('YatharthS/LuxTTS', device='cuda') # 准备参考音频(至少3秒) encoded_prompt = lux_tts.encode_prompt('reference.wav', rms=0.01) # 生成语音 wav = lux_tts.generate_speech("你好,这是一段测试语音。", encoded_prompt, num_steps=4) sf.write('output.wav', wav.numpy().squeeze(), 48000) ``` ## 采样参数调节 | 参数 | 默认值 | 说明 | |------|--------|------| | `num_steps` | 4 | 采样步数,越高音质越好但越慢(3-4 最优) | | `t_shift` | 0.9 | 越高音质越好但发音可能出错 | | `speed` | 1.0 | 语速控制,越低越慢 | | `rms` | 0.01 | 音量,越高越响 | | `return_smooth` | False | 金属感消除,开启后更平滑但清晰度降低 | | `ref_duration` | 5 | 参考音频时长,降低可加速,出现伪影则设 1000 | ## 社区生态 - [LuxTTS-Gradio](https://github.com/NidAll/LuxTTS-Gradio) — Gradio Web UI - [OptiClone](https://github.com/ycharfi09/OptiClone) — 精美 UI 应用 - [LuxTTS-ComfyUI](https://github.com/DragonDiffusionbyBoyo/BoyoLuxTTS-Comfyui) — ComfyUI 节点 - [Lux-TTS ONNX](https://github.com/ningyos/luxtts-onnx) — ONNX 推理版本 - [FalAI](https://fal.ai/models/fal-ai/lux-tts) — 在线试用 ## 与同类模型对比 | 模型 | 显存需求 | 音质 | 速度 | 声音克隆 | |------|---------|------|------|---------| | **LuxTTS** | **~1GB** | **48kHz** | **150x** | ✅ 3秒参考 | | Qwen3-TTS | 较大 | 高 | 97ms流式 | ✅ 3秒克隆 | | XTTS v2 | ~4GB | 24kHz | ~10x | ✅ 3秒参考 | | Bark | ~4GB | 24kHz | ~5x | ❌ 无精确克隆 | ## 适合场景 - 本地低资源部署(笔记本/轻薄本即可) - 批量语音生成(150x 速度优势明显) - 需要声音克隆但 GPU 资源有限的项目 - 嵌入到应用中作为 TTS 后端 --- **分类**:软件 **标签**:声音 · 克隆 · LuxTTS **作者**:Xiao.Xi **链接**:https://octohz.com/p/1907