
83 万下载的开源视频模型天花板——文生视频/图生视频/音视频同步/4K 20 秒,8GB 显存量化可跑
这是什么
LTX-2.5 是 Lightricks 最新开源的视频生成基础模型(8 月发布),83 万下载量,开源视频模型里目前最强的一批。不仅能文生视频、图生视频、视频编辑,还原生支持音视频同步生成——给一段音乐或对话,它能把视频画面和声音对上。22B 参数,ComfyUI 已支持,HuggingFace 可下载。
相比 LTX-2.3 升级了什么
- 原生多镜头:一次生成多场景,角色、环境、光照、声音跨镜头保持一致,不用自己拼接
- Diffusion Fidelity Rendering:复杂场景(人群、快速运动、密集细节)分配更多算力,不会再糊成一片
- Diffusion Video Decoder:用人脸清晰度、文字可读性大幅提升,不再像 2.3 那样面部和文字容易模糊
- Gemma 4 12B 文本编码器:理解力暴涨,能同时追踪多个角色、动作、镜头指令
- Auto Duration:模型自己判断动作需要多长,不用手动设时长
- 音视频同步:Audio-to-Video 终于来了,配乐、对话、音效都能对上画面
两个版本
| Fast(蒸馏版) | Pro(高质量版) | |
|---|---|---|
| 定位 | 速度快、支持 4K 和 20 秒 | 画质优先 |
| 分辨率 | 720p / 1080p / 2K / 4K | 720p / 1080p |
| 最长时长 | 20 秒(720p) | 10 秒 |
| 画面瑕疵率 | 0.39/clip | 0.28/clip |
| 生成速度 | 2x GB200 上 720p 6.8 秒 | 同栈,质量优先 |
本地部署要求
- 官方最低:16GB 显存(FP8/INT8 量化)
- 全精度:约 66GB 显存(需要 80GB 卡如 A100/H100)
- 8GB 显存也能跑:INT8 量化 + ComfyUI 优化后,RTX 5060/4060 8GB 实测可以生成 2.5K 视频
- 内存:建议 32GB+
- ComfyUI 已支持:有现成 workflow,节点都齐了
- LTX Desktop:官方桌面客户端,16GB 显存即可运行
模型下载
- Lightricks/LTX-2.5:主仓库,ComfyUI 对齐的 split pack(需同意协议)
- Lightricks/LTX-2.5-Diffusers:Diffusers 格式,含 22B distilled LoRA
- Lightricks/LTX-2.5-Pre-Trained:原生预训练权重(没做 SFT,适合微调和 LoRA 训练)
许可证
LTX-2.x Community License——年收入 1000 万美元以下免费商用,超过需付费。微调后的模型转移可能需要付费授权。不是 Apache/MIT,但个人和小团队免费没问题。
API 价格(不自己部署的话)
| 720p | 1080p | 2K | 4K | |
|---|---|---|---|---|
| Fast | $0.09/秒 | $0.13/秒 | $0.19/秒 | $0.30/秒 |
| Pro | $0.12/秒 | $0.17/秒 | — | — |
适合谁
- 想本地跑视频生成的(ComfyUI 用户必试)
- 需要音视频同步能力的创作者
- 想微调/训练自己领域视频模型的团队
- 8-24GB 显存的普通玩家(量化版能跑)
注意
- HF 模型需登录并同意 Lightricks 协议才能下载
- 22B 全精度对显存要求高,量化是刚需
- 非 Apache 开源,商用注意许可证条款
