
LTX-2.5 完整指南:22B 开源视频模型,速度优先的效率之王
一、模型概述
LTX-2.5 是 Lightricks 旗下 LTX 团队(2026 年独立)发布的第三代开源视频生成模型,22B 参数 Diffusion Transformer。2026 年 8 月 11 日发布,开源权重在 Hugging Face。
核心定位:不是画质最强的,但生成速度最快的开源视频模型之一。2K 分辨率 5 秒视频,RTX 4090 约 47 秒生成。
许可证
- 年收入 $10M 以下:免费商用(LTX-2.x Community License)
- 年收入 $10M 以上:需购买付费商业许可
- LoRA 微调权重转移可能需要付费许可
两个版本
| 版本 | 定位 | 最高分辨率 | 端点 |
|---|---|---|---|
| ltx-2-5-fast | 速度优先,蒸馏 8 步 | 4K | 文生/图生/音生视频 |
| ltx-2-5-pro | 画质优先 | 1080p | 文生/图生/音生视频 |
Pro 版仅 API 可用,本地部署的是 Fast 版。
二、为什么这么快
2.1 蒸馏(核心)
- 将完整模型的多步生成压缩为约 8 步
- 引导(guidance)也学进了蒸馏模型,推理时每步不用算两遍
- 蒸馏版和完整版参数量相同(都是 22B),变快的关键是步数少+单步计算少
2.2 极致潜空间压缩
- 潜空间压缩比 1:192(主流模型通常更低)
- Transformer 每步处理的 Token 数大幅减少
- 细节交给解码器补充
2.3 Diffusion Fidelity Rendering(扩散保真渲染)
- 不平均分配计算量,而是按场景复杂度动态分配算力
- 人脸、文字、快速运动区域多算;静止背景少算
- 在画质和速度之间找到更优的平衡
2.4 速度实测(社区数据)
| 硬件 | 分辨率 | 5 秒 | 10 秒 | 15 秒 |
|---|---|---|---|---|
| RTX 4090 | 2K | ~47s | ~90s | ~155s |
| RTX 3060 12GB | 2K | 可跑 | 较慢 | 较慢 |
| 2× GB200(官方) | 720p | 6.8s | — | — |
| Mac Studio MLX | — | ~53s | — | — |
| Mac Studio MPS | — | ~853s | — | 不推荐 |
三、新特性(相比 LTX-2)
3.1 原生多镜头(Native Multi-Shot)
单次生成可产出多个连接的镜头,角色、场景、光照、视觉风格和声音在镜头切换间保持一致。适合直接生成有剪辑的视频片段。
3.2 更强的提示词理解
文本编码器升级为 Gemma 4 12B + 自定义 Prompt Enhancer,能用更短更简单的提示词控制复杂创意。
3.3 自动时长预测(Auto Duration)
根据请求的动作内容自动判断合适的视频长度,不需要手动指定秒数。
3.4 Diffusion Video Decoder
全新的视频解码器,减少运动伪影,更平滑自然的运动效果。
3.5 原生 4K HDR + 立体声音频
Fast 版支持 4K HDR 输出,视频和音频在同一个前向传播中联合生成。
四、支持的任务
| 任务 | Fast | Pro |
|---|---|---|
| 文生视频(T2V) | ✅ | ✅ |
| 图生视频(I2V) | ✅ | ✅ |
| 音生视频(A2V) | ✅ | ✅ |
| 视频重拍(Retake) | ❌ | ❌ |
| 视频延长(Extend) | ❌ | ❌ |
| 画面重构(Reframe) | ❌ | ❌ |
| LoRA 微调 | ✅ | — |
五、本地部署
5.1 下载模型
HuggingFace: Lightricks/LTX-2.5(需同意协议后下载)
5.2 GPU 部署(NVIDIA)
pip install ltx-video
显存需求:
| 配置 | 最低显存 | 说明 |
|---|---|---|
| FP16 全精度 | ~40GB | 需要 A100/4090 |
| 量化(int4/qint8) | ~12-16GB | RTX 3060/4060 可跑 |
5.3 LTX Desktop(⭐ 最简单,Win/Linux/Mac)
Lightricks/LTX-Desktop(1906 stars),官方桌面应用:
- 支持 Windows/Linux NVIDIA 和 Apple Silicon Mac
- 开箱即用,默认 LTX 2.5 Fast
- 支持文生视频、图生视频、非线性编辑
- Beta 状态
5.4 ComfyUI
ComfyUI 内置 LTX 支持,直接加载模型使用。
5.5 在线 API
官方 API:ltx.io,注册即用,支持 Pro 版。
六、Mac / Apple Silicon 部署
6.1 LTX Desktop(推荐普通用户)
官方桌面应用直接支持 Apple Silicon,下载安装即用。
6.2 MLX 一行命令(⭐ 推荐,16x 加速)
curl -fsSL https://gist.githubusercontent.com/DanielHauschildt/9ad1d7cef482ed508a121881280b74dd/raw/generate -o generate
chmod +x generate
./generate "A wide shot of a rainy city at dusk..."
- 53 秒 vs PyTorch MPS 的 853 秒
- 首次运行自动下载 MLX 运行时 + ~36GB 权重
- 支持音频生成
- 适配 macOS 26 watchdog / eval-guard
6.3 Swift + MLX 原生实现
VincentGourbin/ltx-video-swift-mlx:
- 支持文生视频、图生视频、视频重拍、音频生成
- **支持 LoRA 训练(QLoRA)**和推理
- 支持 qint8/int4 量化
6.4 Mac 硬件要求
| 配置 | 最低 | 推荐 |
|---|---|---|
| 芯片 | M1 | M2 Pro+ |
| 内存 | 32GB | 64GB+ |
| 磁盘 | ~50GB 空闲 | SSD |
七、LoRA 微调
LTX-2.5 支持在 Apple Silicon 上进行 QLoRA 微调(通过 ltx-video-swift-mlx),可以定制风格、角色、场景等。
八、与其他开源模型对比
| LTX-2.5 | MiniMax H3 | Wan 3.0 | Kling 3 | |
|---|---|---|---|---|
| 参数量 | 22B | 33B | — | — |
| 开源 | ✅ | ✅ | ✅ | ❌ |
| 原生音频 | ✅ | ✅ | ❌ | ❌ |
| 最高分辨率 | 4K | 2K | — | 2K |
| 单次最长 | ~15s | 15s | — | — |
| 2K/5s 生成速度 | ~47s (4090) | ~6min (4090) | — | — |
| 多镜头 | ✅ | ❌ | ❌ | ❌ |
| Mac 支持 | ✅ MLX | ❌ | ❌ | ❌ |
| 免费商用 | ✅(<$10M) | ✅ | ✅ | ❌ |
LTX-2.5 的核心优势是速度+Mac 支持+多镜头,画质不是最强但效率最高。
九、适用场景
- 自媒体过场素材:几秒钟的 B-roll,47 秒出片效率极高
- 广告/电商:一张产品图快速生成多场景多镜头版本
- 影视前期预演:导演快速将想法变成视频,做分镜或预演
- 实时创作:生成速度快到可以反复尝试,从「等几分钟」变成「生成-修改-再生成」的快速循环
- Mac 用户:唯一原生支持 Apple Silicon MLX 加速的主流开源视频模型
十、已知局限
- 画质不是顶级,与 MiniMax H3、Kling 3 等闭源模型有差距
- 复杂人物动作、多人交互、手部细节仍有明显 AI 痕迹
- Fast 版的 8 步蒸馏会牺牲一些画质
- Retake / Extend / Reframe 功能尚未支持
- PyTorch MPS 路径非常慢(853s),必须用 MLX
入口
- 官方权重:HuggingFace: Lightricks/LTX-2.5
- 官方文档:docs.ltx.io
- 官方网站:ltx.io/model/ltx-2-5
- LTX Desktop:GitHub
- Mac MLX 一行命令:Gist
- Swift + MLX:GitHub
- PyPI 包:
pip install ltx-video - 技术详解:note.com 长文
暂无评论
