LTX-2.5 完整指南:22B 开源视频模型,速度优先

LTX-2.5 完整指南:22B 开源视频模型,速度优先


2K/5秒视频47秒生成,RTX3060可跑,Mac MLX原生支持,多镜头+立体声,免费商用(年入<0M)

LTX-2.5 完整指南:22B 开源视频模型,速度优先的效率之王

一、模型概述

LTX-2.5 是 Lightricks 旗下 LTX 团队(2026 年独立)发布的第三代开源视频生成模型,22B 参数 Diffusion Transformer。2026 年 8 月 11 日发布,开源权重在 Hugging Face。

核心定位:不是画质最强的,但生成速度最快的开源视频模型之一。2K 分辨率 5 秒视频,RTX 4090 约 47 秒生成。

许可证

  • 年收入 $10M 以下:免费商用(LTX-2.x Community License)
  • 年收入 $10M 以上:需购买付费商业许可
  • LoRA 微调权重转移可能需要付费许可

两个版本

版本定位最高分辨率端点
ltx-2-5-fast速度优先,蒸馏 8 步4K文生/图生/音生视频
ltx-2-5-pro画质优先1080p文生/图生/音生视频

Pro 版仅 API 可用,本地部署的是 Fast 版。

二、为什么这么快

2.1 蒸馏(核心)

  • 将完整模型的多步生成压缩为约 8 步
  • 引导(guidance)也学进了蒸馏模型,推理时每步不用算两遍
  • 蒸馏版和完整版参数量相同(都是 22B),变快的关键是步数少+单步计算少

2.2 极致潜空间压缩

  • 潜空间压缩比 1:192(主流模型通常更低)
  • Transformer 每步处理的 Token 数大幅减少
  • 细节交给解码器补充

2.3 Diffusion Fidelity Rendering(扩散保真渲染)

  • 不平均分配计算量,而是按场景复杂度动态分配算力
  • 人脸、文字、快速运动区域多算;静止背景少算
  • 在画质和速度之间找到更优的平衡

2.4 速度实测(社区数据)

硬件分辨率5 秒10 秒15 秒
RTX 40902K~47s~90s~155s
RTX 3060 12GB2K可跑较慢较慢
2× GB200(官方)720p6.8s——
Mac Studio MLX—~53s——
Mac Studio MPS—~853s—不推荐

三、新特性(相比 LTX-2)

3.1 原生多镜头(Native Multi-Shot)

单次生成可产出多个连接的镜头,角色、场景、光照、视觉风格和声音在镜头切换间保持一致。适合直接生成有剪辑的视频片段。

3.2 更强的提示词理解

文本编码器升级为 Gemma 4 12B + 自定义 Prompt Enhancer,能用更短更简单的提示词控制复杂创意。

3.3 自动时长预测(Auto Duration)

根据请求的动作内容自动判断合适的视频长度,不需要手动指定秒数。

3.4 Diffusion Video Decoder

全新的视频解码器,减少运动伪影,更平滑自然的运动效果。

3.5 原生 4K HDR + 立体声音频

Fast 版支持 4K HDR 输出,视频和音频在同一个前向传播中联合生成。

四、支持的任务

任务FastPro
文生视频(T2V)✅✅
图生视频(I2V)✅✅
音生视频(A2V)✅✅
视频重拍(Retake)❌❌
视频延长(Extend)❌❌
画面重构(Reframe)❌❌
LoRA 微调✅—

五、本地部署

5.1 下载模型

HuggingFace: Lightricks/LTX-2.5(需同意协议后下载)

5.2 GPU 部署(NVIDIA)

pip install ltx-video

显存需求:

配置最低显存说明
FP16 全精度~40GB需要 A100/4090
量化(int4/qint8)~12-16GBRTX 3060/4060 可跑

5.3 LTX Desktop(⭐ 最简单,Win/Linux/Mac)

Lightricks/LTX-Desktop(1906 stars),官方桌面应用:

  • 支持 Windows/Linux NVIDIA 和 Apple Silicon Mac
  • 开箱即用,默认 LTX 2.5 Fast
  • 支持文生视频、图生视频、非线性编辑
  • Beta 状态

5.4 ComfyUI

ComfyUI 内置 LTX 支持,直接加载模型使用。

5.5 在线 API

官方 API:ltx.io,注册即用,支持 Pro 版。

六、Mac / Apple Silicon 部署

6.1 LTX Desktop(推荐普通用户)

官方桌面应用直接支持 Apple Silicon,下载安装即用。

6.2 MLX 一行命令(⭐ 推荐,16x 加速)

curl -fsSL https://gist.githubusercontent.com/DanielHauschildt/9ad1d7cef482ed508a121881280b74dd/raw/generate -o generate
chmod +x generate
./generate "A wide shot of a rainy city at dusk..."
  • 53 秒 vs PyTorch MPS 的 853 秒
  • 首次运行自动下载 MLX 运行时 + ~36GB 权重
  • 支持音频生成
  • 适配 macOS 26 watchdog / eval-guard

6.3 Swift + MLX 原生实现

VincentGourbin/ltx-video-swift-mlx:

  • 支持文生视频、图生视频、视频重拍、音频生成
  • **支持 LoRA 训练(QLoRA)**和推理
  • 支持 qint8/int4 量化

6.4 Mac 硬件要求

配置最低推荐
芯片M1M2 Pro+
内存32GB64GB+
磁盘~50GB 空闲SSD

七、LoRA 微调

LTX-2.5 支持在 Apple Silicon 上进行 QLoRA 微调(通过 ltx-video-swift-mlx),可以定制风格、角色、场景等。

八、与其他开源模型对比

LTX-2.5MiniMax H3Wan 3.0Kling 3
参数量22B33B——
开源✅✅✅❌
原生音频✅✅❌❌
最高分辨率4K2K—2K
单次最长~15s15s——
2K/5s 生成速度~47s (4090)~6min (4090)——
多镜头✅❌❌❌
Mac 支持✅ MLX❌❌❌
免费商用✅(<$10M)✅✅❌

LTX-2.5 的核心优势是速度+Mac 支持+多镜头,画质不是最强但效率最高。

九、适用场景

  • 自媒体过场素材:几秒钟的 B-roll,47 秒出片效率极高
  • 广告/电商:一张产品图快速生成多场景多镜头版本
  • 影视前期预演:导演快速将想法变成视频,做分镜或预演
  • 实时创作:生成速度快到可以反复尝试,从「等几分钟」变成「生成-修改-再生成」的快速循环
  • Mac 用户:唯一原生支持 Apple Silicon MLX 加速的主流开源视频模型

十、已知局限

  • 画质不是顶级,与 MiniMax H3、Kling 3 等闭源模型有差距
  • 复杂人物动作、多人交互、手部细节仍有明显 AI 痕迹
  • Fast 版的 8 步蒸馏会牺牲一些画质
  • Retake / Extend / Reframe 功能尚未支持
  • PyTorch MPS 路径非常慢(853s),必须用 MLX

入口

19200举报0子龙•28天前
点击获取 ^_^
被收录:

暂无评论