
33B参数开源视频生成模型,文生视频/图生视频/首尾帧过渡,原生同步音频,支持2K,ComfyUI Day-0原生支持
这是什么
MiniMax 于 2026年8月3日 开源的全模态生成模型,33B参数(Omni Transformer架构), 能统一理解文本、图像、视频、音频的多模态上下文,生成带原生立体声音频的视频, 最高支持 2K分辨率、15秒时长。
ComfyUI 同日就跟进了原生支持(Day-0),官方提供 T2V(文生视频)、I2V(图生视频)、 R2V(参考图转视频)三种工作流模板。
亮点
- 视频+音频一体生成:不是先生成视频再配音,是模型原生同步生成画面和立体声音频
- 量化版本齐全:官方仓库提供 bf16/INT8/剪枝/NVFP4 多种量化,最小配置能在 RTX 3060 12GB 消费级显卡上跑通
- 首尾帧控制:支持指定首帧和尾帧图片,做转场过渡视频,不只是单张图片驱动
实测体验
自己在双卡 RTX 3090 Ti 上部署了 INT8 剪枝版(minimax_h3_fl2va_pruned_int8_convrot), 配 ComfyUI + ComfyUI-MultiGPU 插件跑通:
- 文本编码器(~15GB)+ 扩散模型(~20GB)分别常驻两张卡,避免单卡显存不够时的内存 offload
- 默认参数(1344×768,124帧≈5秒,20步采样)单次生成约 35分钟
- 生成质量不错,细节和运镜都比较自然(见封面图,灯塔+海浪+海鸥的实际生成结果截帧)
部署门槛
官方没有公布显存需求矩阵,社区反馈从 RTX 3060 12GB(基础工作流)到 RTX 4090 都有人跑通, 差异较大,建议先用小分辨率/短时长跑通再逐步加参数。多卡场景下 ComfyUI 原生不支持 张量并行,双卡只能靠 ComfyUI-MultiGPU 这类插件做"组件级拆分"(文本编码器/扩散模型分卡), 不会提升单次生成速度,只是缓解显存压力。
暂无评论
