# MiniMax H3 — 开源全模态视频生成模型 > 33B参数开源视频生成模型,文生视频/图生视频/首尾帧过渡,原生同步音频,支持2K,ComfyUI Day-0原生支持 ## 这是什么 MiniMax 于 2026年8月3日 开源的全模态生成模型,33B参数(Omni Transformer架构), 能统一理解文本、图像、视频、音频的多模态上下文,生成带**原生立体声音频**的视频, 最高支持 **2K分辨率、15秒时长**。 ComfyUI 同日就跟进了原生支持(Day-0),官方提供 T2V(文生视频)、I2V(图生视频)、 R2V(参考图转视频)三种工作流模板。 ## 亮点 - **视频+音频一体生成**:不是先生成视频再配音,是模型原生同步生成画面和立体声音频 - **量化版本齐全**:官方仓库提供 bf16/INT8/剪枝/NVFP4 多种量化,最小配置能在 RTX 3060 12GB 消费级显卡上跑通 - **首尾帧控制**:支持指定首帧和尾帧图片,做转场过渡视频,不只是单张图片驱动 ## 实测体验 自己在双卡 RTX 3090 Ti 上部署了 INT8 剪枝版(minimax_h3_fl2va_pruned_int8_convrot), 配 ComfyUI + ComfyUI-MultiGPU 插件跑通: - 文本编码器(~15GB)+ 扩散模型(~20GB)分别常驻两张卡,避免单卡显存不够时的内存 offload - 默认参数(1344×768,124帧≈5秒,20步采样)单次生成约 **35分钟** - 生成质量不错,细节和运镜都比较自然(见封面图,灯塔+海浪+海鸥的实际生成结果截帧) ## 部署门槛 官方没有公布显存需求矩阵,社区反馈从 RTX 3060 12GB(基础工作流)到 RTX 4090 都有人跑通, 差异较大,建议先用小分辨率/短时长跑通再逐步加参数。多卡场景下 ComfyUI 原生不支持 张量并行,双卡只能靠 ComfyUI-MultiGPU 这类插件做"组件级拆分"(文本编码器/扩散模型分卡), 不会提升单次生成速度,只是缓解显存压力。 --- **分类**:软件 **标签**:视频 · 模型 · 生成 **作者**:Xiao.Xi **链接**:https://octohz.com/p/1983