MiniMax H3 — 开源全模态视频生成模型

MiniMax H3 — 开源全模态视频生成模型


33B参数开源视频生成模型,文生视频/图生视频/首尾帧过渡,原生同步音频,支持2K,ComfyUI Day-0原生支持

这是什么

MiniMax 于 2026年8月3日 开源的全模态生成模型,33B参数(Omni Transformer架构), 能统一理解文本、图像、视频、音频的多模态上下文,生成带原生立体声音频的视频, 最高支持 2K分辨率、15秒时长

ComfyUI 同日就跟进了原生支持(Day-0),官方提供 T2V(文生视频)、I2V(图生视频)、 R2V(参考图转视频)三种工作流模板。

亮点

  • 视频+音频一体生成:不是先生成视频再配音,是模型原生同步生成画面和立体声音频
  • 量化版本齐全:官方仓库提供 bf16/INT8/剪枝/NVFP4 多种量化,最小配置能在 RTX 3060 12GB 消费级显卡上跑通
  • 首尾帧控制:支持指定首帧和尾帧图片,做转场过渡视频,不只是单张图片驱动

实测体验

自己在双卡 RTX 3090 Ti 上部署了 INT8 剪枝版(minimax_h3_fl2va_pruned_int8_convrot), 配 ComfyUI + ComfyUI-MultiGPU 插件跑通:

  • 文本编码器(~15GB)+ 扩散模型(~20GB)分别常驻两张卡,避免单卡显存不够时的内存 offload
  • 默认参数(1344×768,124帧≈5秒,20步采样)单次生成约 35分钟
  • 生成质量不错,细节和运镜都比较自然(见封面图,灯塔+海浪+海鸥的实际生成结果截帧)

部署门槛

官方没有公布显存需求矩阵,社区反馈从 RTX 3060 12GB(基础工作流)到 RTX 4090 都有人跑通, 差异较大,建议先用小分辨率/短时长跑通再逐步加参数。多卡场景下 ComfyUI 原生不支持 张量并行,双卡只能靠 ComfyUI-MultiGPU 这类插件做"组件级拆分"(文本编码器/扩散模型分卡), 不会提升单次生成速度,只是缓解显存压力。

2500举报0Xiao.Xi8天前
点击获取 ^_^
被收录:

暂无评论