MiniMax H3 本地部署完整指南:从装机到出片

MiniMax H3 本地部署完整指南:从装机到出片


33B开源全模态视频模型,原生立体声,从3060到5090全覆盖的保姆级部署+提示词+加速教程

一、项目简介

MiniMax H3 是 2026 年 8 月开源的 33B 参数全模态视频生成模型,支持最高 2K、24fps、15 秒视频输出,原生同步生成立体声音频,Apache 2.0 开源协议。

当前 Video Arena 开源模型双榜第一(文生视频 + 图生视频),仅比闭源 Seedance 2.0 低 2 分。

三模块架构:

  • H3-Context-IR(闭源 API)— 提示词理解与编排
  • H3-Base(✅ 开源)— 33B 生成主体,输出 768p + 原生立体声
  • H3-Regenerate-2K(闭源 API)— 768p → 2K 重生成

本地部署的核心是 H3-Base,草稿和 768p 成片完全免费。

二、硬件门槛

  • 最低: RTX 3060 12GB + 32GB 内存 + NVMe SSD → 能跑 480p
  • 推荐: 24GB+ 显存(3090/4090 级别) → 768p 原生画布
  • 理想: 5090(32GB) → NVFP4 原生支持,更快更省
  • 内存不低于 32GB(底线),64GB 才从容
  • 30/40 系显卡选 INT8/FP8 量化,NVFP4 在非 50 系上反而更慢(软件模拟解压)

三、本地部署步骤(ComfyUI)

3.1 安装 ComfyUI ≥ 0.30.0

H3 原生支持节点在 2026-08-03 合并入 ComfyUI,旧版无法运行。

下载桌面版:https://github.com/Comfy-Org/ComfyUI

3.2 下载 4 个核心文件(约 40GB)

仓库:https://huggingface.co/Comfy-Org/MiniMax-H3

国内加速:huggingface.cohf-mirror.com

文件大小用途
minimax_h3_fl2va_pruned_int8_convrot.safetensors19.5GBDiT 主模型(T2V/I2V)
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors14.6GB文本编码器
minimax_h3_video_vae_fp16.safetensors5.2GB视频 VAE(画面)
minimax_h3_audio_vae_fp32.safetensors0.6GB音频 VAE(声音)

两个 VAE 都必须下,少了音频 VAE = 无声视频。

一键下载(国内):

export HF_ENDPOINT=https://hf-mirror.com
pip install -U huggingface_hub
hf download Comfy-Org/MiniMax-H3 \
  diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
  text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
  vae/minimax_h3_video_vae_fp16.safetensors \
  vae/minimax_h3_audio_vae_fp32.safetensors \
  --local-dir ComfyUI/models/

3.3 加载模板 → 跑通第一条视频

ComfyUI → 工作流 → 浏览模板 → 视频 → "MiniMax H3 Text to Video"

模板默认预览分辨率 768×432,4090 热跑约 99 秒出片。第一次含模型加载约 10 分钟。

四、三种生成模式

模式权重说明
T2V 文生视频fl2va纯文字生成
I2V 图生视频fl2va给首帧/尾帧
R2V 参考生视频ref2va(另下 19.5GB)锁定角色/画风/音色

R2V 是 H3 最强模式,支持最多 9 张参考图 + 3 条参考视频 + 3 条参考音频。

五、硬性参数规则(来自源码)

  • 帧数网格:17k+5(5、22、39、56…362),最长 15.08 秒
  • 原生画布:短边 768,最大 768×1344,每轴 32 倍数
  • 最低 384p,256p 必然失败
  • 分辨率降不了显存(大头是模型),OOM 就换更小量化

六、加速方案

方案效果画质影响
SageAttention 2.x每 步 省 ~24%无损
SageAttention + EasyCache累计省 ~42%SSIM≈0.96 轻微
SageAttention + TeaCache累计省 ~58%SSIM≈0.78 明显
Turbo LoRA20步→4-8步无损

💡 注意:

  • 网传 Turbo LoRA "5× 加速"是采样步数缩放,端到端实测 3.9×(14秒片从 15:57 到 4:03),VAE 解码和封装不跟着缩
  • EasyCache 是给原生 20 步设计的,跟 4 步 Turbo LoRA 不叠加,实测还多 5% 监控开销,别全都开
  • LoRA 生态现状:加速方向已成熟,人物/画风训练还没成气候,想训角色的先等等

⚠️ Cache 改变生成结果本身(同 seed 画面不同),不适合"草稿挑片→换配置复现"的工作流。正确用法:筛提示词用 Sage+TeaCache,正片用 Sage 或 Sage+EasyCache。

七、提示词语法(全文最核心)

H3 有官方结构化提示词格式,三字段骨架:

integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...

关键规则:

  • 镜头切换:[Shot 2] At 00:03.500, the camera cuts to...
  • 运镜写完整英文句子(类型+幅度+速度)
  • 对白用 (S1) 分配角色,台词放 <d>[语言] 台词</d> 标签内,一字不改
  • 配乐只写乐器和节奏,不写情绪词
  • I2V/R2V 有额外的首帧对齐指令

完整官方指南:https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md

偷懒法: 让任意 LLM 代劳——把官方指南链接和你的中文想法一起丢给它。

八、必备开源仓库

仓库用途
MiniMax-AI/MiniMax-H3官方仓库,权重+9个Skill
larryvrh/MiniMax-H3-Turbo-Lora加速 LoRA,20步→4-8步,实测 3.9×
NikoDemon80/ComfyUI-H3-Motion-Context长视频续接(H3 单次上限15秒)
T8mars/comfyui-minimax-h3-audio-T8音视频工作流合集
AIMixer/ComfyUI_MiniMaxH3_Director导演台工作流(T2V/I2V/R2V/V2V)
Icyoung/ComfyUI-MiniMaxH3-TeaCacheH3 专用 TeaCache 加速节点
kijai/ComfyUI-KJNodesSageAttention 补丁节点

九、保姆级教程出处

十、本地 vs API 成本对比

场景本地API
768p 草稿/试错免费¥0.50/秒
1080p(本地超分)免费¥0.50/秒
官方 2K不支持(本地)¥0.80/秒
768p→2K 重生成不支持¥0.30/秒

推荐策略: 试错本地跑(省 API 费),定稿 1080p 本地超分(免费),非要 2K 再走 API。

3300举报0Xiao.Xi4天前
点击获取 ^_^
被收录:

暂无评论