
一、项目简介
MiniMax H3 是 2026 年 8 月开源的 33B 参数全模态视频生成模型,支持最高 2K、24fps、15 秒视频输出,原生同步生成立体声音频,Apache 2.0 开源协议。
当前 Video Arena 开源模型双榜第一(文生视频 + 图生视频),仅比闭源 Seedance 2.0 低 2 分。
三模块架构:
- H3-Context-IR(闭源 API)— 提示词理解与编排
- H3-Base(✅ 开源)— 33B 生成主体,输出 768p + 原生立体声
- H3-Regenerate-2K(闭源 API)— 768p → 2K 重生成
本地部署的核心是 H3-Base,草稿和 768p 成片完全免费。
二、硬件门槛
- 最低: RTX 3060 12GB + 32GB 内存 + NVMe SSD → 能跑 480p
- 推荐: 24GB+ 显存(3090/4090 级别) → 768p 原生画布
- 理想: 5090(32GB) → NVFP4 原生支持,更快更省
- 内存不低于 32GB(底线),64GB 才从容
- 30/40 系显卡选 INT8/FP8 量化,NVFP4 在非 50 系上反而更慢(软件模拟解压)
三、本地部署步骤(ComfyUI)
3.1 安装 ComfyUI ≥ 0.30.0
H3 原生支持节点在 2026-08-03 合并入 ComfyUI,旧版无法运行。
下载桌面版:https://github.com/Comfy-Org/ComfyUI
3.2 下载 4 个核心文件(约 40GB)
仓库:https://huggingface.co/Comfy-Org/MiniMax-H3
国内加速:huggingface.co → hf-mirror.com
| 文件 | 大小 | 用途 |
|---|---|---|
minimax_h3_fl2va_pruned_int8_convrot.safetensors | 19.5GB | DiT 主模型(T2V/I2V) |
qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors | 14.6GB | 文本编码器 |
minimax_h3_video_vae_fp16.safetensors | 5.2GB | 视频 VAE(画面) |
minimax_h3_audio_vae_fp32.safetensors | 0.6GB | 音频 VAE(声音) |
两个 VAE 都必须下,少了音频 VAE = 无声视频。
一键下载(国内):
export HF_ENDPOINT=https://hf-mirror.com
pip install -U huggingface_hub
hf download Comfy-Org/MiniMax-H3 \
diffusion_models/minimax_h3_fl2va_pruned_int8_convrot.safetensors \
text_encoders/qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors \
vae/minimax_h3_video_vae_fp16.safetensors \
vae/minimax_h3_audio_vae_fp32.safetensors \
--local-dir ComfyUI/models/
3.3 加载模板 → 跑通第一条视频
ComfyUI → 工作流 → 浏览模板 → 视频 → "MiniMax H3 Text to Video"
模板默认预览分辨率 768×432,4090 热跑约 99 秒出片。第一次含模型加载约 10 分钟。
四、三种生成模式
| 模式 | 权重 | 说明 |
|---|---|---|
| T2V 文生视频 | fl2va | 纯文字生成 |
| I2V 图生视频 | fl2va | 给首帧/尾帧 |
| R2V 参考生视频 | ref2va(另下 19.5GB) | 锁定角色/画风/音色 |
R2V 是 H3 最强模式,支持最多 9 张参考图 + 3 条参考视频 + 3 条参考音频。
五、硬性参数规则(来自源码)
- 帧数网格:17k+5(5、22、39、56…362),最长 15.08 秒
- 原生画布:短边 768,最大 768×1344,每轴 32 倍数
- 最低 384p,256p 必然失败
- 分辨率降不了显存(大头是模型),OOM 就换更小量化
六、加速方案
| 方案 | 效果 | 画质影响 |
|---|---|---|
| SageAttention 2.x | 每 步 省 ~24% | 无损 |
| SageAttention + EasyCache | 累计省 ~42% | SSIM≈0.96 轻微 |
| SageAttention + TeaCache | 累计省 ~58% | SSIM≈0.78 明显 |
| Turbo LoRA | 20步→4-8步 | 无损 |
💡 注意:
- 网传 Turbo LoRA "5× 加速"是采样步数缩放,端到端实测 3.9×(14秒片从 15:57 到 4:03),VAE 解码和封装不跟着缩
- EasyCache 是给原生 20 步设计的,跟 4 步 Turbo LoRA 不叠加,实测还多 5% 监控开销,别全都开
- LoRA 生态现状:加速方向已成熟,人物/画风训练还没成气候,想训角色的先等等
⚠️ Cache 改变生成结果本身(同 seed 画面不同),不适合"草稿挑片→换配置复现"的工作流。正确用法:筛提示词用 Sage+TeaCache,正片用 Sage 或 Sage+EasyCache。
七、提示词语法(全文最核心)
H3 有官方结构化提示词格式,三字段骨架:
integrated_multimodal_description: [Shot 1] ...
overall_soundscape: ...
non_diegetic_music: ...
关键规则:
- 镜头切换:
[Shot 2] At 00:03.500, the camera cuts to... - 运镜写完整英文句子(类型+幅度+速度)
- 对白用
(S1)分配角色,台词放<d>[语言] 台词</d>标签内,一字不改 - 配乐只写乐器和节奏,不写情绪词
- I2V/R2V 有额外的首帧对齐指令
完整官方指南:https://huggingface.co/MiniMaxAI/MiniMax-H3/blob/main/docs/VIDEO_PROMPT_WRITING_GUIDE_base_en.md
偷懒法: 让任意 LLM 代劳——把官方指南链接和你的中文想法一起丢给它。
八、必备开源仓库
| 仓库 | 用途 |
|---|---|
| MiniMax-AI/MiniMax-H3 | 官方仓库,权重+9个Skill |
| larryvrh/MiniMax-H3-Turbo-Lora | 加速 LoRA,20步→4-8步,实测 3.9× |
| NikoDemon80/ComfyUI-H3-Motion-Context | 长视频续接(H3 单次上限15秒) |
| T8mars/comfyui-minimax-h3-audio-T8 | 音视频工作流合集 |
| AIMixer/ComfyUI_MiniMaxH3_Director | 导演台工作流(T2V/I2V/R2V/V2V) |
| Icyoung/ComfyUI-MiniMaxH3-TeaCache | H3 专用 TeaCache 加速节点 |
| kijai/ComfyUI-KJNodes | SageAttention 补丁节点 |
九、保姆级教程出处
- huangserva 原文:https://x.com/servasyy_ai/article/2085251627880255525
- 苏米客整理版:https://www.xmsumi.com/detail/3967
- 七牛云部署指南:https://segmentfault.com/a/1190000048115621
十、本地 vs API 成本对比
| 场景 | 本地 | API |
|---|---|---|
| 768p 草稿/试错 | 免费 | ¥0.50/秒 |
| 1080p(本地超分) | 免费 | ¥0.50/秒 |
| 官方 2K | 不支持(本地) | ¥0.80/秒 |
| 768p→2K 重生成 | 不支持 | ¥0.30/秒 |
推荐策略: 试错本地跑(省 API 费),定稿 1080p 本地超分(免费),非要 2K 再走 API。
暂无评论
