
MiniMax H3 使用教程:从零部署到长视频生成与实时直播
一、模型概述
MiniMax H3 是 MiniMax(海螺AI)推出的第三代开源视频生成模型,33B 参数的全模态(Omni-modal)DiT 架构。最大亮点是视频和立体声音频在同一个前向传播中联合生成——人声、音效、背景音乐不是后期叠加的,而是模型原生输出的。
核心能力
- 文生视频(T2V):纯文字提示词生成视频
- 图生视频(I2V/fl2va):首帧/尾帧/首尾帧控制,让图片动起来
- 参考驱动生成(R2V/ref2va):提供参考图片/视频/音频,锁定角色、风格、动作或声音
- 输出规格:最高 2K 分辨率,24fps,单次 4-15 秒,同步立体声音频
两个任务专用 Checkpoint
| Checkpoint | 支持任务 | 输入条件 | 输出 |
|---|---|---|---|
| H3-Base FL2VA | 文生视频音频、首尾帧生视频音频 | 文字;可选首帧/尾帧 | 视频+音频 |
| H3-Base Ref2VA | 参考驱动生视频音频 | 文字+参考图片/视频/音频 | 视频+音频 |
两个 Checkpoint 共享同一个 33B Omni Transformer 主体,AdaLN 分支约 13B 参数可预计算缓存,推理时不需加载。
二、在线使用(零部署)
2.1 fal.ai H3 Max(⭐ 生成速度超过播放速度)
fal.ai 对 H3 做了后训练优化推出 H3 Max:5 秒 768p 视频仅需 ~2.5 秒生成,15 秒视频约 9 秒完成。
- 免费额度:未登录每天 5 条 5 秒 768p 视频;登录后每天额外 5 条,最长 15 秒
- 价格(促销期截至 2026.09.01):480p $0.025/秒,768p $0.04/秒;之后翻倍
- API 端点:
https://fal.run/minimax/h3-max/text-to-video
2.2 Hugging Face Space
在线体验,可直接试玩,无需注册。
2.3 MiniMax 官方
海螺 AI(HailuoAI)官网可直接在线生成 2K 视频,注册即用。
三、本地部署
3.1 下载模型权重
官方权重在 HuggingFace: MiniMaxAI/MiniMax-H3,需先申请下载权限(GitHub Issues 提交申请)。
# 下载 FL2VA(文生视频 + 首尾帧)
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/" "Ref2VA/" --local-dir MiniMax-H3
# 或者用 Comfy-Org 的优化重打包版
hf download Comfy-Org/MiniMax-H3 --local-dir MiniMax-H3-comfyorg
3.2 显存需求
| 方案 | 最低显存 | 输出质量 | 说明 |
|---|---|---|---|
| 官方 BF16 | 多卡(~80GB) | 最高 | 原始精度,需要 A100/H100 级别 |
| 官方 FP8 + NVFP4 文本编码器 | 单卡 4090(~46GB) | 高 | 20 秒视频约 6 分钟 |
| Comfy-Org 优化版(动态 offload) | RTX 3060(12GB) | 中 | 压缩到 ~42.5GB,offload 到内存 |
| GGUF Q4 | 16GB(offload) | 中低 | UNet ~19.9GB + 文本编码器 + VAE |
| GGUF Q5 | 24-32GB | 中 | UNet ~25.9GB,接近全精度 |
| NVFP4 | 20GB(Blackwell 显卡) | 中 | 仅限 B200/B300 等新架构 |
社区经验:Q4 = 性价比推荐;Q5 = 接近全精度但需更多显存;Q3 = 兼容性最广但质量下降明显。
3.3 社区量化版本
| 仓库 | 格式 | 特点 |
|---|---|---|
| joeygambino/MiniMax-H3-GGUF | GGUF Q4-Q5 | 需 ComfyUI-GGUF + 一行架构补丁 |
| rockerBOO/minimax-h3-nvfp4 | NVFP4/INT4 | 20GB,Blackwell 专用 |
| Abiray/MiniMax-H3-GGUF | GGUF Q3-Q5 | 附带 ComfyUI 工作流 |
3.4 ComfyUI 安装与使用
安装 ComfyUI(如果还没有):
git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI
pip install -r requirements.txt
加载模型:将下载的模型放入 ComfyUI/models/checkpoints/ 或 ComfyUI/models/unet/。
使用内置工作流:ComfyUI 内置三套官方模板:
video_minimax_h3_t2v— 文生视频video_minimax_h3_i2v— 图生视频video_minimax_h3_r2v— 参考驱动生成
从模板库直接加载即可开始使用。
四、低显存优化技巧
4.1 分块处理(Tile/Chunk)
原理:将视频潜空间分成多块分别处理,用显存换时间。
- 块数填 2/4/8,越多显存占用越低,但处理时间越长
- 实测:原来 70 万像素 10 秒跑不动,分 2 块后可以跑到 80 万像素 10 秒
- 适合 8GB/12GB 显卡用户
4.2 CLIP 模型清理
生成前卸载 CLIP 文本编码器的显存占用,生成完成后再重新加载。可以节省数 GB 显存。
4.3 Turbo LoRA 加速
如果模型已经能跑但预览太慢,加 H3 Turbo LoRA 实现 4 步采样(v4 low-step),大幅提升生成速度。
五、长视频生成(突破 15 秒限制)
H3 原生单次生成上限约 15 秒,超过后质量下降且容易崩溃。社区通过 Motion Context(运动上下文传递) 实现长视频拼接。
5.1 Motion Context 原理
核心思路:不是传递图片帧,而是传递模型内部状态。
- 第一段视频正常生成(例如 10 秒)
- 提取结尾约 1 秒的模型内部潜空间状态
- 将该状态注入下一段视频生成的起始位置
- 第二段视频不是重新生成,而是接着上一段继续往下演
- 画面和音频都能无缝衔接
5.2 操作步骤(ComfyUI)
- 第一段生成:正常跑工作流,Motion Context 加载设为 0(无前文状态)
- 保存第一段的潜空间输出
- 第二段生成:Motion Context 加载设为 1,段序号改为 2
- 输入新提示词,点击运行
- 重复以上步骤可生成 30 秒、40 秒甚至更长的视频
5.3 长视频专用 ComfyUI 节点/插件
| 插件 | Stars | 特点 |
|---|---|---|
| ethanfel/ComfyUI-H3-Motion-Context | 335 | Motion Context 循环,场景计划驱动,支持暂停/恢复/重试 |
| tritant/ComfyUI_MiniMax_H3_Extender | 155 | 多片段链式生成,磁盘缓存,动态图片/音频参考,Per-Clip LoRA |
| vizart-vj/ComfyUI-MiniMax-H3-LongMedia | 71 | 流式 Sol Attention,压缩 KV,自适应 VRAM 守卫,MultiClip 规划 |
六、首尾帧控制
首尾帧(First/Last Frame)可以精确控制视频的起止画面:
- 只要首帧:生成首帧图 → 关闭尾帧 ControlNet → 生成视频
- 首尾都要:首帧和尾帧的 ControlNet 都打开 → 模型填充中间过渡
- 只要尾帧:只开尾帧 ControlNet
ComfyUI 官方模板 video_minimax_h3_i2v 即为此模式。
七、实时直播应用
7.1 fal.ai H3 Max + Twitch/Rumble 直播
2026 年 8 月底,开发者 Rehan Sheikh 和 Pieter Levels 分别实现了基于 H3 Max 的实时 AI 视频直播:
架构:
Twitch/Rumble 弹幕 → 抓取 prompt → fal.ai H3 Max API 生成 → 推流回直播
- H3 Max 生成速度超过播放速度(15 秒视频 ~9 秒生成),实现无缝衔接
- 24 小时不间断生成,观众通过弹幕实时影响内容方向
- 效果类似《瑞克和莫蒂》中的「跨维度电视」
- Twitch 因政策封禁后,已迁移到 Rumble
7.2 这不是 MiniMax 官方功能
H3 Max 是 fal.ai 的后训练加速版本,直播桥接脚本是开发者自写的。MiniMax 官方未提供直播功能。
八、提示词技巧
8.1 官方 Skill 文档
MiniMax 提供了官方的提示词 Skill 文档,可以将它提交给任意智能体(豆包、Claude 等),让 AI 按照 MiniMax 的提示词规范来帮你写 prompt。
8.2 分辨率与尺寸
| 比例 | 分辨率(16:9 为例) |
|---|---|
| 21:9 | 超宽电影 |
| 16:9 | 1344×768 |
| 4:3 | 传统电视 |
| 1:1 | 方形 |
| 3:4 | 竖版 |
| 9:16 | 手机竖屏 |
ComfyUI 中可通过快捷分辨率节点选择,输入最短边像素数即可。
九、已知局限
- 手部/物体一致性:社区反馈在相当比例的测试片段中存在手部、物体物理等问题
- 原生音频质量:音频同步生成是亮点,但音质和准确性仍有提升空间
- 15 秒硬限制:单次生成超过 15 秒质量明显下降,长视频必须用 Motion Context 拼接
- GGUF 非官方支持:社区量化版不是 MiniMax 或 Comfy-Org 维护的,可能存在兼容性问题
入口
- 官方权重:HuggingFace: MiniMaxAI/MiniMax-H3
- ComfyUI 官方文档:docs.comfy.org
- fal.ai H3 Max:fal.ai/minimax-h3-max
- 在线体验:HuggingFace Space
- Motion Context 插件:GitHub
- H3 Extender 插件:GitHub
- 长视频低显存指南:Seedance
- GGUF 量化:joeygambino/MiniMax-H3-GGUF
- H3 Max 直播 Demo:Infinite Slop
暂无评论
