MiniMax H3 完整使用教程:部署、长视频、实时直播

MiniMax H3 完整使用教程:部署、长视频、实时直播


33B 开源全模态视频模型,从零部署到 Motion Context 长视频拼接、低显存优化、fal.ai H3 Max 实时直播,一份搞定

MiniMax H3 使用教程:从零部署到长视频生成与实时直播

一、模型概述

MiniMax H3 是 MiniMax(海螺AI)推出的第三代开源视频生成模型,33B 参数的全模态(Omni-modal)DiT 架构。最大亮点是视频和立体声音频在同一个前向传播中联合生成——人声、音效、背景音乐不是后期叠加的,而是模型原生输出的。

核心能力

  • 文生视频(T2V):纯文字提示词生成视频
  • 图生视频(I2V/fl2va):首帧/尾帧/首尾帧控制,让图片动起来
  • 参考驱动生成(R2V/ref2va):提供参考图片/视频/音频,锁定角色、风格、动作或声音
  • 输出规格:最高 2K 分辨率,24fps,单次 4-15 秒,同步立体声音频

两个任务专用 Checkpoint

Checkpoint支持任务输入条件输出
H3-Base FL2VA文生视频音频、首尾帧生视频音频文字;可选首帧/尾帧视频+音频
H3-Base Ref2VA参考驱动生视频音频文字+参考图片/视频/音频视频+音频

两个 Checkpoint 共享同一个 33B Omni Transformer 主体,AdaLN 分支约 13B 参数可预计算缓存,推理时不需加载。

二、在线使用(零部署)

2.1 fal.ai H3 Max(⭐ 生成速度超过播放速度)

fal.ai 对 H3 做了后训练优化推出 H3 Max:5 秒 768p 视频仅需 ~2.5 秒生成,15 秒视频约 9 秒完成。

  • 免费额度:未登录每天 5 条 5 秒 768p 视频;登录后每天额外 5 条,最长 15 秒
  • 价格(促销期截至 2026.09.01):480p $0.025/秒,768p $0.04/秒;之后翻倍
  • API 端点:https://fal.run/minimax/h3-max/text-to-video

2.2 Hugging Face Space

在线体验,可直接试玩,无需注册。

2.3 MiniMax 官方

海螺 AI(HailuoAI)官网可直接在线生成 2K 视频,注册即用。

三、本地部署

3.1 下载模型权重

官方权重在 HuggingFace: MiniMaxAI/MiniMax-H3,需先申请下载权限(GitHub Issues 提交申请)。

# 下载 FL2VA(文生视频 + 首尾帧)
hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/" "Ref2VA/" --local-dir MiniMax-H3

# 或者用 Comfy-Org 的优化重打包版
hf download Comfy-Org/MiniMax-H3 --local-dir MiniMax-H3-comfyorg

3.2 显存需求

方案最低显存输出质量说明
官方 BF16多卡(~80GB)最高原始精度,需要 A100/H100 级别
官方 FP8 + NVFP4 文本编码器单卡 4090(~46GB)高20 秒视频约 6 分钟
Comfy-Org 优化版(动态 offload)RTX 3060(12GB)中压缩到 ~42.5GB,offload 到内存
GGUF Q416GB(offload)中低UNet ~19.9GB + 文本编码器 + VAE
GGUF Q524-32GB中UNet ~25.9GB,接近全精度
NVFP420GB(Blackwell 显卡)中仅限 B200/B300 等新架构

社区经验:Q4 = 性价比推荐;Q5 = 接近全精度但需更多显存;Q3 = 兼容性最广但质量下降明显。

3.3 社区量化版本

仓库格式特点
joeygambino/MiniMax-H3-GGUFGGUF Q4-Q5需 ComfyUI-GGUF + 一行架构补丁
rockerBOO/minimax-h3-nvfp4NVFP4/INT420GB,Blackwell 专用
Abiray/MiniMax-H3-GGUFGGUF Q3-Q5附带 ComfyUI 工作流

3.4 ComfyUI 安装与使用

安装 ComfyUI(如果还没有):

git clone https://github.com/comfyanonymous/ComfyUI
cd ComfyUI
pip install -r requirements.txt

加载模型:将下载的模型放入 ComfyUI/models/checkpoints/ 或 ComfyUI/models/unet/。

使用内置工作流:ComfyUI 内置三套官方模板:

  • video_minimax_h3_t2v — 文生视频
  • video_minimax_h3_i2v — 图生视频
  • video_minimax_h3_r2v — 参考驱动生成

从模板库直接加载即可开始使用。

四、低显存优化技巧

4.1 分块处理(Tile/Chunk)

原理:将视频潜空间分成多块分别处理,用显存换时间。

  • 块数填 2/4/8,越多显存占用越低,但处理时间越长
  • 实测:原来 70 万像素 10 秒跑不动,分 2 块后可以跑到 80 万像素 10 秒
  • 适合 8GB/12GB 显卡用户

4.2 CLIP 模型清理

生成前卸载 CLIP 文本编码器的显存占用,生成完成后再重新加载。可以节省数 GB 显存。

4.3 Turbo LoRA 加速

如果模型已经能跑但预览太慢,加 H3 Turbo LoRA 实现 4 步采样(v4 low-step),大幅提升生成速度。

五、长视频生成(突破 15 秒限制)

H3 原生单次生成上限约 15 秒,超过后质量下降且容易崩溃。社区通过 Motion Context(运动上下文传递) 实现长视频拼接。

5.1 Motion Context 原理

核心思路:不是传递图片帧,而是传递模型内部状态。

  1. 第一段视频正常生成(例如 10 秒)
  2. 提取结尾约 1 秒的模型内部潜空间状态
  3. 将该状态注入下一段视频生成的起始位置
  4. 第二段视频不是重新生成,而是接着上一段继续往下演
  5. 画面和音频都能无缝衔接

5.2 操作步骤(ComfyUI)

  1. 第一段生成:正常跑工作流,Motion Context 加载设为 0(无前文状态)
  2. 保存第一段的潜空间输出
  3. 第二段生成:Motion Context 加载设为 1,段序号改为 2
  4. 输入新提示词,点击运行
  5. 重复以上步骤可生成 30 秒、40 秒甚至更长的视频

5.3 长视频专用 ComfyUI 节点/插件

插件Stars特点
ethanfel/ComfyUI-H3-Motion-Context335Motion Context 循环,场景计划驱动,支持暂停/恢复/重试
tritant/ComfyUI_MiniMax_H3_Extender155多片段链式生成,磁盘缓存,动态图片/音频参考,Per-Clip LoRA
vizart-vj/ComfyUI-MiniMax-H3-LongMedia71流式 Sol Attention,压缩 KV,自适应 VRAM 守卫,MultiClip 规划

六、首尾帧控制

首尾帧(First/Last Frame)可以精确控制视频的起止画面:

  • 只要首帧:生成首帧图 → 关闭尾帧 ControlNet → 生成视频
  • 首尾都要:首帧和尾帧的 ControlNet 都打开 → 模型填充中间过渡
  • 只要尾帧:只开尾帧 ControlNet

ComfyUI 官方模板 video_minimax_h3_i2v 即为此模式。

七、实时直播应用

7.1 fal.ai H3 Max + Twitch/Rumble 直播

2026 年 8 月底,开发者 Rehan Sheikh 和 Pieter Levels 分别实现了基于 H3 Max 的实时 AI 视频直播:

架构:

Twitch/Rumble 弹幕 → 抓取 prompt → fal.ai H3 Max API 生成 → 推流回直播
  • H3 Max 生成速度超过播放速度(15 秒视频 ~9 秒生成),实现无缝衔接
  • 24 小时不间断生成,观众通过弹幕实时影响内容方向
  • 效果类似《瑞克和莫蒂》中的「跨维度电视」
  • Twitch 因政策封禁后,已迁移到 Rumble

7.2 这不是 MiniMax 官方功能

H3 Max 是 fal.ai 的后训练加速版本,直播桥接脚本是开发者自写的。MiniMax 官方未提供直播功能。

八、提示词技巧

8.1 官方 Skill 文档

MiniMax 提供了官方的提示词 Skill 文档,可以将它提交给任意智能体(豆包、Claude 等),让 AI 按照 MiniMax 的提示词规范来帮你写 prompt。

8.2 分辨率与尺寸

比例分辨率(16:9 为例)
21:9超宽电影
16:91344×768
4:3传统电视
1:1方形
3:4竖版
9:16手机竖屏

ComfyUI 中可通过快捷分辨率节点选择,输入最短边像素数即可。

九、已知局限

  • 手部/物体一致性:社区反馈在相当比例的测试片段中存在手部、物体物理等问题
  • 原生音频质量:音频同步生成是亮点,但音质和准确性仍有提升空间
  • 15 秒硬限制:单次生成超过 15 秒质量明显下降,长视频必须用 Motion Context 拼接
  • GGUF 非官方支持:社区量化版不是 MiniMax 或 Comfy-Org 维护的,可能存在兼容性问题

入口

67300举报0子龙•28天前
点击获取 ^_^
被收录:

暂无评论