# MiniMax H3 完整使用教程:部署、长视频、实时直播 > 33B 开源全模态视频模型,从零部署到 Motion Context 长视频拼接、低显存优化、fal.ai H3 Max 实时直播,一份搞定 # MiniMax H3 使用教程:从零部署到长视频生成与实时直播 ## 一、模型概述 MiniMax H3 是 MiniMax(海螺AI)推出的第三代开源视频生成模型,33B 参数的全模态(Omni-modal)DiT 架构。最大亮点是**视频和立体声音频在同一个前向传播中联合生成**——人声、音效、背景音乐不是后期叠加的,而是模型原生输出的。 ### 核心能力 - **文生视频(T2V)**:纯文字提示词生成视频 - **图生视频(I2V/fl2va)**:首帧/尾帧/首尾帧控制,让图片动起来 - **参考驱动生成(R2V/ref2va)**:提供参考图片/视频/音频,锁定角色、风格、动作或声音 - **输出规格**:最高 2K 分辨率,24fps,单次 4-15 秒,同步立体声音频 ### 两个任务专用 Checkpoint | Checkpoint | 支持任务 | 输入条件 | 输出 | |-----------|---------|---------|------| | H3-Base FL2VA | 文生视频音频、首尾帧生视频音频 | 文字;可选首帧/尾帧 | 视频+音频 | | H3-Base Ref2VA | 参考驱动生视频音频 | 文字+参考图片/视频/音频 | 视频+音频 | 两个 Checkpoint 共享同一个 33B Omni Transformer 主体,AdaLN 分支约 13B 参数可预计算缓存,推理时不需加载。 ## 二、在线使用(零部署) ### 2.1 fal.ai H3 Max(⭐ 生成速度超过播放速度) [fal.ai](https://fal.ai/minimax-h3-max) 对 H3 做了后训练优化推出 **H3 Max**:5 秒 768p 视频仅需 ~2.5 秒生成,15 秒视频约 9 秒完成。 - **免费额度**:未登录每天 5 条 5 秒 768p 视频;登录后每天额外 5 条,最长 15 秒 - **价格**(促销期截至 2026.09.01):480p $0.025/秒,768p $0.04/秒;之后翻倍 - **API 端点**:`https://fal.run/minimax/h3-max/text-to-video` ### 2.2 Hugging Face Space [在线体验](https://huggingface.co/spaces/multimodalart/minimax-h3),可直接试玩,无需注册。 ### 2.3 MiniMax 官方 海螺 AI(HailuoAI)官网可直接在线生成 2K 视频,注册即用。 ## 三、本地部署 ### 3.1 下载模型权重 官方权重在 [HuggingFace: MiniMaxAI/MiniMax-H3](https://huggingface.co/MiniMaxAI/MiniMax-H3),需先申请下载权限(GitHub Issues 提交申请)。 ```bash # 下载 FL2VA(文生视频 + 首尾帧) hf download MiniMaxAI/MiniMax-H3 --include "model_index.json" "FL2VA/" "Ref2VA/" --local-dir MiniMax-H3 # 或者用 Comfy-Org 的优化重打包版 hf download Comfy-Org/MiniMax-H3 --local-dir MiniMax-H3-comfyorg ``` ### 3.2 显存需求 | 方案 | 最低显存 | 输出质量 | 说明 | |------|---------|---------|------| | 官方 BF16 | 多卡(~80GB) | 最高 | 原始精度,需要 A100/H100 级别 | | 官方 FP8 + NVFP4 文本编码器 | 单卡 4090(~46GB) | 高 | 20 秒视频约 6 分钟 | | Comfy-Org 优化版(动态 offload) | RTX 3060(12GB) | 中 | 压缩到 ~42.5GB,offload 到内存 | | GGUF Q4 | 16GB(offload) | 中低 | UNet ~19.9GB + 文本编码器 + VAE | | GGUF Q5 | 24-32GB | 中 | UNet ~25.9GB,接近全精度 | | NVFP4 | 20GB(Blackwell 显卡) | 中 | 仅限 B200/B300 等新架构 | **社区经验**:Q4 = 性价比推荐;Q5 = 接近全精度但需更多显存;Q3 = 兼容性最广但质量下降明显。 ### 3.3 社区量化版本 | 仓库 | 格式 | 特点 | |------|------|------| | [joeygambino/MiniMax-H3-GGUF](https://huggingface.co/joeygambino/MiniMax-H3-GGUF) | GGUF Q4-Q5 | 需 ComfyUI-GGUF + 一行架构补丁 | | [rockerBOO/minimax-h3-nvfp4](https://huggingface.co/rockerBOO/minimax-h3-nvfp4) | NVFP4/INT4 | 20GB,Blackwell 专用 | | [Abiray/MiniMax-H3-GGUF](https://huggingface.co/Abiray/MiniMax-H3-GGUF) | GGUF Q3-Q5 | 附带 ComfyUI 工作流 | ### 3.4 ComfyUI 安装与使用 **安装 ComfyUI**(如果还没有): ```bash git clone https://github.com/comfyanonymous/ComfyUI cd ComfyUI pip install -r requirements.txt ``` **加载模型**:将下载的模型放入 `ComfyUI/models/checkpoints/` 或 `ComfyUI/models/unet/`。 **使用内置工作流**:ComfyUI 内置三套官方模板: - `video_minimax_h3_t2v` — 文生视频 - `video_minimax_h3_i2v` — 图生视频 - `video_minimax_h3_r2v` — 参考驱动生成 从模板库直接加载即可开始使用。 ## 四、低显存优化技巧 ### 4.1 分块处理(Tile/Chunk) 原理:将视频潜空间分成多块分别处理,用显存换时间。 - 块数填 2/4/8,越多显存占用越低,但处理时间越长 - 实测:原来 70 万像素 10 秒跑不动,分 2 块后可以跑到 80 万像素 10 秒 - 适合 8GB/12GB 显卡用户 ### 4.2 CLIP 模型清理 生成前卸载 CLIP 文本编码器的显存占用,生成完成后再重新加载。可以节省数 GB 显存。 ### 4.3 Turbo LoRA 加速 如果模型已经能跑但预览太慢,加 **H3 Turbo LoRA** 实现 4 步采样(v4 low-step),大幅提升生成速度。 ## 五、长视频生成(突破 15 秒限制) H3 原生单次生成上限约 15 秒,超过后质量下降且容易崩溃。社区通过 **Motion Context(运动上下文传递)** 实现长视频拼接。 ### 5.1 Motion Context 原理 核心思路:**不是传递图片帧,而是传递模型内部状态。** 1. 第一段视频正常生成(例如 10 秒) 2. 提取结尾约 1 秒的模型内部潜空间状态 3. 将该状态注入下一段视频生成的起始位置 4. 第二段视频不是重新生成,而是**接着上一段继续往下演** 5. 画面和音频都能无缝衔接 ### 5.2 操作步骤(ComfyUI) 1. 第一段生成:正常跑工作流,Motion Context 加载设为 0(无前文状态) 2. 保存第一段的潜空间输出 3. 第二段生成:Motion Context 加载设为 1,段序号改为 2 4. 输入新提示词,点击运行 5. 重复以上步骤可生成 30 秒、40 秒甚至更长的视频 ### 5.3 长视频专用 ComfyUI 节点/插件 | 插件 | Stars | 特点 | |------|-------|------| | [ethanfel/ComfyUI-H3-Motion-Context](https://github.com/ethanfel/ComfyUI-H3-Motion-Context) | 335 | Motion Context 循环,场景计划驱动,支持暂停/恢复/重试 | | [tritant/ComfyUI_MiniMax_H3_Extender](https://github.com/tritant/ComfyUI_MiniMax_H3_Extender) | 155 | 多片段链式生成,磁盘缓存,动态图片/音频参考,Per-Clip LoRA | | [vizart-vj/ComfyUI-MiniMax-H3-LongMedia](https://github.com/vizart-vj/ComfyUI-MiniMax-H3-LongMedia) | 71 | 流式 Sol Attention,压缩 KV,自适应 VRAM 守卫,MultiClip 规划 | ## 六、首尾帧控制 首尾帧(First/Last Frame)可以精确控制视频的起止画面: - **只要首帧**:生成首帧图 → 关闭尾帧 ControlNet → 生成视频 - **首尾都要**:首帧和尾帧的 ControlNet 都打开 → 模型填充中间过渡 - **只要尾帧**:只开尾帧 ControlNet ComfyUI 官方模板 `video_minimax_h3_i2v` 即为此模式。 ## 七、实时直播应用 ### 7.1 fal.ai H3 Max + Twitch/Rumble 直播 2026 年 8 月底,开发者 [Rehan Sheikh](https://x.com/rehan_shei) 和 [Pieter Levels](https://levels.io) 分别实现了基于 H3 Max 的实时 AI 视频直播: **架构**: ``` Twitch/Rumble 弹幕 → 抓取 prompt → fal.ai H3 Max API 生成 → 推流回直播 ``` - H3 Max 生成速度超过播放速度(15 秒视频 ~9 秒生成),实现无缝衔接 - 24 小时不间断生成,观众通过弹幕实时影响内容方向 - 效果类似《瑞克和莫蒂》中的「跨维度电视」 - Twitch 因政策封禁后,已迁移到 Rumble ### 7.2 这不是 MiniMax 官方功能 H3 Max 是 fal.ai 的后训练加速版本,直播桥接脚本是开发者自写的。MiniMax 官方未提供直播功能。 ## 八、提示词技巧 ### 8.1 官方 Skill 文档 MiniMax 提供了官方的提示词 Skill 文档,可以将它提交给任意智能体(豆包、Claude 等),让 AI 按照 MiniMax 的提示词规范来帮你写 prompt。 ### 8.2 分辨率与尺寸 | 比例 | 分辨率(16:9 为例) | |------|---------------------| | 21:9 | 超宽电影 | | 16:9 | 1344×768 | | 4:3 | 传统电视 | | 1:1 | 方形 | | 3:4 | 竖版 | | 9:16 | 手机竖屏 | ComfyUI 中可通过快捷分辨率节点选择,输入最短边像素数即可。 ## 九、已知局限 - **手部/物体一致性**:社区反馈在相当比例的测试片段中存在手部、物体物理等问题 - **原生音频质量**:音频同步生成是亮点,但音质和准确性仍有提升空间 - **15 秒硬限制**:单次生成超过 15 秒质量明显下降,长视频必须用 Motion Context 拼接 - **GGUF 非官方支持**:社区量化版不是 MiniMax 或 Comfy-Org 维护的,可能存在兼容性问题 ## 入口 - **官方权重**:[HuggingFace: MiniMaxAI/MiniMax-H3](https://huggingface.co/MiniMaxAI/MiniMax-H3) - **ComfyUI 官方文档**:[docs.comfy.org](https://docs.comfy.org/tutorials/video/minimax/minimax-h3) - **fal.ai H3 Max**:[fal.ai/minimax-h3-max](https://fal.ai/minimax-h3-max) - **在线体验**:[HuggingFace Space](https://huggingface.co/spaces/multimodalart/minimax-h3) - **Motion Context 插件**:[GitHub](https://github.com/ethanfel/ComfyUI-H3-Motion-Context) - **H3 Extender 插件**:[GitHub](https://github.com/tritant/ComfyUI_MiniMax_H3_Extender) - **长视频低显存指南**:[Seedance](https://www.seedance.tv/blog/minimax-h3-long-video-low-vram) - **GGUF 量化**:[joeygambino/MiniMax-H3-GGUF](https://huggingface.co/joeygambino/MiniMax-H3-GGUF) - **H3 Max 直播 Demo**:[Infinite Slop](https://levels.io) --- **分类**:软件 **标签**:视频 · MiniMax · H3 **作者**:子龙 **链接**:https://octohz.com/p/2085