前言
随着 AI 视频赛道竞争白热化,多数视频模型只能生成无声画面,音频需要后期拼接,极易出现口型错位、音效脱节。2026 年 8 月 MiniMax 正式开源MiniMax H3(海螺 H3),作为 33.1B 单流 Omni Transformer 全模态视频模型,它最大亮点就是音视频联合原生生成;同时 ComfyUI 官方完成原生适配,开发者可以脱离封闭网页、API,在本地自由搭建视频工作流。
在权威有声视频编辑榜单中,MiniMax H3 综合得分位居前列,是目前为数不多支持本地部署、支持参考生成、音画同步优秀的开源视频方案。本篇带你看懂模型核心能力、硬件门槛、ComfyUI 部署要点、三大生成模式以及常见踩坑方案。
一、MiniMax H3 模型核心架构与参数
很多人容易混淆:MiniMax H3 是视频生成模型,并非 MiniMax 语言大模型。整套系统分为三大模块:
- H3-Base(开源权重,可本地运行) 包含两个核心权重:
- FL2VA:文生视频、首尾帧控制图生视频
- Ref2VA:参考图 / 参考视频 / 参考音频生成,用于锁定角色形象、镜头风格、动作 内置 Qwen3-VL-32B 作为文本编码器,统一编码文本、图像、视频、音频多模态信息。
- H3-Context-IR(API 模块):多模态上下文增强,优化提示词理解,开源权重暂不包含
- H3-Regenerate-2K(API 模块):2K 超分放大,本地基础版本默认输出 768P
基础输出规格
- 时长:4~15 秒,24FPS
- 默认分辨率:短边 768px;借助官方超分模块最高支持 2K
- 音频:原生 32kHz 立体声,画面与音频同步生成,非后期合成
- 语言:支持中文、英文、日语等 11 种语言对话生成
- 宽高比:自由适配 9:16、16:9、1:1、21:9 等短视频常用比例
最关键优势:单流联合音视频去噪
市面上绝大多数 T2V 模型流程:生成画面 → 独立 TTS / 音效模型生成音频 → FFmpeg 拼接。
缺点:口型不对、动作音效错位、节奏割裂。
MiniMax H3 架构将视频 latent 与音频 latent 放在同一个前向链路联合去噪,画面运动、人物台词、环境音效在生成阶段互相约束,天然解决音画不同步痛点,尤其适合数字人对话、剧情短片、动画角色视频创作。
二、ComfyUI 原生支持意味着什么?
在 H3 开源当天,ComfyUI 主仓库完成 PR 合并,实现原生节点支持,无需安装第三方自定义节点,新版 ComfyUI 直接加载官方工作流模板。

ComfyUI H3工作流示例
✅ 相比网页端海螺 AI、封闭 API 平台,ComfyUI 本地部署优势:
- 完全自定义工作流:自由串联 VAE、放大、插帧、降噪、视频合并等节点
- 支持批量生成、自动化流水线,适合短视频工作室批量产出
- 可接入 LoRA、Turbo 加速方案,大幅降低采样耗时
- 不受云端额度、水印、生成时长限制(遵循 MiniMax 社区开源协议)
- 输出原始 latent 文件,方便二次迭代微调画面与音频
三、三大生成模式(ComfyUI 内置模板)
打开新版 ComfyUI 模板库,可以直接加载三套官方基础工作流:
1. Text-to-Video|文生视频(FL2VA)
仅依靠提示词从零生成带音效 / 人声视频。
适用:概念短片、场景动画、产品演示动画。
提示词建议写明:镜头运动、光影、人物动作、对白台词、环境音效。
2. Image-to-Video|首尾帧图生视频(FL2VA)
上传首帧、可选尾帧图片,控制视频起始与结束画面,静态图片动态化。
适用:插画动效、海报短视频、静态角色驱动。
3. Reference-to-Video|参考生成(Ref2VA)
支持输入多张参考图、参考视频、参考音频,锁定角色长相、画风、动作、音色。
创作者最常用模式,解决 AI 视频角色崩坏、形象漂移难题,适合系列短视频、IP 动画持续产出。
四、硬件门槛与模型版本选择(ComfyUI 部署必读)
最低建议 NVIDIA 显卡,AMD 显卡、Mac 可以运行,但速度极慢。
显存参考(BF16 原生精度)
- 24G 显存:完整加载 BF16 权重,稳定跑通全部模式
- 16G 显存:建议使用 INT8 量化权重,关闭同时加载多参考素材
- ≤12G 显存:优先 INT4 量化版本,必要开启模型分片加载(device_map)
需要下载的模型清单(存放路径对应 ComfyUI 目录)
- H3 FL2VA / Ref2VA 主模型 →
models/minimax_h3/ - Qwen3-VL-32B 文本编码器 →
models/clip/ - Video VAE + Audio VAE →
models/vae/
⚠️ 避坑提醒:不要一次性下载全部精度模型,根据显卡显存只选 BF16 / INT8 / INT4 其中一套;网络不佳可使用 HF 镜像加速下载。
五、ComfyUI 快速上手简易步骤
- 升级 ComfyUI 到最新版本(最低 v0.30.0 以上,内置 MiniMax 原生节点)
- 下载对应量化版本模型,放置到对应目录
- 重启 ComfyUI,顶部模板库加载 MiniMax H3 预设工作流
- 填写 Prompt、配置分辨率、时长、采样步数
- 执行生成,最终节点自动封装带立体声的 MP4 视频
提速技巧
- 使用 H3 Turbo LoRA,可将采样步数降低,预览速度提升 40% 以上
- 优先 768P 基础分辨率完成初稿,再使用视频超分节点提升清晰度
- 开启模型 CPU/GPU 分片加载,低配显卡防止 OOM 显存溢出
六、适合哪些创作者与开发场景
- 短视频创作者:剧情动画、数字人口播、插画动态短片
- 独立动画工作室:统一角色 IP 系列视频
- AI 内容开发者:搭建私有化视频生成服务、Agent 多模态工作流
- ComfyUI 爱好者:自定义音视频流水线,打通图生视频、参考生成、后期剪辑一体化链路
七、开源协议与限制说明
MiniMax H3 采用 MiniMax H3 社区许可证,权重开放本地部署,支持商用,但禁止模型权重二次分发、逆向蒸馏、训练竞品模型;使用前务必阅读官方协议。
注意:开源仅包含 H3-Base 基础模块,2K 超分、上下文增强模块仍为 API 服务,本地权重无法直接实现。
八、小结
MiniMax H3 填补了开源赛道原生音视频同步生成的空白,而 ComfyUI 原生适配,让普通爱好者与开发者摆脱封闭平台束缚。
如果你一直在寻找能本地运行、支持角色锁定、自带同步音效的开源视频模型,ComfyUI + MiniMax H3 是当下最值得投入学习的组合。随着社区不断优化量化方案、加速节点,低配显卡的运行门槛未来还会持续降低。