摘要:MiniMax H3 开源之后,很多开发者困惑:BF16、INT8 不同量化精度下,到底能不能跑 720P、1080P?原生开源权重、重生成 2K 模块、显存边界、分辨率对齐约束,本文一次性梳理清楚MiniM…。
MiniMax H3 是 MiniMax 开源的通用全模态音视频生成模型,可同时生成画面 + 32KHz 立体声音频,支持文生视频、图生视频、首尾帧、多参考图视频续写、视频编辑,输出帧率固定 24FPS,时长 4‑15sMiniMax。很多人直接拿它对标传统视频模型,会混淆原生 Base 生成分辨率和后处理超分 / 重生成分辨率,同时不同量化(BF16、INT8)直接决定你能开到多大画布,720P、1080P 能否可用,不能只看宣传页的 2K 标签MiniMax De…。
一、先理清 H3 两个核心模块
- H3‑Base(开源本地权重):原生生成短边 768px,16:9 对应
1344×768,宽高必须对齐 32 的整数倍,这是本地 BF16/INT8 推理的原生画布上限,并不是直接输出 1080PMiniM…。 - H3‑Regenerate‑2K:二次重生成模块,把 Base 输出 768P 结果送入重生成流程,得到 2K 级别画面;本地开源包并不自带完整 2K 重生成权重,2K 能力主要来自云端 API,本地硬件很难直接跑原生 1080P Base 生成MiniMax De…。
误区:H3‑Base 本地模型原生不支持直接输出 1080P(1920×1080)原生 latent 生成,强行填 1920×1080 参数会 OOM、画面崩坏、黑帧;720P(1280×720)需要做 32 倍数对齐修正。
二、BF16 与 INT8 精度对比,分辨率支持边界
BF16 是官方参考推理精度;INT8 是社区量化版本,用来降低显存占用,会带来轻微画质损失,换取更低硬件门槛MiniM…。
表格
| 精度 | 显存占用 (整套模型) | 原生支持画布(对齐 32) | 720P 场景 | 1080P 场景 | 适合硬件 |
|---|---|---|---|---|---|
| BF16(官方混合 BF16/FP32) | ~40‑45GB | 原生最优1344×768;可向下兼容对齐版 720P |
可运行对齐版本1280×704,不建议 1280×720(非 32 倍数) |
无法原生直接生成 1080P,显存直接溢出,只能输出 768P 再后期超分 | A100、H100、B200,多卡环境 |
| INT8(社区 AWQ/GPTQ 量化) | ~19‑24GB | 原生最优1344×768;低显存建议下调画布 |
可跑对齐 720P(1280×704);8G 显卡必须开启 lowvram,短片段,容易 OOM | 不能原生生成 1080P 视频 latent;只能生成 768P 再外部超分到 1080P,不是模型原生渲染 | RTX 3090/4090 24G;8‑16G 显卡仅适合草稿测试 |
重要规则:H3 所有输出尺寸,宽、高两个维度都必须是 32 的整数倍,否则推理异常。
- 标准 720P 原始
1280×720,720 不能被 32 整除;本地实际可用对齐尺寸:1280 × 704(等效 720P 视野)MiniM…。 - 1080P
1920×1080:1080 不是 32 倍数,同时 latent 尺寸爆炸,无论 BF16 还是 INT8,本地 Base 模型都扛不住,直接爆显存。
BF16 模式特点
- 官方基准精度,音画质量最好,音频同步稳定,无量化伪影,是做成品输出首选MiniM…。
- 单卡 24G 显卡跑 BF16 基本不可能,整套模型(Omni‑Transformer+VisualVAE+AudioVAE + 文本编码器)体积巨大,需要大显存 A100/H100/B200,多卡分布式 Ulysses 切分。
- 即便 BF16 大卡,原生最高生成依然是短边 768(1344×768),不是 1080P。想要 1080P 成片,工作流:
H3‑Base生成1344×768 → 外部超分工具上采样到1920×1080。
INT8 量化模式特点
- 将 Transformer 主权重量化为 INT8,VAE、音频模块一般保留 FP16/FP32,控制显存;画质有轻微损失,复杂人物细节、面部偶尔会出现量化噪声,音频质量基本保留。
- RTX4090 24G 可以稳定跑
1344×768;8‑12G 显卡只能降分辨率、开 lowvram、缩短生成时长,适合草稿调试,不适合批量生产。 - INT8 同样不能突破模型原生 latent 上限,不支持原生 1080P 生成。720P 只能使用对齐后的
1280×704。
三、720P / 1080P 在 MiniMax H3 中的正确落地方式
✅720P(对齐版,本地 BF16 / INT8 都支持)
16:9,使用对齐 32 倍数的尺寸:1280 × 704
- BF16:大卡环境稳定出片,画质最优。
- INT8:24G 卡稳定;8‑12G 卡可跑,但尽量缩短生成秒数,防止 OOM。
不要直接填 1280×720,会出现画面裁切、色块、推理报错。
⚠️1080P(重点澄清)
无论 BF16 还是 INT8,开源 H3‑Base 本地权重,都不能原生直接生成 1920×1080 latent 视频帧MiniMax De…。
两种拿到 1080P 成片的可行路径:
- 云端 API H3‑Regenerate‑2K:768P 中间结果送入官方重生成模块,原生输出更高分辨率,本地没有这套完整权重。
- 本地后处理超分方案(BF16 / INT8 通用)
模型原生生成:1344 ×768 → Real‑ESRGAN / RIFE等视频超分 → 上采样到1920×1080
画面清晰度提升,但属于后期放大,不是模型原生渲染 1080P 细节。
很多整合包宣传 “本地 H3 跑 1080P”,本质都是这套外部超分流程,并非原生 latent 生成。强行在 ComfyUI 填入 1920×1080 尺寸,只会 OOM 崩溃或者输出损坏视频。
四、实际部署建议
- 追求成品质量:优先 BF16 精度,画布固定
1344×768;需要 720P 输出改为1280×704;需要 1080P,生成完成后做视频超分。硬件建议 A100/H100 多卡。 - 消费级显卡本地玩(RTX 3090/4090 24G):选择成熟 INT8 量化版本,优先
1344×768;720P 使用 1280×704,控制片段时长。 - 8‑12G 显存显卡:INT8+lowvram,只做草稿测试,不要追求 720P 以上,极易 OOM。
- 所有尺寸务必校验宽高是否为 32 倍数,这是 H3 本地部署高频踩坑点MiniM…。
五、总结
- BF16:官方标准精度,画质最佳;支持对齐版 720P(1280×704);不支持原生 1080P 生成,需要后期超分;吃巨大显存,适合数据中心级 GPU。
- INT8:量化降显存,消费卡可跑;支持对齐 720P;同样不支持原生 1080P,画质轻微下降,适合本地调试。
- MiniMax H3 开源 Base 原生画布上限短边 768px,1080P/2K 原生生成依赖云端 Regenerate‑2K 模块,本地不要混淆 “模型原生生成分辨率” 和 “后期超分输出分辨率”。