显存档位与量化谱系
作者实测或声明过的显存档位,以及社区真实存在的 11 档量化文件谱系。
这是交付包内 02-显存档位与量化谱系.md 的原文,内容未作改写。包内同时保留 Markdown 原件。
MiniMax H3 · 显存档位与量化谱系
这份文档解决一个问题:「我这块卡该下哪个权重」。 原则:有依据的才写,没依据的不编。 所以我给的不是「8G 该用什么」这种我拍脑袋的结论,而是两样可查的东西: ① 作者自己实测/声明过的档位(带原文出处);② 社区真实存在的量化文件谱系(每个文件都能点开下)。
一、作者实测或声明的档位
| 档位 | 依据级别 | 依据原文 | 对应工作流 |
|---|---|---|---|
| 8 GB | [作者实测] | YixuAn-13/minimax-h3-comfyui-all-in-one:「围绕 8GB 显存(实测 RTX 4060 Laptop)调优」(并写明「8GB 显存起步」「全部分辨率锚定 0.82MP(实测上限),2.09MP 会硬 OOM」)<br>来源:仓库 README(本机抓取) | 29 条 |
| 12 GB | [作者实测] | juemin4-source/minimax-h3-guide:「在 12GB 显存(RTX 4070 Ti)上把 MiniMax H3 视频生成从 8 分钟压到 1 分钟(约 6-8 倍)」(MIT 许可)<br>来源:仓库 README(本机抓取) | 5 条 |
| 32 GB | [作者实测] | matsuo-koya/minimax-h3-notes:「Measured speed-ups for MiniMax H3 on one RTX 5090 (ComfyUI)」(该仓库只有文档与实测数据,没有工作流文件)<br>来源:仓库描述(GitHub API) | 不在本交付集内 |
| 8 GB | [作者声明] | 作者把显存写进了文件名/路径 | 2 条 |
| 16 GB | [作者声明] | 作者把显存写进了文件名/路径 | 7 条 |
| 24 GB | [作者声明] | 作者把显存写进了文件名/路径 | 1 条 |
| 48 GB | ❌ 无依据 | 见第五节 | 未分版 |
有实测依据的档位,具体是哪些工作流
8 GB —— YixuAn-13/minimax-h3-comfyui-all-in-one
community_10eros_v3_i2v.jsoncommunity_1141_fl2va_twopass.jsoncommunity_1143_ref2va_twopass.jsoncommunity_dualclock_i2v_8step.jsoncommunity_dualclock_r2v_8step.jsoncommunity_dualclock_t2v_8step.jsoncommunity_face_refine_parity.jsoncommunity_lowvram_8g16g.jsoncommunity_mnodes_jerk_t2v.jsoncommunity_sigma_latent_upscale.jsonH3全模式本地工作流_Beta_1_Lite.jsonH3全模式本地工作流_Beta_1.jsonH3全模式本地工作流_Beta_2_Lite.jsonH3全模式本地工作流_Beta_2.1.jsonH3全模式本地工作流_Beta_2.jsonH3全模式本地工作流_Beta_3_FaceRefine.jsonH3全模式本地工作流_Beta_3_Lite.jsonH3全模式本地工作流_Beta_3.jsonofficial_单加加速Lora的文生视频流.jsonofficial_video_minimax_h3_i2v.jsonofficial_video_minimax_h3_r2v.jsonofficial_video_minimax_h3_t2v.jsonreference_10eros_v3.jsonreference_1141_fl2va_twopass_wjluoxiao.jsonreference_1143_ref2va_twopass_wjluoxiao.jsonreference_lowvram_8g16g.jsonreference_official_i2v.jsonreference_official_r2v.jsonreference_official_t2v.json
12 GB —— juemin4-source/minimax-h3-guide
h3_2d_anim_v3.jsonminimax_h3_i2v_native.jsonminimax_h3_r2v_native.jsonminimax_h3_t2va_native.jsonwan22_i2v_gguf.json
作者把显存写进文件名/路径的(作者声明)
8 GB
community_lowvram_8g16g.json— 依据:_8g16g.(两档都适用)reference_lowvram_8g16g.json— 依据:_8g16g.(两档都适用)
16 GB
044.REALminimax-H3-CineconIA-PrimerPaseRapido-16GB-v1.json— 依据:16GJR MiniMax H3 双采样 chunk sampler 16G GPU version1.0.json— 依据:16GJR MiniMax H3 双采样 chunk sampler 16G GPU version2.0.json— 依据:16GJR MiniMax H3 新整合双采高清Unified加速+tst+progressive采样+TRT解码+tao3步2采+harden chunk—— ver2.5 (16G优化版).json— 依据:16GJR MiniMax H3 无限时长MV 2采高清放大 ver2.1 (16G优化版).json— 依据:16Gcommunity_lowvram_8g16g.json— 依据:_8g16g.(两档都适用)reference_lowvram_8g16g.json— 依据:_8g16g.(两档都适用)
24 GB
vdn_h3_t2v_8step_24gb.json— 依据:24G
二、社区真实存在的量化谱系(按压缩程度从低到高)
这是实际能下载到的文件,不是我推的档位。看清自己卡的位置后,按这张表挑对应量化等级即可。
| 量化档 | 说明 | 实测找到的文件 | 主要来源仓 |
|---|---|---|---|
| IQ1_S / IQ1_M(1 比特级,最省) | 极限压缩,画质损失明显,属于「能跑起来」档 | 4 个(来源仓下载量合计 1,732) | MarxistLeninist/MiniMax-H3-FL2VA-Pruned-IQ1-GGUF |
| Q2_K / UD-Q2_K_XL | GGUF 低比特,显存占用最小的一档常见选择 | 4 个(来源仓下载量合计 1,456,680) | unsloth/MiniMax-H3-GGUF |
| Q3_K_S / Q3_K_M / UD-Q3_K_XL | 低比特里画质与体积的折中点 | 9 个(来源仓下载量合计 2,034,770) | Abiray/MiniMax-H3-GGUF<br>vantagewithai/MiniMax-H3-comfyUI-GGUF<br>unsloth/MiniMax-H3-GGUF |
| Q4_0 / Q4_1 / Q4_K_S / Q4_K_M | GGUF 最常用档,多数低配教程用这个 | 18 个(来源仓下载量合计 2,034,770) | Abiray/MiniMax-H3-GGUF<br>vantagewithai/MiniMax-H3-comfyUI-GGUF<br>unsloth/MiniMax-H3-GGUF |
| Q5_0 / Q5_1 / Q5_K_M / Q6_K / Q8_0 | 接近原始精度的 GGUF 档 | 28 个(来源仓下载量合计 2,034,770) | Abiray/MiniMax-H3-GGUF<br>vantagewithai/MiniMax-H3-comfyUI-GGUF<br>unsloth/MiniMax-H3-GGUF |
| INT4Q / INT4BQ / mixed_int4_int8_convrot | INT4 权重,safetensors 格式,ComfyUI 原生加载 | 8 个(来源仓下载量合计 719,760) | Abiray/MiniMax-H3-GGUF<br>Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot<br>tsolful/Minimax_H3_INT4MixedConvRot |
| W4A4 / W4A8 / w4a8_convrot | 4 比特权重(激活 4 或 8 比特),社区新方案 | 7 个(来源仓下载量合计 49,754) | AX1Y2JP/MiniMax-H3-W4A8-ConvRot<br>Winnougan/MiniMax-H3-INT4_Convrot_ComfyUI |
| NVFP4 / NF4 / nvfp4_mixed | NVIDIA FP4 与 NF4 量化 | 16 个(来源仓下载量合计 721,929) | Abiray/MiniMax-H3-GGUF<br>rockerBOO/minimax-h3-nvfp4<br>Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot |
| MXFP8 / FP8 / fp8_scaled / fp8e5m2 | 8 比特浮点 | 1 个(来源仓下载量合计 2,169) | rockerBOO/minimax-h3-nvfp4 |
| INT8_ConvRot(标准 / HQ / Lite) | 官方与社区都有,性价比高的一档 | 12 个(来源仓下载量合计 152,019) | Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot<br>DmitryDB/MiniMax-H3-ComfyUI-Quants<br>Winnougan/MiniMax-H3-INT4_Convrot_ComfyUI |
| BF16 / FP16(原精度,最吃显存) | 官方原始权重,显存占用最大 | 4 个(来源仓下载量合计 2,176,440) | Abiray/MiniMax-H3-GGUF<br>unsloth/MiniMax-H3-GGUF<br>Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot |
各量化仓的完整清单
| 仓库 | 下载量 | 赞 | 权重文件数 | 国内(魔搭)有镜像 |
|---|---|---|---|---|
MarxistLeninist/MiniMax-H3-FL2VA-Pruned-IQ1-GGUF | 1,732 | 0 | 4 | ✗ 未镜像 |
WaveCut/MiniMax-H3-OrbitQuant-W4A4 | 24 | 3 | 19 | ✗ 未镜像 |
Abiray/MiniMax-H3-GGUF | 567,741 | 144 | 25 | ✓ 有(26,579 下载) |
vantagewithai/MiniMax-H3-comfyUI-GGUF | 10,349 | 24 | 26 | ✗ 未镜像 |
unsloth/MiniMax-H3-GGUF | 1,456,680 | 326 | 18 | ✓ 有(87,012 下载) |
rockerBOO/minimax-h3-nvfp4 | 2,169 | 1 | 1 | ✗ 未镜像 |
Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot | 152,019 | 242 | 9 | ✗ 未镜像 |
tsolful/Minimax_H3_INT4MixedConvRot | 0 | 39 | 4 | ✗ 未镜像 |
DmitryDB/MiniMax-H3-ComfyUI-Quants | 0 | 37 | 12 | ✗ 未镜像 |
AX1Y2JP/MiniMax-H3-W4A8-ConvRot | 49,754 | 29 | 5 | ✗ 未镜像 |
DiffSynth-Studio/MiniMax-H3-NF4 | 0 | 14 | 7 | ✗ 未镜像 |
Winnougan/MiniMax-H3-INT4_Convrot_ComfyUI | 0 | 27 | 7 | ✗ 未镜像 |
三、哪些权重能在国内直连下载(魔搭镜像实测)
hf-mirror 是 HuggingFace 的国内镜像,但只有被镜像过的仓库才有。下面是我逐个调魔搭 API 实测的结果:
| 仓库 | 魔搭上是否存在 | 下载量 | 星 | 许可 |
|---|---|---|---|---|
MarxistLeninist/MiniMax-H3-FL2VA-Pruned-IQ1-GGUF | ✗ 不存在 | — | — | — |
WaveCut/MiniMax-H3-OrbitQuant-W4A4 | ✗ 不存在 | — | — | — |
Abiray/MiniMax-H3-GGUF | ✓ 存在 | 26,579 | 30 | other |
vantagewithai/MiniMax-H3-comfyUI-GGUF | ✗ 不存在 | — | — | — |
unsloth/MiniMax-H3-GGUF | ✓ 存在 | 87,012 | 30 | other |
rockerBOO/minimax-h3-nvfp4 | ✗ 不存在 | — | — | — |
Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot | ✗ 不存在 | — | — | — |
tsolful/Minimax_H3_INT4MixedConvRot | ✗ 不存在 | — | — | — |
DmitryDB/MiniMax-H3-ComfyUI-Quants | ✗ 不存在 | — | — | — |
AX1Y2JP/MiniMax-H3-W4A8-ConvRot | ✗ 不存在 | — | — | — |
DiffSynth-Studio/MiniMax-H3-NF4 | ✗ 不存在 | — | — | — |
Winnougan/MiniMax-H3-INT4_Convrot_ComfyUI | ✗ 不存在 | — | — | — |
Comfy-Org/MiniMax-H3 | ✓ 存在 | 3,173,551 | 524 | other |
lightx2v/Minimax-h3-Turbo | ✓ 存在 | 32,002 | 86 | apache-2.0 |
lightx2v/Minimax-h3-Turbo-SLA | ✓ 存在 | 894 | 7 | apache-2.0 |
Kijai/MiniMax-H3-experimental | ✓ 存在 | 9,370 | 7 | — |
alibaba-pai/MiniMax-H3-Acc-LoRAs | ✗ 不存在 | — | — | — |
MiniMaxAI/MiniMax-H3 | ✗ 不存在 | — | — | — |
没被魔搭镜像的仓,仍然可以走 hf-mirror.com(实测可达 451ms);huggingface.co 直连不通。
四、其他权重来源(社区自训,官方仓没有)
这批是社区作者自己蒸馏/合并的权重,官方仓里查不到。它们主要解决「更少步数」与「更低显存」两个问题:
| 仓库 | 在 awesome 索引里被引用 |
|---|---|
drbaph/MiniMax-H3-Turbo-Lora-ComfyUI | 30 次 |
Abiray/MiniMax-H3-GGUF | 26 次 |
vantagewithai/MiniMax-H3-comfyUI-GGUF | 23 次 |
lightx2v/Minimax-h3-Turbo | 15 次 |
unsloth/MiniMax-H3-GGUF | 15 次 |
DmitryDB/MiniMax-H3-ComfyUI-Quants | 10 次 |
larryvrh/MiniMax-H3-Turbo-Lora | 9 次 |
rockerBOO/minimax-h3-nvfp4 | 9 次 |
TenStrip/10Eros-Max | 8 次 |
Abiray/MiniMax-H3-Singularity-GGUF | 8 次 |
taxexempt/Custom-MiniMaX-H3-mixed-quants | 8 次 |
Abiray/Minimax-H3-nvfp4-INT4-INT8-Convrot | 7 次 |
TenStrip/LTX2.3-10Eros_Version-Testing | 7 次 |
realrebelai/MiniMax-H3_GGUFs | 6 次 |
WaveCut/MiniMax-H3-OrbitQuant-W4A4 | 5 次 |
coolthor/MiniMax-H3-pruned-NVFP4 | 5 次 |
DmitryDB/MiniMax-H3-10Eros-Max-Quants | 5 次 |
Abiray/MiniMax-H3-Turbo-Lora-Pruned-ComfyUI | 4 次 |
smhfacct/Minimax-H3-fl2va-ref2va-hybrid-models | 4 次 |
tsolful/Minimax_H3_INT4MixedConvRot | 4 次 |
Rkss/Minimax_h3_fl2v_lightx2v_turbo_4to8step_768p_v4_step600_dareties_native | 3 次 |
tutututututu/Tutu-MiniMax-H3-AudioVideo-20to8-NFE-LoRA | 3 次 |
t8star/minimax-h3-4step-turbo-loras-comfyui-exp | 3 次 |
t8star/minimax_h3_turbo_4step_10ErosMax_test4_pruned_curveproj1025_T8 | 3 次 |
infosave/MiniMax-H3-Turbo-cmf | 3 次 |
rzgar/minimax_h3_fl2v_lightx2v_4step_int8-convrot_comfy | 3 次 |
alibaba-pai/MiniMax-H3-Acc-LoRAs | 3 次 |
drozbay/MiniMax-H3-FastH3-Preview-LoRA | 3 次 |
rzgar/minimax_h3_fl2va_fp8_e4m3fn | 3 次 |
Winnougan/MiniMax-H3-INT4_Convrot_ComfyUI | 3 次 |
五、为什么 48G 档我没做(以及一个我自己推翻的推导)
你要求「按 8G/12G/24G/48G 显存档位分版」。8G、12G 有作者实测,16G、24G 有作者声明,32G 有 RTX 5090 实测记录 —— 但 48G 一处依据都没有:
- 本地 12,088 条工作流索引里,路径/文件名命中显存数字的只有 7 处(16G×5、24G×1,另有 2G/3G 是
b3g、2gpu这类误命中) - 官方模板库 909 条里,没有一条写显存
- 官方与社区的权重仓(含 194 个 H3 相关 HF 仓)里,量化档位最高只到 BF16 原精度,没有任何一处写 48G 显存要求
- awesome 索引 788 个链接里,没有任何 48G 卡实测记录
我试过用实测文件大小推导,结论是这条路不成立
本轮我把网盘上的权重精确字节数都取回来了,本来想用「权重总和」推出各档位下限。算出来是这样的:
| 项 | 值 |
|---|---|
| 配置组合总数(主模型 × 文本编码器 × 视频 VAE) | 48 |
| 总和最小的组合 | 32.7 GB(minimax_h3_fl2va_pruned_w6a8.safetensors + qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors + minimax_h3_video_vae_int8_convrot.safetensors) |
| 能压进 32GB 以内的组合 | 0 个 |
| 能压进 8GB 以内的组合 | 0 个 |
**可是 8GB 那位作者(YixuAn-13,RTX 4060 Laptop)明确实测可以跑。 最小的官方组合也要 32.7 GB,两者直接矛盾 —— 这说明用文件大小推显存档位是错的**。
矛盾的原因:ComfyUI 不会把所有权重同时塞进显存。文本编码器编码完 prompt 就卸载,扩散模型在低显存模式下按块加载/卸载(--lowvram/--novram),所以峰值远低于「权重文件总和」。 YixuAn-13 那套 8GB 方案正是这么做的:BlockCache 模型缓存 + SageAttention + SolAttn + comfy-kitchen 后端 + LowVRAM 三件套 + 两级 VRAM/RAM 清理。
所以我不拿这个推导当 48G 的依据 —— 它算出来的数字看着精确,实际把 ComfyUI 的显存管理机制整个忽略了。 把这条路写出来,是为了让你知道:别用权重文件大小判断自己的卡能不能跑,那会严重高估需求。
要补 48G 档,需要你给我依据:比如你自己 48G 卡的实测记录,或某位明确写了 48G 的工作流。给我,我立刻补。
六、读者自判方法(三步)
- 先看量化档:从第二节那张表里挑一档。压缩越狠越省显存、画质损失越大;
Q4_K_M与INT8_ConvRot是社区最常用的两个折中点。 - 再看分辨率:8GB 那位作者实测的结论是「全部分辨率锚定 0.82MP 是上限,2.09MP 会硬 OOM」。分辨率对显存的影响和量化档一样大,同一个权重降分辨率往往就能跑起来。
- 最后叠加提速件:
YixuAn-13的 8GB 方案是 BlockCache + SageAttention + SolAttn + LowVRAM 三件套一起上;本交付包的03-档位与提速-作者实测/里就是这批工作流。
这三步都是「可查事实 + 你自己判断」,我没有替你宣布「你的卡能跑什么」—— 那需要真卡实测,我给不了。
