MiniMax H3 是一个 33.1B 参数的全模态 Transformer,能一次性生成带立体声音频的视频。 它的硬件门槛比参数看起来要低——关键不是单看显存,而是**显存、内存、硬盘三层之间怎么配合**。
| 显存 | 可行方案 | 体验 |
|---|---|---|
| 8 GB | GGUF Q3 + 重度卸载 + 大页文件 | 540p 短线;慢,但能出片 |
| 12 GB | 剪枝 INT8(官方推荐档) | 540p-640p;4-8 步加速后可用 |
| 16 GB | 同上,显存更宽裕 | 768p 短线舒适;50 系可上 NVFP4/W4A8 |
| 24 GB | 完整 INT8 或大参数剪枝模型 | 768p 全时长;基本无需逐层卸载 |
| 32 GB+ | 剪枝 INT8 常驻 + NVFP4 编码器 | 768p 15 秒;适合批量出片 |
注意:ComfyUI 的动态显存管理会让"峰值显存"贴着显卡上限走,所以 16GB 卡跑 768p 时显存显示 约 14-15GB 属于正常现象,不代表模型只需要这么多。
H3 运行时有三个大块在抢内存:文本编码器(14.6-27GB,加载后不会释放宿主副本)、 主模型(19.5-34GB)、以及 VAE。32 GB 内存的机器上,这些无法同时驻留, 系统会开始用页文件换入换出——单步时间会从秒级掉到十几秒级,并伴随 SSD 写入。
--fast-disk(让权重走可回收的页缓存),
并把虚拟内存调到 48 GB 以上;如果长期使用,升级到 64 GB 是性价比最高的一步。
内存世代也有影响:DDR4-3200 双通道的有效带宽约 36 GB/s,DDR5-6000 约 71 GB/s。 在权重卸载场景下,这个差距会直接反映到等待时间上;单通道内存则会再砍一半。
| 硬件 | 分辨率 / 时长 | 步数 | 耗时参考 |
|---|---|---|---|
| RTX 5090 32GB | 1344×768 / 5 秒 | 8(LightX2V) | 约 80 秒(端到端,实测日志) |
| RTX 5070 Ti 16GB | 1344×768 / 5 秒 | 8(larry) | 约 3 分钟 |
| RTX 4070 12GB | 576×832 / 5 秒 | 20(基线) | 约 4.5 分钟 |
| RTX 4070 12GB | 576×832 / 5 秒 | 4(LightX2V) | 约 80 秒 |
| RTX 3060 12GB | 1280×736 / 5 秒 | 20(基线) | 约 17 分钟 |
时长对时间的影响是非线性的:15 秒视频的 token 数约为 5 秒的 3 倍,但注意力计算量按平方增长, 所以实际耗时差距会更大。建议新手从 5 秒起步,跑通后再拉长。
上面的表格只是参考。打开 WhichH3,选择你的显卡、内存与页文件设置, 它会给出每个"分辨率 × 时长"组合的显存、内存、页文件写入与预估耗时,并标出你机器上的最佳临界点。