低显存跑 H3 完全可行,但要用"组合拳":更小的量化 + 正确的启动参数 + 够大的虚拟内存, 并且把分辨率控制在 540p 档。下面是按显存分档的清单。
| 方案 | 主模型体积 | 适用 | 说明 |
|---|---|---|---|
| GGUF Q3_K_M(剪枝) | 8.9 GB | 8-10GB 显存 | 体积最小;质量有损失,速度低于 INT8 |
| 剪枝 INT8 ConvRot | 19.5 GB | 12GB+ 显存 | 官方推荐;配动态卸载在 12GB 上实测可用 |
| W4A8 ConvRot(剪枝) | 12.5 GB | 12GB+ 显存 / ComfyUI ≥0.31 | 4 位权重跑 INT8 计算,权重误差约 0.073,接近 INT8 质量 |
文本编码器同样要选小的:NVFP4 AWQ(14.6GB)适合绝大多数机器(不限 Blackwell);
内存特别小(16GB)可以把编码器换成 GGUF Q2(13.1GB)并配合 --fast-disk。
python main.py --fast-disk --disable-mmap --use-sage-attention
--fast-disk:权重放页缓存,可被系统回收,内存占有率大幅下降(实测 45→13GB 级);--disable-mmap:Windows 下读取超过 20GB 的模型文件需要加,否则可能崩溃;--use-sage-attention:采样提速 1.3-2 倍(长序列注意噪声风险,见下文);--lowvram:显存 8GB 时再加。16GB 内存 + 8GB 显存的组合是"必须开大页文件"的场景:建议虚拟内存设为 48GB 以上, 放在 NVMe 固态上。这样系统在显存与内存都吃紧时还能靠磁盘顶住——代价是慢,但能出片。 32GB 内存的 12GB 显卡用户可以不开页文件,但要接受权重频繁从 SSD 读回。
| 配置 | 分辨率 / 时长 | 设置 | 耗时 |
|---|---|---|---|
| 8GB 显存 + 16GB 内存 + 46GB 页文件 | 736×416 / 5 秒 | 4 步蒸馏 + Sage | 约 5-6.5 分钟 |
| 8GB 显存 + 16GB 内存 | 736×416 / 10 秒 | 4 步 + 文本编码器加速 | 约 13 分钟 |
| 8GB 显存 + 16GB 内存 | 736×416 / 15 秒 | — | 基本不可用(建议放弃) |
| 12GB 显存 + 32GB 内存 | 1280×736 / 5 秒 | 720p 加速 4 步 | 约 7 分钟 |
想知道你的具体配置能跑到哪一档,用 计算器 点几个选项即可; 想找对应的量化文件,去 模型下载库 的"量化 / 低显存"分类。