5090 实测:H3 从 20 步压到 4 步,时间都花在哪了

更新于 2026-09 · 数据来自本机 ComfyUI 运行日志与公开实测

这台测试机的配置:RTX 5090 32GB + 64GB DDR5-6000,模型是官方最小组合 (剪枝 INT8 主模型 19.5GB + NVFP4 文本编码器 14.6GB + 两个 VAE),启动参数 --fast --use-sage-attention,加速 LoRA 用 LightX2V 8 步版。 下面所有数字都来自真实日志,不是估算。

先看一张时间账

同一条 1344×768、73 帧(约 3 秒)的片段,8 步采样的时间构成:

阶段耗时占比
文本编码器加载 + 编码约 11 秒14%
采样(8 步 × 5.45 秒/步)43.6 秒54%
VAE 解码 + 保存约 17.1 秒21%
其它(调度、缓存等)约 8.6 秒11%
端到端80.3 秒100%

两个结论:短片段里采样只占一半,加载与解码是另一大块;片段越长, 采样占比越高(token 数增长伴随注意力平方项),加速的重点才真正落到采样上。

步数压缩:20 → 8 → 4 的实际收益

同机、1280×704、约 5 秒片段的公开实测(采样段,不含加载):

配置步数采样耗时相对 20 步
官方基线20约 270 秒(外推)1.0×
+ LightX2V Turbo 8 步8125 秒2.2×
+ 内置 INT8 注意力(Kitchen)879 秒3.4×
+ FastH3 4 步蒸馏4约 60-70 秒(由 1.87× 推算)约 4×
注意一个反直觉现象:单步耗时不是常数。20 步档的单步约 13.5 秒, 8 步档反而涨到约 15.6 秒——少的步数没有减少每步开销(LoRA 补丁、调度切换都还在), 但总时间仍大幅下降。所以「步数 ÷ 4 = 时间 ÷ 4」只在粗算时成立。

三层加速的正确叠加方式

  1. 步数蒸馏(只选一个):LightX2V 8 步(质量损失最小)、4 步(约 3.4×)、 larryvrh Turbo 8 步、FastH3 4 步(约 4×)。叠加两个蒸馏 LoRA 会互相破坏效果;
  2. 注意力后端(可叠加,收益大):SageAttention 或 ComfyUI 0.32+ 内置的 Kitchen 注意力,采样段再提速 1.4-2×。512 步里的这层相当于白送;
  3. 缓存类(谨慎):EasyCache / Spectrum 再省 15-40%,但属于跳过计算, 需要抽检画面;同一提示词批量出种子时,无损的 CLIPCached 条件缓存收益更大。

质量怎么取舍

你的显卡对应多少时间?

上面的数字只适用于 5090。不同显卡的采样时间主要跟显存带宽和架构相关—— 打开 WhichH3 计算器,选显卡、内存和页文件设置, 它会给出每个「分辨率 × 时长 × 步数」的预估时间、显存占用,以及 20 步 / 8 步 / 4 步 三档加速方案的对比,并标出你机器上的最佳档位。

结论