2026 年本地视频生成基本是三个开源选择:**MiniMax H3**(音画同生、15 秒)、 **Wan 2.2**(阿里通义,生态最成熟)、**LTX-2.5**(极速 + 原生音频)。 它们不是替代关系,而是三种取舍。先看结论:
| 模型 | 参数 | 本地显存 | 最长 | 原生音频 | 许可 | 速度感受 |
|---|---|---|---|---|---|---|
| MiniMax H3 | 33.1B | 8GB 极限 / 16GB 可用 / 32GB 舒适 | 15 秒 | ✅ 立体声 | 社区许可(含地区与营收条款) | 慢(5090 768p 5s 4步约 80 秒) |
| Wan 2.2 TI2V-5B | 5B | 8GB(GGUF)/ 16GB 舒适 | 约 5 秒 | ❌ 需另配音频 | Apache 2.0(商用最省心) | 中(4090 480p 5s 约 4-6 分钟) |
| Wan 2.2 A14B | 27B(14B 激活) | 12GB(GGUF 卸载)/ 40GB+ 满血 | 约 5 秒 | ❌ | Apache 2.0 | 慢(画质最好档) |
| LTX-2.5 | 22B | 12GB(蒸馏/量化)/ 32GB+ 完整质量 | 约 10 秒 | ✅ 单次同生 | 开放权重(商用条款需查官方,分档) | 极快(蒸馏版接近实时) |
| 你的核心需求 | 推荐 | 原因 |
|---|---|---|
| 要人物说话、音效与画面同步生成 | H3 或 LTX-2.5 | 两者都是原生音视频联合生成;Wan 2.2 需要后期配音或对口型流程 |
| 要 10-15 秒的完整叙事片段 | H3 | 15 秒是开源模型里最长;LTX 约 10 秒;Wan 约 5 秒 |
| 要快速抽卡、大量迭代 | LTX-2.5 蒸馏版 | 蒸馏 + 单卡接近实时的速度,是三个里最快的 |
| 商用许可要最省心 | Wan 2.2 | Apache 2.0;H3 与 LTX 的许可有各自条款(H3 还含地区限制) |
| 生态与 LoRA 数量 | Wan 2.2 | 发布一年多,训练工具链与社区 LoRA 最丰富;H3 的生态正在快速补齐 |
| 画质与细节上限 | H3(768p)与 Wan A14B | 两者在各自分辨率档位都是第一梯队;LTX 强在速度而非细节 |
注意「快」有两种:LTX 快在架构与蒸馏;H3 的 4 步加速 LoRA 也能把 20 步压到 4 步(约 4 倍), 但基数不同。如果你主要做「音频必须同步」的短片,H3 与 LTX 之间的速度差可以被工作流(抽卡分辨率)抹平。