铭鸿体育资讯网

MacBook Pro本地跑VDN-H3,15s不到10分钟!

最近把 VDN-H3 移植到了 Vpipe,在 M5 Pro 24GB 上实测了一轮。
实测:越长、分辨率越高,加速越明显
统一使用 6 DiT steps + Turbo LoRA:
832×480 15 秒左右:17 min → 10 min,~1.7×
1344×768 14 秒左右:74 min → 28 min,~2.6×
小负载下 VDN 甚至可能更慢,但随着分辨率和时长增加,两条曲线会迅速拉开。

Vpipe 原版本身有多快?
最近另一个项目 FastH3 公布的数据,用 M4 Max 36GB:
832×480|124 帧|4 步:504s
我用 15" M5 MacBook Air 16GB 跑 Vpipe 原版 H3,不加 VDN:
832×480|124 帧|6 步 + 涡轮:469s
而且是完整冷启动,包括 text encoder,没有提前缓存模型权重(16GB没法缓存)。
不是同一台硬件,不能算严格对比。但 16GB MacBook Air 跑原版 BF16 H3 6步,已经可以比 M4 Max 上 FastH3 4步 的运行时间还短。
模型层面的加速很重要,底层推理实现的效率同样重要。

VDN的加速思路我很认可:利用扩散计算里的冗余,通过线性注意力+滑窗注意力,大幅降低大负载工况的计算量。
不过 VDN 也有代价。它会额外增加约 4GB 不可融合的权重和 1.1GB 可类似 LoRA 融合的权重。所以 24GB 机器上,小负载的内存开销会抵消一部分节约的计算。这也是为什么小负载下 VDN 不一定更快。不过后面还有优化空间:权重融合 + 8位量化。

画质怎么样?这点比预想得好。
同 seed 下,VDN-H3 和原版 H3 的整体构图通常非常接近。但有些场景确实存在质量下降。我测到一个我之前发过的水柱冲天的场景(可以翻我之前笔记):向上喷射的水柱,在视频中间逐渐变成向下流,几秒后又恢复向上。我怀疑这是滑窗和线性注意力带来的问题。后面或许可以尝试混入少量全局注意力。
目前这个方法只限于文生视频。首尾帧和多参考也是下一步值得做的方向。但是在线性和滑窗注意力的框架下,实现参考有点难度。
#MacBookPro #Mac本地部署 #本地AI #minimaxh3 #VDN #AppleSilicon #视频生成