| 配置 | 采样耗时 | 每步均值 | 端到端 | 跳步 | 相对基线画质偏差 |
|---|---|---|---|---|---|
| 基线(无 cache) | 121s | 6.03s | 147s | — | — |
| EasyCache(阈值 0.2) | 60s | 3.02s | 87s(1.69×) | 10/20 | 8.3/255(轨迹微分岔,无伪影) |
| FirstBlockCache(duckyshell,H3 Fast 档 0.10/max2) | 55s | 2.79s | 85s(1.73×) | 11/20 | 7.4/255(轨迹微分岔,无伪影) |
| FBC + Sol-Attn(tau 1.0,热跑) | 87s | 4.35s | 112s | 11/20 | 13.0/255(无伪影) |
| nvfp4 + Sol-Attn + FBC · 50 步 | 194s | 3.89s | 218s | 29/50 | —(50步档,见下方视频) |
⚠ Sol-Attn 实测:画质中性(无伪影),但在本机 sage 2.2.0 + triton 栈上为速度负收益(20步采样 87s vs 纯 FBC 55s,冷/热跑一致,非编译开销)。其宣称的 1.14–1.44× 是对照其测试环境的 sage 基线,未在我们的组合上复现。
原视频(输入)
bf16 GT · 50步 · 外部机器
基线 · 20步 · 147s
FirstBlockCache · 85s
原视频(输入)
bf16 GT · 50步 · 外部机器
nvfp4 + Sol-Attn + FBC · 50步 · 218s
结论:两种 cache 都把 20 步压到 ≈10 步无 cache 的耗时(82-87s),画质保持 20 步档、均无伪影。
FirstBlockCache(F1B0:每步只算 block 0,残差小则复用其余 49 block 的缓存)略胜:更快(55 vs 60s 采样)、
偏差更小(7.4 vs 8.3)、跳步分布更规律(cache steps 3,4,6,7,…,18,连跳上限 2 保证画质)。
两者互斥,二选一;EasyCache 是核心自带零安装,FBC 需装 duckyshell 节点。