MiniMax-H3 Ref2VA · Cache 加速对比

混合精度 checkpoint (FP8+NVFP4) · 480×832 · 124 帧 @24fps · 20 步 · seed 42 · case 9202c3df · RTX 5090 单卡 · sage 2.2.0 + triton 后端已开。← 返回 8-case 主对比页
配置采样耗时每步均值端到端跳步相对基线画质偏差
基线(无 cache)121s6.03s147s
EasyCache(阈值 0.2)60s3.02s87s(1.69×)10/208.3/255(轨迹微分岔,无伪影)
FirstBlockCache(duckyshell,H3 Fast 档 0.10/max2)55s2.79s85s(1.73×)11/207.4/255(轨迹微分岔,无伪影)
FBC + Sol-Attn(tau 1.0,热跑)87s4.35s112s11/2013.0/255(无伪影)
nvfp4 + Sol-Attn + FBC · 50 步194s3.89s218s29/50—(50步档,见下方视频)
⚠ Sol-Attn 实测:画质中性(无伪影),但在本机 sage 2.2.0 + triton 栈上为速度负收益(20步采样 87s vs 纯 FBC 55s,冷/热跑一致,非编译开销)。其宣称的 1.14–1.44× 是对照其测试环境的 sage 基线,未在我们的组合上复现。
原视频(输入)
bf16 GT · 50步 · 外部机器
基线 · 20步 · 147s
FirstBlockCache · 85s
原视频(输入)
bf16 GT · 50步 · 外部机器
nvfp4 + Sol-Attn + FBC · 50步 · 218s
结论:两种 cache 都把 20 步压到 ≈10 步无 cache 的耗时(82-87s),画质保持 20 步档、均无伪影。 FirstBlockCache(F1B0:每步只算 block 0,残差小则复用其余 49 block 的缓存)略胜:更快(55 vs 60s 采样)、 偏差更小(7.4 vs 8.3)、跳步分布更规律(cache steps 3,4,6,7,…,18,连跳上限 2 保证画质)。 两者互斥,二选一;EasyCache 是核心自带零安装,FBC 需装 duckyshell 节点。