PreciseCache

Paper:PreciseCache Precise Feature Caching for Efficient and High-fidelity Video Generation,ICLR 2026

解决的核心问题:DiT 加速。

以往的统一缓存或自适应缓存机制无法准确识别真正的“冗余特征”,导致误跳过了重要特征的计算,

论文提出了一个名为 PreciseCache 的即插即用、无需训练的加速框架 。它从 Step-wise Block-wise 两个空间粒度,精准检测并剔除真正冗余的计算。

核心方案

创新点一:时域自适应缓存 LFCache

  • 在去噪过程中,高噪声阶段主要决定视频的“底层结构和轮廓”(低频信息,极其重要,不能跳过),而低噪声阶段只负责修饰“感知不明显的细节”(高频信息,可安全跳过)

  • 利用快速傅里叶变换(FFT)提取模型预测特征 的低频分量 :

    定义低频差异(Low-Frequency Difference, LFD)来衡量相邻时间步之间结构信息的改变程度:

在实际推理中,如果累加的低频误差 小于设定阈值 ,就直接复用上一步的缓存,跳过当前推理 。

直接计算 需要运行完整的模型,这无法实现加速 。作者巧妙地发现,LFD 对图像的分辨率并不敏感 。因此,在每个时间步,先对潜在特征进行空间+时间下采样,用极轻量的小特征图跑一次“试探推理”得到 ,计算出估计的 。如果累加的误差 低于阈值 ,则直接复用上一步的缓存特征,跳过当前步的完整大模型推理 。

创新点二:网络块级别自适应缓存

直觉:即使某些时间步不能被整体跳过,DiT 内部包含几十个 Transformer Block,并不是每一个 Block 在这一步都做出了很大贡献 。有些 Block 的输入和输出几乎没变,它们的计算同样可以被跳过。

在无法跳过的完整推理步 中,计算每个 Block 的残差,对于第 个 Block,它接收到的输入特征是 ,输出特征是 。算法会计算这个 Block 对特征到底做了多大的修改,并将这个差值 缓存下来:

算出所有 Block 的差值后,对它们求 范数(矩阵模长)并排序 。找出贡献最大的前 的 Block(比如前 40%),把它们标记为核心块,其余的标记为非核心块。 在紧接着的后面 同样需要执行网络推理的步骤中(论文中设置 ),模型不再傻傻地运行所有 Block,而是开始偷懒:

  • 如果是核心块(在 Top 里面):保持正常计算,让特征老老实实地过一遍这个 Block。
  • 如果是非核心块:

核心思想:那些在第 步时没有什么存在感的 Block(算出来的残差特别小),在接下来的第 步时,依然没有什么存在感 。而且,它们所负责处理的信息变化趋势也是高度相似的 。

实验效果:

image.png

PreciseCache
https://d4wnnn.github.io/2026/05/26/Notion/PreciseCache/
作者
D4wn
发布于
2026年5月26日
许可协议