LTX

Paper:LTX-Video: Realtime Video Latent Diffusion

传统视频扩散模型:

  • 视频 → VAE 压缩 → Transformer 多步去噪 → VAE 只负责解码

LTX-Video:

  • 视频被 更猛烈地压缩 → Transformer 在极少的 token 上去噪 → VAE Decoder 同时完成解码和最后一步去噪

论文在 1.9B 大小的模型上,生成 121 帧,768*512的视频,只需要两秒。

超高压缩的 Video VAE。

传统的VAE多数是空间压缩88,时间压缩4倍,然后再经过 22*1的 patchfy,把相邻 latent 合并成 token。

而 LTX-Video 则是对 VAE 直接做 32328的压缩,然后不经过 patchfy,直接变成 token。

虽然维度压缩的更小,但是通道维度从16提升到了128.

Denoising Decoder

如果 latent 被压缩的很厉害,无法完整保存一些细节。即使 Transformer 输出一个比较干净的 latent,但是可能也没有足够的信息,让普通的 decoder 恢复细节。

而 LTX-Video 让 Decoder 接受带少量噪声的 latent 以及 当前时间步 t,然后直接预测干净像素。

训练噪声的时间步范围大约是

为高压缩 VAE 设计的损失

最终的损失:

下面一个一个讲:

首先是像素 MSE 损失,也就是保证基础内容一致:

然后是 LPIPS 感知损失,在 latent space 比较差异。

然后是 DWT 损失,也就是对原始视频和重建视频做3维离散小波变换 DWT,把视频分解成多个频率分量:

  • 空间的高低频
  • 时间的高低频
  • 各种组合频段

论文计算 8 个 3D DWT 分量,对应的分量使用 L1 距离,目的是让 VAE 保留边缘、纹理、高频运动的纹理信息。

然后是 GAN 损失,传统 GAN 看到的是单独样本,然后判断真假。问题是视频中有些模糊本身就是真实的。所以论文同时把原图和重建图给判别器,让判别器判断哪个是真的哪个是假的。

其他信息

LTX 使用 T5-XXL 作为文本编码器,使用 Cross Attention 注入文本


LTX
https://d4wnnn.github.io/2026/07/16/Notion/LTX/
作者
D4wn
发布于
2026年7月16日
许可协议