LTX-2

Paper:LTX-2: Efficient Joint Audio-Visual Foundation Model

模型整体结构如下:

image.png

LTX-2 是一个同时生成音频和视频的基模。

有如下核心设计。

  • 视频和音频不共享 latent
    • 因为视频具有三维结构,而音频主要是时间信息。
    • 一个音频大概是 40ms,特征维度128.
  • 非对称的双流 Transformer
    • Video Stream 比较大,而 Audio Stream 比较小,前者为14B,后者为5B。把主要算力投入到视频生成,同时用一个更轻量的音频分支来完成声音建模。
  • 双向音视频 Cross-Attention
    • 每一层中,模型执行两个方向的交互。音频 token 作为 query 查询视频,再反过来查询音频。
  • 跨模态的 AdaLN
    • 音频和视频虽然联合生成,但是存在明显差异,可能去噪进度不同。

    • 核心思想是发送方自己控制自己的信息是否可靠,以视频读取音频为例:

    • 其中,

    • 在 Cross Attention 得到结果后,LTX-2 还会再做一次门控:

    • 也就是写入视频流的跨模态结果,由音频模态的 timestep 控制。

  • 使用 Gemma 3 12B 作为文本编码器,主要是因为音视频联合生成对文本理解要求更高。
  • Modality-CFG

为什么需要两个 CFG?因为每个分支不只有文本条件,还会接收另一模态的信息。

论文将一个模态的模型写成:

其中:

  • x:当前模态的 latent;
  • t:文本条件;
  • m:另一模态的条件特征。

其引导预测为:


LTX-2
https://d4wnnn.github.io/2026/07/24/Notion/LTX-2/
作者
D4wn
发布于
2026年7月24日
许可协议