LTX-2
Paper:LTX-2: Efficient Joint Audio-Visual Foundation Model
模型整体结构如下:
LTX-2 是一个同时生成音频和视频的基模。
有如下核心设计。
- 视频和音频不共享 latent
- 因为视频具有三维结构,而音频主要是时间信息。
- 一个音频大概是 40ms,特征维度128.
- 非对称的双流 Transformer
- Video Stream 比较大,而 Audio Stream 比较小,前者为14B,后者为5B。把主要算力投入到视频生成,同时用一个更轻量的音频分支来完成声音建模。
- 双向音视频 Cross-Attention
- 每一层中,模型执行两个方向的交互。音频 token 作为 query 查询视频,再反过来查询音频。
- 跨模态的 AdaLN
音频和视频虽然联合生成,但是存在明显差异,可能去噪进度不同。
核心思想是发送方自己控制自己的信息是否可靠,以视频读取音频为例:
其中,
, , 在 Cross Attention 得到结果后,LTX-2 还会再做一次门控:
也就是写入视频流的跨模态结果,由音频模态的 timestep 控制。
- 使用 Gemma 3 12B 作为文本编码器,主要是因为音视频联合生成对文本理解要求更高。
- Modality-CFG
为什么需要两个 CFG?因为每个分支不只有文本条件,还会接收另一模态的信息。
论文将一个模态的模型写成:
其中:
- x:当前模态的 latent;
- t:文本条件;
- m:另一模态的条件特征。
其引导预测为:
LTX-2
https://d4wnnn.github.io/2026/07/24/Notion/LTX-2/