LongLive 与 LongLive 2.0
LongLive 1.0
Paper:LongLive: Real-time Interactive Long Video Generation
解决的核心问题:实时、可交互的长视频生成
基础模型:Wan 2.1-1.3B
痛点:用户很难一次写完精确的长视频脚本,需要在生成中动态调整内容,但提示切换会产生两难。清空 KV Cache 能立刻响应新提示,却破坏人物和场景连续性;保留旧 Cache 虽然画面平滑,却会残留旧提示语义,使新指令延迟甚至失效。与此同时,长视频带来误差累积、注意力计算和显存增长,真正困难的是同时做到实时响应、提示遵循和跨分钟一致性。
核心贡献:KV-ReCache
- 一般来说长视频的 rollout,下一个chunk的生成需要前一个chunk的kv cache,一般是用上一个chunk最后一次forward的kv cache,但是这个kv cache是有一点噪声的,所以论文提出对最后的干净x0继续进行一次forward(如果有新的prompt就用新的prompt),重新计算cache。
核心贡献2:Streaming Long Tuning
- 把长序列拆成连续 5 秒片段,模型基于自身历史滚动生成,而教师仅监督当前片段;相比短训长测或整段反传,实现了低显存的“长训长测”对齐
训练的 Pipeline:
- 训练单向 Teacher 模型。
- 每个 chunk 只能看到前面几个 chunk 的信息
- 蒸馏,进行 Teacher Forcing 训练。
LongLive 2.0
Paper:LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation
1.0 的路线:
这里后面的 long tuning 依赖前面已经得到的 few-step AR 模型,所以是串行。
而 2.0 是两条线:
同时:
最后再:
LongLive 与 LongLive 2.0
https://d4wnnn.github.io/2026/08/30/Notion/LongLive 与 LongLive 2.0/