LongLive 与 LongLive 2.0

LongLive 1.0

Paper:LongLive: Real-time Interactive Long Video Generation

解决的核心问题:实时、可交互的长视频生成

基础模型:Wan 2.1-1.3B

痛点:用户很难一次写完精确的长视频脚本,需要在生成中动态调整内容,但提示切换会产生两难。清空 KV Cache 能立刻响应新提示,却破坏人物和场景连续性;保留旧 Cache 虽然画面平滑,却会残留旧提示语义,使新指令延迟甚至失效。与此同时,长视频带来误差累积、注意力计算和显存增长,真正困难的是同时做到实时响应、提示遵循和跨分钟一致性。

核心贡献:KV-ReCache

  • 一般来说长视频的 rollout,下一个chunk的生成需要前一个chunk的kv cache,一般是用上一个chunk最后一次forward的kv cache,但是这个kv cache是有一点噪声的,所以论文提出对最后的干净x0继续进行一次forward(如果有新的prompt就用新的prompt),重新计算cache。
image.png

核心贡献2:Streaming Long Tuning

  • 把长序列拆成连续 5 秒片段,模型基于自身历史滚动生成,而教师仅监督当前片段;相比短训长测或整段反传,实现了低显存的“长训长测”对齐
image.png

训练的 Pipeline:

  • 训练单向 Teacher 模型。
    • 每个 chunk 只能看到前面几个 chunk 的信息
  • 蒸馏,进行 Teacher Forcing 训练。

LongLive 2.0

Paper:LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation

1.0 的路线:

这里后面的 long tuning 依赖前面已经得到的 few-step AR 模型,所以是串行。

而 2.0 是两条线:

线

同时:

线

最后再:


LongLive 与 LongLive 2.0
https://d4wnnn.github.io/2026/08/30/Notion/LongLive 与 LongLive 2.0/
作者
D4wn
发布于
2026年8月30日
许可协议