Long-Live-RAG

Paper:LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation

image.png

具体是怎么做 Rag的?

  • 每个历史块保存一个 1024 维检索 embedding,以及对应的原生生成器 context。前者负责低成本相似度搜索,后者保留完整视觉细节供注意力使用。

如何训练:

  • 将某个 chunk 的 latent 通过自编器重建
  • Window Temporal Delta Loss :防止相邻 chunk 的 embedding 过于相似。实现时计算相邻窗口的cos相似度,超过某个阈值就惩罚。
  • Trajectory-smoothing Loss :防止相邻 chunk 的 embedding 突变。实现时计算二姐阶差分。

Long-Live-RAG
https://d4wnnn.github.io/2026/08/30/Notion/Long-Live-RAG/
作者
D4wn
发布于
2026年8月30日
许可协议