Long-Live-RAG
Paper:LongLive-RAG: A General Retrieval-Augmented Framework for Long Video Generation
具体是怎么做 Rag的?
- 每个历史块保存一个 1024 维检索 embedding,以及对应的原生生成器 context。前者负责低成本相似度搜索,后者保留完整视觉细节供注意力使用。
如何训练:
- 将某个 chunk 的 latent 通过自编器重建
- Window Temporal Delta Loss
:防止相邻 chunk 的 embedding 过于相似。实现时计算相邻窗口的cos相似度,超过某个阈值就惩罚。 - Trajectory-smoothing Loss
:防止相邻 chunk 的 embedding 突变。实现时计算二姐阶差分。
Long-Live-RAG
https://d4wnnn.github.io/2026/08/30/Notion/Long-Live-RAG/