StreamingLLM

Paper:Efficient Streaming Language Models with Attention Sinks

image.png

论文发现模型普遍对初始 Token 保持较高的注意力,比如上图里面:

  • 横轴为被关注的 token,也就是 key
  • 纵轴为当前正在生成或者计算的 token

所以如果初始 token 被删除了,就会很大的影响注意力分布,生成质量就会突然恶化。所以在生成长文本的时候,不能盲目的删除初始的 token。

论文提出了 StreamingLLM:

  • 初始 Token 永远保留(维持注意力分布的稳定性)
  • 保留最近的一些 Token

另外论文提出了对预训练的改进,也就是在每个训练样本开头加上专门的可学习的sink token。


StreamingLLM
https://d4wnnn.github.io/2026/08/29/Notion/StreamingLLM/
作者
D4wn
发布于
2026年8月29日
许可协议