Paper: Scissorhands: Exploiting the Persistence of Importance Hypothesis for LLM KV Cache Compression


一句话概括

利用注意力分数的持久性假设,通过剪除不重要的KV缓存条目来大幅降低LLM推理的内存占用。

核心思想

LLM推理中KV Cache随序列长度线性增长,成为长文本推理的主要内存瓶颈。Scissorhands发现了重要性持久性现象:在历史步骤中被注意力关注的token,在未来步骤中也倾向于保持重要。基于此,可以安全地丢弃那些持续不被关注的KV缓存条目。

关键创新

提出了一种无需重训练的KV Cache压缩方法:(1)在每个解码步骤中追踪每个token的注意力分数历史;(2)基于累积重要性评分淘汰不重要的缓存条目;(3)保留关键的初始token(attention sink)和近期token。可将KV Cache压缩至原来的20%-30%而几乎不损失性能。

深远影响

KV Cache压缩已成为LLM部署的关键优化技术。后续的StreamingLLM、H2O等工作进一步发展了这一方向,使得在有限GPU内存上服务超长上下文成为可能,直接影响了vLLM等推理框架的设计。

启发与思考

注意力的稀疏性和持久性暗示LLM可能并不需要记住所有历史信息。这与人类的选择性注意力机制有异曲同工之处。如何更智能地管理上下文窗口中的信息是提升LLM效率的关键。