Paper: YaRN: Efficient Context Window Extension of Large Language Models


一句话概括

YaRN结合NTK感知插值和注意力缩放,实现了比位置插值更高效的上下文窗口扩展,支持高达128K的上下文长度。

核心思想

在位置插值的基础上,YaRN综合了多种改进:NTK感知插值对不同频率的位置编码分量采用不同的缩放策略(高频少缩放、低频多缩放);动态NTK根据序列长度自适应调整缩放因子;注意力缩放因子补偿缩放带来的注意力分布变化。这些技术的组合实现了更好的长文本处理能力。

关键创新

NTK感知插值针对不同频率差异化处理;动态缩放因子适应不同序列长度;注意力缩放补偿机制保持注意力分布稳定;所需微调数据量进一步减少。

深远影响

YaRN是上下文扩展技术的重要进步,其NTK感知思想被广泛吸收到后续工作中。该方法被多个开源长文本模型采用,推动了128K甚至更长上下文模型的发展。

启发与思考

YaRN展示了在已有方法上精细化改进的力量。位置编码中不同频率分量对信息编码的作用不同,差异化处理比一刀切更优。这种精细化思维对RAG系统的各个组件优化都有启发。