Skip to main content
QUICK REVIEW

[论文解读] Scaling Laws of RoPE-based Extrapolation

Xiaoran Liu, Hang Yan|arXiv (Cornell University)|Oct 8, 2023
Topic ModelingComputer Science被引用 3
一句话总结

本文提出了一套统一的理论框架——基于RoPE外推的扩展规律(Scaling Laws of RoPE-based Extrapolation),用以解释通过调整旋转基(rotary base)(无论大于还是小于10,000)以及微调上下文长度,如何提升基于RoPE的LLM外推性能。研究证明,在16K上下文长度下,使用500或1,000,000的基值进行微调,可使LLaMA2 7B和13B模型实现对100万 token 的外推,且基值与微调长度之间存在决定性能的关键周期性关系,该关系控制着模型在训练长度之外的表现。

ABSTRACT

The extrapolation capability of Large Language Models (LLMs) based on Rotary Position Embedding is currently a topic of considerable interest. The mainstream approach to addressing extrapolation with LLMs involves modifying RoPE by replacing 10000, the rotary base of $θ_n={10000}^{-2n/d}$ in the original RoPE, with a larger value and providing longer fine-tuning text. In this work, we first observe that fine-tuning a RoPE-based LLM with either a smaller or larger base in pre-training context length could significantly enhance its extrapolation performance. After that, we propose extbf{ extit{Scaling Laws of RoPE-based Extrapolation}}, a unified framework from the periodic perspective, to describe the relationship between the extrapolation performance and base value as well as tuning context length. In this process, we also explain the origin of the RoPE-based extrapolation issue by extbf{ extit{critical dimension for extrapolation}}. Besides these observations and analyses, we achieve extrapolation up to 1 million context length within only 16K training length on LLaMA2 7B and 13B.

研究动机与目标

  • 探究一种反直觉现象:在微调中,旋转基值小于或大于10,000均能提升基于RoPE的LLM外推性能,而标准基值10,000反而表现不佳。
  • 识别RoPE外推失败的潜在机制,并通过周期性与临界维度分析揭示其解决路径。
  • 建立一个统一的理论框架,将旋转基、微调上下文长度与外推性能关联起来。
  • 在LLaMA2 7B和13B模型上实证验证该框架,仅使用16K微调上下文即实现100万上下文长度的外推。

提出的方法

  • 从周期性视角建模RoPE在训练长度之外的行为,分析角分辨率与周期性如何影响注意力稳定性。
  • 引入“外推临界维度”概念,解释当基值与上下文长度不匹配时性能下降的原因。
  • 利用RoPE的三角函数性质,推导出旋转基、微调上下文长度与外推极限之间的数学扩展规律。
  • 在LLaMA2模型上,对500至1,000,000范围内的基值,分别在4K和16K微调长度下进行实证测试。
  • 通过Books3数据集上的困惑度评估验证框架,并分析注意力得分动态。
  • 证明基值减小可通过提升角分辨率增强外推能力,而大基值则通过相位折叠(phase wrapping)扩展有效范围。

实验结果

研究问题

  • RQ110,000是否是微调中基于RoPE外推性能最差的基值?其性能为何在此处下降?
  • RQ2旋转基、微调上下文长度与外推上限之间是否存在数学关系?
  • RQ3为何较小和较大的基值均能提升外推性能?其双重改善机制是什么?
  • RQ4RoPE外推问题的根源是什么?其与注意力得分稳定性及周期性的关系如何?
  • RQ5所提出的扩展规律能否解释现有方法(如Dynamic NTK和Code LLaMA)的成功?

主要发现

  • 在原始4K上下文长度下,使用较小基值(如500)或较大基值(如1,000,000)进行微调,相比标准的10,000基值,显著提升了外推性能。
  • 通过在16K上下文长度下使用1,000,000的基值进行微调,LLaMA2 7B和13B模型成功实现了对100万上下文长度的外推。
  • 基值为10,000时的性能下降,归因于角分辨率与周期性之间的临界错配,使其在测试范围内成为表现最差的基值。
  • 基值减小通过提升角分辨率,延迟相位折叠,从而维持注意力稳定性,增强外推能力。
  • 该框架通过揭示大基值与长上下文的组合可实现长序列中稳定的相位演进,解释了Code LLaMA(1M基值,16K微调)的成功。
  • 研究识别出非常大基值的外推性能上限,证实了基于相位的泛化在RoPE中的理论极限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。