Skip to main content
QUICK REVIEW

[論文レビュー] Scaling Laws of RoPE-based Extrapolation

Xiaoran Liu, Hang Yan|arXiv (Cornell University)|Oct 8, 2023
Topic ModelingComputer Science被引用数 3
ひとこと要約

本稿では、回転基底(10,000未満および10,000超)を調整し、文脈長をファインチューニングすることで、RoPEベースのLLMにおける外挿性能を向上させる統一的理論枠組み—RoPEベース外挿のスケーリング法則—を提案する。実証的に、16K文脈長で基底を500または1,000,000に設定してファインチューニングすることで、LLaMA2 7Bおよび13Bモデルが100万トークンにまで外挿可能であることを示した。基底値とファインチューニング長さの間には、訓練長さを超えた性能を支配する周期的関係が顕著に現れ、これが性能に大きな影響を与える。

ABSTRACT

The extrapolation capability of Large Language Models (LLMs) based on Rotary Position Embedding is currently a topic of considerable interest. The mainstream approach to addressing extrapolation with LLMs involves modifying RoPE by replacing 10000, the rotary base of $θ_n={10000}^{-2n/d}$ in the original RoPE, with a larger value and providing longer fine-tuning text. In this work, we first observe that fine-tuning a RoPE-based LLM with either a smaller or larger base in pre-training context length could significantly enhance its extrapolation performance. After that, we propose extbf{ extit{Scaling Laws of RoPE-based Extrapolation}}, a unified framework from the periodic perspective, to describe the relationship between the extrapolation performance and base value as well as tuning context length. In this process, we also explain the origin of the RoPE-based extrapolation issue by extbf{ extit{critical dimension for extrapolation}}. Besides these observations and analyses, we achieve extrapolation up to 1 million context length within only 16K training length on LLaMA2 7B and 13B.

研究の動機と目的

  • 標準の10,000ベースとは異なる、より小さい値およびより大きな値の回転基底がRoPEベースのLLMの外挿性能を向上させるという直感に反する現象を解明すること。
  • RoPE外挿失敗の背後にあるメカニズムを、周期性と臨界次元解析を通じて特定し、その解決法を明らかにすること。
  • 回転基底、ファインチューニング文脈長、外挿性能の間の統一的理論枠組みを構築すること。
  • LLaMA2 7Bおよび13Bを用いて、16Kファインチューニング文脈長での実証的検証を実施し、100万トークンの文脈長外挿を達成すること。

提案手法

  • 訓練長さを超えたRoPEの挙動をモデル化するための周期的視点を提案し、角分解能と周期性が注意機構の安定性に与える影響を分析する。
  • 外挿性能の低下を説明するための「外挿のための臨界次元」の概念を導入し、基底と文脈長の不一致が性能低下を引き起こすメカニズムを解明する。
  • RoPEの三角関数的性質を用いて、回転基底、ファインチューニング文脈長、外挿限界の間の数学的スケーリング法則を導出する。
  • LLaMA2モデルに対して、500から1,000,000の基底値を4Kおよび16Kのファインチューニング長さで変動させ、実証的検証を実施する。
  • Books3データセットを用いた perplexity 評価と注意スコアのダイナミクス分析を通じて、枠組みの妥当性を検証する。
  • 基底の低減が角分解能の向上により外挿性能を向上させ、位相の重ね合わせを遅らせて注意の安定性を維持することを示す。一方、大きな基底値は位相の包み込みにより有効範囲を拡大する。

実験結果

リサーチクエスチョン

  • RQ110,000は、ファインチューニングにおけるRoPEベース外挿性能にとって最悪の基底値であるか。なぜこの値で性能が低下するのか?
  • RQ2回転基底、ファインチューニング文脈長、および外挿上限の間に数学的関係が存在するか?
  • RQ3より小さな基底値とより大きな基底値の両方が外挿性能を向上させる可能性があるのか。その二重方向の向上はどのように説明できるか?
  • RQ4RoPE外挿問題の原因は何か。これは注意スコアの安定性と周期性とどのように関連しているか?
  • RQ5提案されたスケーリング法則は、Dynamic NTK や Code LLaMA といった既存手法の成功を説明できるか?

主な発見

  • 標準の10,000ベースと比較して、元の4K文脈長でより小さな基底(例:500)またはより大きな基底(例:1,000,000)でファインチューニングすることで、外挿性能が顕著に向上する。
  • 基底を1,000,000に設定し、16K文脈長でのファインチューニングを行うことで、LLaMA2 7Bおよび13Bモデルが100万トークンの文脈長にまで外挿可能である。
  • 基底=10,000で観察される性能低下は、角分解能と周期性の臨界的不一致に起因し、テスト範囲内で最も性能が低い基底である。
  • 基底の低減は角分解能の向上により外挿性能を向上させ、位相の重ね合わせを遅らせて注意の安定性を維持する。
  • 本枠組みは、大規模な基底と長い文脈長の組み合わせが、長時間にわたるシーケンスで安定した位相進行を可能にするため、Code LLaMA(100万基底、16Kファインチューニング)の成功を説明できる。
  • 非常に大きな基底値では、外挿性能に上限が存在することが判明し、RoPEにおける位相ベース一般化の理論的限界を確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。