Skip to main content
QUICK REVIEW

[論文レビュー] Giraffe: Adventures in Expanding Context Lengths in LLMs

Arka Pal, Deep Karkhanis|arXiv (Cornell University)|Aug 21, 2023
Topic Modeling被引用数 5
ひとこと要約

この論文では、ロータリ位置埋め込み(RoPE)の線形補間を用いて、LLaMAおよびLLaMA2から微調整された13BパラメータのLLMファミリー、Giraffeを提案する。これにより、最大32kトークンのコンテキスト長が拡張される。主な発見は、線形スケーリングが他の手法を上回ることであり、推論時にスケール因子をさらに大きくすることでさらなる向上が得られる。一方、独自の評価タスクでは、24kトークンを超えると顕著な性能低下が生じるが、困惑度(perplexity)は妥当な水準を維持していることが判明した。

ABSTRACT

Modern large language models (LLMs) that rely on attention mechanisms are typically trained with fixed context lengths which enforce upper limits on the length of input sequences that they can handle at evaluation time. To use these models on sequences longer than the train-time context length, one might employ techniques from the growing family of context length extrapolation methods -- most of which focus on modifying the system of positional encodings used in the attention mechanism to indicate where tokens or activations are located in the input sequence. We conduct a wide survey of existing methods of context length extrapolation on a base LLaMA or LLaMA 2 model, and introduce some of our own design as well -- in particular, a new truncation strategy for modifying the basis for the position encoding. We test these methods using three new evaluation tasks (FreeFormQA, AlteredNumericQA, and LongChat-Lines) as well as perplexity, which we find to be less fine-grained as a measure of long context performance of LLMs. We release the three tasks publicly as datasets on HuggingFace. We discover that linear scaling is the best method for extending context length, and show that further gains can be achieved by using longer scales at evaluation time. We also discover promising extrapolation capabilities in the truncated basis. To support further research in this area, we release three new 13B parameter long-context models which we call Giraffe: 4k and 16k context models trained from base LLaMA-13B, and a 32k context model trained from base LLaMA2-13B. We also release the code to replicate our results.

研究の動機と目的

  • 固定長のシーケンスで訓練されたLLMのゼロショットコンテキスト長の外挿法を評価・比較すること。
  • 元の訓練長を超えるコンテキスト長への延長を目的とした、新たな位置埋め込み戦略(特に切断基底を含む)を考案・検証すること。
  • ベースのLLaMAおよびLLaMA2モデルから微調整された、3つの新しい長文コンテキストLLM(Giraffe-4k、16k、32k)を導入・リリースすること。
  • 長文コンテキスト性能の細分化された評価を可能にするため、3つの新しいベンチマークデータセット(LongChat-Lines、FreeFormQA、AlteredNumericQA)を構築・リリースすること。
  • 困惑度だけでは長文コンテキスト能力を十分に評価できないこと、およびタスク固有のベンチマークが困惑度では捉えきれない顕著な性能低下を明らかにすることを示すこと。

提案手法

  • さまざまなスケール因子を用いた、ロータリ位置埋め込み(RoPE)の線形補間を用いて、ベースのLLaMAおよびLLaMA2モデルを微調整した。
  • 元のコンテキスト長を超える外挿を改善するため、位置埋め込みの新たな切断基底を提案した。
  • 3つの新しい公開データセット(LongChat-Lines(キー・バリュー検索)、FreeFormQA、AlteredNumericQA(長文文書上の質疑応答))を用いて、手法を評価した。
  • 一貫した評価を確保するため、固定されたプロンプト構造を用いたインstruct微調整(IFT)を適用した。
  • ベースライン指標として文書コーパス上の困惑度を用いたが、長文コンテキスト推論精度を捉える上でその限界を強調した。
  • HuggingFaceに、4k、16k、32kのコンテキスト長を持つ3つの13Bモデルのコードと重みをリリースした。

実験結果

リサーチクエスチョン

  • RQ1他の手法(正弦波、学習可能、スケーリング済みRoPEなど)と比較して、ロータリ位置埋め込みの線形補間が、長文コンテキストLLMのゼロショット外挿性能において最良であるか?
  • RQ2質問と回答の配置が、さまざまなコンテキスト長におけるモデル性能に与える影響は?
  • RQ3位置埋め込みの切断基底を用いることで、元のコンテキスト長を超えて真正の外挿が可能になるか?また、線形スケーリングと比較して性能は?
  • RQ4困惑度と実際の長文コンテキスト推論精度の相関度はどの程度か?また、カスタムベンチマークは困惑度では捉えきれない性能低下を明らかにするか?
  • RQ5微調整時のスケール因子を超えて、推論時にスケール因子を大きくすることで性能向上が得られるか?また、その向上に限界はあるか?

主な発見

  • ロータリ位置埋め込みの線形補間は、すべての評価タスクにおいて、学習可能および正弦波位置埋め込みと比較して一貫して優れた性能を示した。
  • FreeFormQAおよびAlteredNumericQAでは、24kトークンを超えると、困惑度が安定しているにもかかわらず性能低下が観察された。これは、一貫性と推論精度の間には乖離があることを示唆している。
  • 質問をコンテキストの末尾に配置することで、FreeFormQAおよびAlteredNumericQAにおける長文長での精度が向上した。これは、注意機構が長文シーケンスにおいて最近のトークンを好む可能性があることを示唆している。
  • 位置埋め込みの切断基底は、有望な外挿能力を示したが、線形スケーリングを上回ることはなかった。今後の検証が求められる。
  • 微調整時のスケール因子を超えて推論時にスケール因子を大きくすることで、性能向上が得られたが、2倍の要因を超えると増加が止まり、このアプローチの実用的限界があることが示された。
  • 困惑度は長文コンテキスト性能の粗い指標であることが判明した。モデルが高困惑度で一貫性のある出力を生成しても、推論タスクでは失敗する可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。