[論文レビュー] Efficient Training of Language Models to Fill in the Middle
自己回帰言語モデルは、中間のスパンを末尾へ移動させる簡単なデータ変換によってFIM(fill-in-the-middle)を学習でき、FIMの学習は左から右への能力に対して実質的にコストなしで行える。FIMのファインチューニングは計算資源を要し、論文はベストプラクティスとベンチマークを提供する。
We show that autoregressive language models can learn to infill text after we apply a straightforward transformation to the dataset, which simply moves a span of text from the middle of a document to its end. While this data augmentation has garnered much interest in recent years, we provide extensive evidence that training models with a large fraction of data transformed in this way does not harm the original left-to-right generative capability, as measured by perplexity and sampling evaluations across a wide range of scales. Given the usefulness, simplicity, and efficiency of training models to fill-in-the-middle (FIM), we suggest that future autoregressive language models be trained with FIM by default. To this end, we run a series of ablations on key hyperparameters, such as the data transformation frequency, the structure of the transformation, and the method of selecting the infill span. We use these ablations to prescribe strong default settings and best practices to train FIM models. We have released our best infilling model trained with best practices in our API, and release our infilling benchmarks to aid future research.
研究の動機と目的
- 因果言語モデルにおけるインフィリングを促進・実現するため、 middle spanを末尾へ移動させる単純なデータ変換(FIM)を導入。
- FIMでの学習が左から右の生成に悪影響を及ぼさないことを、言語ドメインとコードドメインの両方で実証する(FIM-for-freeの特性)。
- FIM能力を最大化するためのハイパーパラメータと実践的ガイドライン(FIMレート、モード、文脈レベル対ドキュメントレベル、中間スパンの選択)を特徴づける。
- 将来のFIM研究と応用を促進するためのインフィリングベンチマークと、モデルのリリースを提供する。
提案手法
- 文書をプレフィックス、ミドル、サフィックスに分割し、中間を末尾へ移動させ、セントネル( sentinel )トークンと結合して(prefix, suffix, middle)を形成するデータ変換を適用。
- オリジナルの左から右データとFIM変換データの混合(FIMレートp、通常は50%)で因果デコーダーモデルを訓練し、自己回帰損失を維持しつつインフィリングを可能にする。
- PSM(prefix-suffix-middle order)とSPM(suffix-prefix-middle)の2つのFIM実装とそれらの結合訓練を検討し、セントネル配置の考慮点を考察。
- データ分断時のチャンク化によるデータ断片化を緩和するため、コンテキストレベル対ドキュメントレベルのFIMを探索し、100Bトークンの事前学習ホライズンとモデルスケールにわたるアブレーションを実施。
- 標準的な自己回帰ベンチマークによる左から右の性能を評価し、言語とコードの専門ベンチマークでインフィリングを測定する。新規のランダムスパンインフィリング課題を含む。
実験結果
リサーチクエスチョン
- RQ1FIMトレーニングはモデルの左から右の自己回帰能力に影響を与えるか。
- RQ2FIMレートを変えると、スケール間でインフィリング性能とAR性能にどのような影響があるか。
- RQ3インフィリングを最大化しつつ自己回帰を損なわないように、FIMの実装(PSM vs SPM、コンテキストレベル対ドキュメントレベル、中間スパンの選択)に関するベストプラクティスは何か。
- RQ4事前学習でのFIMと同等のFIM能力をファインチューニングで達成できるか、そしてその計算コストはどの程度か。
主な発見
- FIMトレーニングはFIM-for-freeの特性を生み出す。言語ドメインとコードドメインの両方で、最大50%のFIMデータを用いた訓練時の左から右(自己回帰)損失と性能は変化しない。
- FIMレートを高くしても自己回帰のパープレックス性は劣化せず、100%のFIMレートでAR損失が低下し始める。一方、インフィリング性能はFIMレートの高さとともに改善。
- コンテキストレベルのFIMはドキュメントレベルのFIMより一貫してインフィリングベンチマークで優れており、AR損失の差はほとんどない。
- SPMモードは一般にPSMよりやや強力であり、PSM+SPMの共同訓練は堅牢で柔軟なモデルと効率的な推論モードを生み出す。
- ARモデルをFIM能力獲得のためにファインチューニングするには大規模な追加計算資源が必要であり、FIMでゼロから学習したモデルと同等の性能を一般には達成しない。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。