Skip to main content
QUICK REVIEW

[論文レビュー] Meet in the Middle: A New Pre-training Paradigm

Anh‐Tu Nguyen, Nikos Karampatziakis|arXiv (Cornell University)|Mar 13, 2023
Topic Modeling被引用数 4
ひとこと要約

本稿では、同一のデータ上で左から右へと、右から左へと同時トレーニングする新しい事前学習パラダイム「Meet in the Middle」(MIM)を提案する。予測の整合性を強制することで、データ効率性とインフィルティング性能が向上する。この手法は、両側の文脈を活用する双方向推論手順により、遅延を低減し、精度を向上させる。結果として、パープレキシティおよびコード補完において最先端の結果を達成する。

ABSTRACT

Most language models (LMs) are trained and applied in an autoregressive left-to-right fashion, assuming that the next token only depends on the preceding ones. However, this assumption ignores the potential benefits of using the full sequence information during training, and the possibility of having context from both sides during inference. In this paper, we propose a new pre-training paradigm with techniques that jointly improve the training data efficiency and the capabilities of the LMs in the infilling task. The first is a training objective that aligns the predictions of a left-to-right LM with those of a right-to-left LM, trained on the same data but in reverse order. The second is a bidirectional inference procedure that enables both LMs to meet in the middle. We show the effectiveness of our pre-training paradigm with extensive experiments on both programming and natural language models, outperforming strong baselines.

研究の動機と目的

  • 標準的な自己回帰的言語モデルの性質にかかわらず、トレーニング中に接頭語と接尾語の両方の文脈を活用することで、事前学習のデータ効率性を向上させること。
  • ユーザーが既存のシーケンスにコンテンツを挿入するインフィルティングタスクにおける性能を向上させることで、モデルが両方向の文脈を利用できるようにすること。
  • 従来の自己回帰的モデルと互換性を保ちつつ、品質と効率性を向上させる統合的トレーニングおよび推論フレームワークを構築すること。
  • 前方と後方の予測が一致するまでに到達するタイミングを検出することで、インフィルティングタスクにおける推論遅延を低減すること。

提案手法

  • 同じモノトニックに順序付けられたトレーニングデータ上で、共有パラメータを持つ2つの言語モデル(左から右への前方モデルと右から左への後方モデル)をトレーニングする。
  • 各トークン位置における前方モデルと後方モデルの予測確率分布を一致させるために、全変動距離に基づく整合性正則化項を導入する。
  • 標準的な言語モデル学習損失と整合性正則化項の組み合わせによる損失関数を用い、トレーニング中に両モデルを同時に最適化する。
  • 推論時、前方と後方の生成を並列に実行し、予測トークンが真ん中で一致するまで継続する。
  • 両モデルの一致を停止基準として活用することで、生成ステップ数を削減し、遅延を低減する。
  • 前方モデルを標準的な自己回帰的言語モデルの即時置換として使用可能に保ちつつ、後方モデルはインフィルティングなどの双方向タスクをサポートする。

実験結果

リサーチクエスチョン

  • RQ1左から右、右から左の言語モデルを同時にトレーニングすることで、事前学習時のデータ効率性が向上するか?
  • RQ2前方と後方の予測の整合性を強制することで、下流のインフィルティングタスクでの性能が向上するか?
  • RQ3真ん中で一致する双方向推論手順は、自己回帰的ベースラインと比較して遅延を低減しつつ、精度を向上させることができるか?
  • RQ4パープレキシティおよびコード補完性能の観点で、MIMパラダイムはFIM や CM3 などの既存手法と比較してどのように差がつくか?

主な発見

  • MIM事前学習パラダイムは、自然言語およびコードのデータセットの両方で、FIM を含む強力なベースラインよりも低いパープレキシティを達成する。
  • HumanEval コード補完ベンチマークでは、MIM は FIM や他のベースラインを上回るゼロショットコード補完精度を達成する。
  • 双方向推論手順により、FIM と比較して平均推論遅延が最大50%まで低減される。特に、モデルが早期に収束する場合に顕著である。
  • アブレーションスタディの結果、整合性正則化項が一貫性と性能、特にインフィルティングタスクにおいて顕著に向上させることを確認した。
  • 本手法は、前方モデルが標準的な自己回帰的言語モデルの即時置換として直接利用可能であるため、従来の自己回帰的モデルと互換性を保っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。