[論文レビュー] PMI-Masking: Principled masking of correlated spans
本稿では、ポイントワイズ相互情報量(PMI)を用いて相関する語のスパンを同定することで、事前学習されたマスク言語モデル(MLM)における相関する語のスパンのマスクを原理的に行うPMI-Maskingを提案する。この手法では、ランダムなトークンではなく、意味的に整合性のあるスパンを同時にマスクすることで、収束を加速し、訓練時間の半分で先行研究の最終的性能に達する。さらに、RACE や SQuAD2.0 を含む複数のベンチマークで、下流タスクの性能を向上させる。
Masking tokens uniformly at random constitutes a common flaw in the pretraining of Masked Language Models (MLMs) such as BERT. We show that such uniform masking allows an MLM to minimize its training objective by latching onto shallow local signals, leading to pretraining inefficiency and suboptimal downstream performance. To address this flaw, we propose PMI-Masking, a principled masking strategy based on the concept of Pointwise Mutual Information (PMI), which jointly masks a token n-gram if it exhibits high collocation over the corpus. PMI-Masking motivates, unifies, and improves upon prior more heuristic approaches that attempt to address the drawback of random uniform token masking, such as whole-word masking, entity/phrase masking, and random-span masking. Specifically, we show experimentally that PMI-Masking reaches the performance of prior masking approaches in half the training time, and consistently improves performance at the end of training.
研究の動機と目的
- ランダムトークンマスクが、簡単なサブワード予測タスクに過剰適合し、語の全体的理解が十分に学習されないという、MLMにおける非効率性を是正すること。
- 全語マスク や ランダムスパンマスク といったヒューリスティックなマスク戦略の限界、すなわち範囲が限定されたり、ノイズの多い部分的コロケーションを含めたりする問題を克服すること。
- 統計的コロケーションに基づく、原理的でデータ駆動のマスク戦略を開発し、信号の効率性とモデルの一般化能力を向上させること。
- PMI-Masking がランダムトークンマスク や ランダムスパンマスク と比較して、収束が速く、下流タスクの性能が優れていることを実証すること。
- 単一トークン予測を目的関数とする標準的なMLMの目的関数が、下流タスクの性能と相関が低く、より効果的な代替案を提案すること。
提案手法
- 事前学習コーパス内での高頻度共起 n-gram(例:フレーズ、コロケーション)を同定するための拡張された n-項ポイントワイズ相互情報量(PMI)測度を定義する。
- 拡張PMI式を用いて、個々のトークン頻度を超えて統計的に有意な共起を示す n-gram をコーパス内で同定する。
- 高PMI n-gram を1つのマスクユニットとして扱い、それらに含まれない通常のトークンは個別にマスク可能とする。
- 事前学習中、高PMI n-gram または単一トークンのどちらかをランダムに選択してマスクし、意味的に整合性のあるスパンを同時にマスクする。
- 標準的なMLM目的関数を用い、残りの文脈からマスクされたスパン(n-gram または単一トークン)を予測する。BERT のアーキテクチャに変更は加えない。
- ベースラインと同一のハイパーパrameterとシーケンス長を用いてモデルを訓練し、マスク戦略間の公平な比較を確保する。
実験結果
リサーチクエスチョン
- RQ1MLMにおけるランダムトークンマスクは、簡単なサブワード予測タスクに過剰適合し、非効率な事前学習を引き起こすか?
- RQ2コロケーション検出に基づく原理的でデータ駆動のマスク戦略は、事前学習の効率性と下流タスクの性能を向上させられるか?
- RQ3PMI-Masking は、全語マスク や ランダムスパンマスク といったヒューリスティック手法と比較して、収束速度と最終的性能の点で優れているか?
- RQ4異なるマスク戦略を用いた場合、単一トークンのパープレキシティと下流タスクの性能の相関はどの程度か?
- RQ5より小さな事前学習コーパスと少ない訓練例を用いても、PMI-Masking はより大きなコーパスとランダムマスクを用いた場合に比べ、より優れた下流結果を達成できるか?
主な発見
- PMI-Masking は、先行するマスク戦略(例:SpanBERT、RoBERTa)が達成する下流タスクの性能を、事前学習時間の半分で達成する。
- PMI-Masking を用いた Base サイズのモデルは、複数の下流タスクで SpanBERT BASE より 1–2 ポints 高く、3倍小さいコーパスと6倍少ない訓練例を用いても RoBERTa BASE を上回る。
- RACE ベンチマークでは、同じ数の訓練例が与えられたにもかかわらず、PMI-Masking を用いたモデルは、ランダムスパンマスクで学習された SpanBERT BASE モデルよりも2点以上高いスコアを達成した。
- PMI-Masking で学習されたモデルは、100万ステップ経過後に単一トークンパープレキシティが21.85に達したが、これはランダムトークンマスク(2.96)よりも顕著に高い値であり、標準的な目的関数を最小化しても下流タスクの成功とは相関しないことを示している。
- PMI-Masking は、事前学習の全期間にわたり、ランダムスパンマスクを常に上回り、訓練の半ばでその最終的性能に達する。
- より大きなアーキテクチャやより大きな事前学習コーパスを用いたモデルと比較しても、PMI-Masking は性能を向上させ、その効率性と有効性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。