[論文レビュー] ERNIE-Gram: Pre-Training with Explicitly N-Gram Masked Language Modeling for Natural Language Understanding
ERNIE-Gram は、連続するトークン列ではなく n-gram の同一性を直接予測する明示的な n-gram マスク言語モデル手法を提案し、事前学習を向上させる。生成モデルを用いて妥当な n-gram をサンプリングし、包括的な粗粒度および細粒度の予測を可能にする。19 個の NLU タスクで最先端の性能を達成し、XLNet や RoBERTa よりも大きく上回り、30万個の n-gram 辞書を用いて GLUE および SQuAD ベンチマークで新たな SOTA を樹立した。
Coarse-grained linguistic information, such as named entities or phrases, facilitates adequately representation learning in pre-training. Previous works mainly focus on extending the objective of BERT's Masked Language Modeling (MLM) from masking individual tokens to contiguous sequences of n tokens. We argue that such contiguously masking method neglects to model the intra-dependencies and inter-relation of coarse-grained linguistic information. As an alternative, we propose ERNIE-Gram, an explicitly n-gram masking method to enhance the integration of coarse-grained information into pre-training. In ERNIE-Gram, n-grams are masked and predicted directly using explicit n-gram identities rather than contiguous sequences of n tokens. Furthermore, ERNIE-Gram employs a generator model to sample plausible n-gram identities as optional n-gram masks and predict them in both coarse-grained and fine-grained manners to enable comprehensive n-gram prediction and relation modeling. We pre-train ERNIE-Gram on English and Chinese text corpora and fine-tune on 19 downstream tasks. Experimental results show that ERNIE-Gram outperforms previous pre-training models like XLNet and RoBERTa by a large margin, and achieves comparable results with state-of-the-art methods. The source codes and pre-trained models have been released at https://github.com/PaddlePaddle/ERNIE.
研究の動機と目的
- BERT モードルのマスク言語モデルが名前付きエンティティやフレーズなどの粗粒度の言語的情報を捉えることの制限を解消すること。
- 連続する n-gram マスクの非効率性、すなわちマスクされたスパン内のトークンを独立して扱い、内部依存関係を無視することを克服すること。
- スパarsなトークン空間ではなく、密な予測空間における n-gram 同一性の明示的モデリングにより表現学習を強化すること。
- 包括的予測(粗粒度および細粒度)と明示的な n-gram 関係学習により、n-gram の意味的モデリングを向上させること。
- 改善された事前学習により、多様な NLU ベンチマークで最先端の性能を達成すること。
提案手法
- ERNIE-Gram は、1つの [MASK] トークンを用いて n-gram をマスクし、事前に構築された n-gram 辞書からの明示的な n-gram 同一性を予測することで、予測空間を |V_F|^n から |V_N| に削減する。
- 妥当な n-gram 同一性をサンプリングする生成モデルを採用し、より強固で多様な訓練信号を可能にする。
- 共有されたアテンションマスク機構を用いて、同時にマスクされたスパンの明示的 n-gram 同一性と個々のトークン同一性を予測することで、包括的な n-gram 予測を実現する。
- 強化された n-gram 関係モデリング機構を導入し、妥当な n-gram から元の n-gram を回復する能力を学習させ、n-gram 間の意味的関係を明示的にモデリングする。
- 置換トークン検出(RTD)目的関数を変更し、元の n-gram と生成された n-gram を区別できるようにし、n-gram レベルとトークン レベルの表現間の相互作用を向上させる。
- 事前学習は、BERT-base および BERT-large の設定を用いて、英語および中国語のテキストコーパス(16GB および 160GB)で実施され、微調整は 19 個の下流タスクで実施された。
実験結果
リサーチクエスチョン
- RQ1個々のトークンや連続するトークン スパンをマスクするのではなく、n-gram 同一性を明示的にマスク・予測することで、表現学習が向上するか?
- RQ2n-gram 同一性を有限で密な空間(V_N)で予測する方が、スパarsで指数的空間(V_F^n)からの予測よりも性能が向上するか?
- RQ3n-gram 同一性とその構成要素トークンの両方を包括的に予測することで、フレーズや名前付きエンティティの意味的モデリングがどの程度向上するか?
- RQ4妥当な代替 n-gram から元の n-gram を回復する能力を学習する明示的 n-gram 関係モデリングは、文脈表現学習をどの程度向上させるか?
- RQ5事前学習における n-gram 辞書の最適サイズは、カバレッジと性能のバランスを取るためにどの程度か?
主な発見
- ERNIE-Gram は 19 個の下流 NLU タスクで XLNet や RoBERTa を大きく上回り、GLUE および SQuAD ベンチマークで最先端の結果を達成した。
- GLUE ベンチマークでは、SQuAD1.1 で 78.9 F1 スコア、SQuAD2.0 で 87.4 F1 スコアを達成し、以前のモデルを著しく上回った。
- アブレーションスタディでは、包括的 n-gram 予測を削除すると性能が 0.3–0.6 ポints 減少し、強化された n-gram 関係モデリングを削除すると 0.4–1.3 ポイント低下した。
- n-gram 辞書サイズが 30万を超えると性能が低下し、低頻度 n-gram を含めると学習に悪影響を及ぼすことが示された。40万の辞書サイズでは顕著な性能低下が観察された。
- ケーススタディでは、ERNIE-Gram はより高い長さの名前付きエンティティのリCALLを維持しており、エンティティ全体にわたる注意の整合性が強く、内部依存関係のモデリングが優れていることが確認された。
- アテンションヘッドの可視化では、ERNIE-Gram では名前付きエンティティ上に明確で一貫性のある明るいブロックが観察された。これは、同じエンティティ内でのトークン同士が互いに注目していることを示しており、ベースラインの対角線的自己アテンションパターンとは対照的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。