[論文レビュー] DeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training with Gradient-Disentangled Embedding Sharing
DeBERTaV3 は MLM を RTD に置換し、勾配分離埋め込み共有(GDES)を導入して ELECTRA 風 pre-training と DeBERTa の分離注意を組み合わせ、GLUE、SQuAD v2.0、クロス言語 XNLI で同様のモデル構造の PLM における SOTA を達成している。
This paper presents a new pre-trained language model, DeBERTaV3, which improves the original DeBERTa model by replacing mask language modeling (MLM) with replaced token detection (RTD), a more sample-efficient pre-training task. Our analysis shows that vanilla embedding sharing in ELECTRA hurts training efficiency and model performance. This is because the training losses of the discriminator and the generator pull token embeddings in different directions, creating the "tug-of-war" dynamics. We thus propose a new gradient-disentangled embedding sharing method that avoids the tug-of-war dynamics, improving both training efficiency and the quality of the pre-trained model. We have pre-trained DeBERTaV3 using the same settings as DeBERTa to demonstrate its exceptional performance on a wide range of downstream natural language understanding (NLU) tasks. Taking the GLUE benchmark with eight tasks as an example, the DeBERTaV3 Large model achieves a 91.37% average score, which is 1.37% over DeBERTa and 1.91% over ELECTRA, setting a new state-of-the-art (SOTA) among the models with a similar structure. Furthermore, we have pre-trained a multi-lingual model mDeBERTa and observed a larger improvement over strong baselines compared to English models. For example, the mDeBERTa Base achieves a 79.8% zero-shot cross-lingual accuracy on XNLI and a 3.6% improvement over XLM-R Base, creating a new SOTA on this benchmark. We have made our pre-trained models and inference code publicly available at https://github.com/microsoft/DeBERTa.
研究の動機と目的
- RTD と DeBERTa を組み合わせて事前学習の効率と下流の性能を改善することを調査する。
- ELECTRA 風の設定でトレーニングを妨げる埋め込み共有の衝突を特定し対処する。
- 勾配分離埋め込み共有(GDES)戦略を提案し、ジェネレータと識別器の目的をバランスさせる。
- GLUE、SQuAD v2.0、および多言語 XNLI ベンチマークで DeBERTaV3 のバリアントを評価し、同程度のモデル規模下で新しい SOTA を確立する。
提案手法
- DeBERTa の MLM を RTD に置換して DeBERTaV3 を形成する。
- 埋め込み共有のダイナミクスを分析し、標準 ES(埋め込み共有)および NES(共有なし)の欠点を実証する。
- 勾配分離埋め込み共有(GDES)を提案し、E_G を E_D と共有するが RTD からの勾配が停止勾配機構を介してジェネレータ埋め込みへ流れないようにし、E_D = sg(E_G) + E_Delta として実装する。
- 判別器埋め込みを E_D = sg(E_G) + E_Delta と再パラメータ化し、E_Delta をゼロで初期化し RTD のみで更新、E_G は MLM で更新する。
- 標準的な DeBERTa 設定を用いて複数のモデルサイズ(Large、Base、Small、XSmall)を Pre-train し、データ量 160GB、ステップ数 500k、バッチサイズ 8192、AdamW オプティマイザを使用する。
- GLUE(8タスク)、MNLI、SQuAD v2.0、RACE、ReCoRD、SWAG、CoNLL-2003、XNLI(英語および多言語設定)で評価する。
実験結果
リサーチクエスチョン
- RQ1MLM を RTD に置換することで DeBERTa の事前学習効率と下流の NLU 性能は向上するか。
- RQ2ジェネレータと識別器間の埋め込み共有はトレーニングダイナミクスとモデル品質にどう影響するか。
- RQ3勾配分離埋め込み共有(GDES)戦略は埋め込み共有の利点を維持しつつ勾配の衝突を回避できるか。
- RQ4ベースラインと比較して GLUE、MNLI、SQuAD v2.0、XNLI における DeBERTaV3 および mDeBERTaV3 の利得はどれくらいか。
主な発見
- RTD ベースの DeBERTaV3 は初期比較で MLM ベースの DeBERTa を MNLI および SQuAD v2.0 の点で大きく上回る。
- ELECTRA の埋め込み共有(ES)はジェネレータと識別器の目的間の牽引力により学習を遅くする可能性がある。NES は勾配の干渉を回避するが下流の利得は限定的。
- GDES は埋め込みを共有しつつジェネレータ-識別器の勾配を分離可能とし、ES および NES よりも速い収束と下流性能の向上を実現する。
- DeBERTaV3 Large は GLUE の平均で 91.37% を達成し、DeBERTa および ELECTRA のベースラインをそれぞれ 1.37 ポイントと 1.91 ポイント上回っている。
- mDeBERTaV3 Base は平均 XNLI 精度 79.8% を達成し、XNLI Base の XLM-R Base および mT5 Base をそれぞれ 3.6 ポイントおよび 4.4 ポイント上回り、同程度のサイズの多言語モデルの新しい SOTA を確立している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。