Skip to main content
QUICK REVIEW

[論文レビュー] Masking as an Efficient Alternative to Finetuning for Pretrained Language Models

Mengjie Zhao, Tao Lin|arXiv (Cornell University)|Apr 26, 2020
Topic Modeling被引用数 13
ひとこと要約

この論文は、事前学習言語モデルの重みに対して選択的バイナリマスクを学習する「マスキング」を提案し、微調整のパラメータ効率の良い代替手法として位置づける。事前学習済み重みを保持し、各タスクごとに1ビットのマスクのみを学習することで、11のNLPタスクにおいて微調整と同等の性能を達成しながら、特にマルチタスク展開時においてメモリ使用量を大幅に削減する。

ABSTRACT

We present an efficient method of utilizing pretrained language models, where we learn selective binary masks for pretrained weights in lieu of modifying them through finetuning. Extensive evaluations of masking BERT and RoBERTa on a series of NLP tasks show that our masking scheme yields performance comparable to finetuning, yet has a much smaller memory footprint when several tasks need to be inferred simultaneously. Through intrinsic evaluations, we show that representations computed by masked language models encode information necessary for solving downstream tasks. Analyzing the loss landscape, we show that masking and finetuning produce models that reside in minima that can be connected by a line segment with nearly constant test accuracy. This confirms that masking can be utilized as an efficient alternative to finetuning.

研究の動機と目的

  • 複数のタスクを同時に展開する際、大規模な事前学習言語モデルの微調整にかかる高いメモリコストを軽減すること。
  • バイナリマスクによる選択的パラメータプルーニングが、事前学習済み重みを更新せずに微調整の性能に匹敵できるかどうかを検証すること。
  • 多様なNLPタスクにおける微調整の代替手法として、マスキングのパラメータ効率性の有効性を評価すること。
  • マスクされたモデルの一般化性能および損失関数の形状特性を分析し、マスキングが競争的な性能を発揮する理由を理解すること。

提案手法

  • 本手法は、下流タスクごとに1つの学習可能なバイナリマスクを学習し、事前学習モデルのアテンション層およびフィードフォワード層に適用する。
  • バイナリマスクは、直線的推定(straight-through estimator)を用いて、離散的なマスク値を介してバックプロパゲーションを可能にする形で、エンドツーエンドで最適化される。
  • 最終的なモデルは、元の事前学習済み重みにバイナリマスクを乗算した重みのみを使用し、元のパrameterはすべて変更されない。
  • 本手法は、文書分類、NER、読解理解を含む11の多様なNLPタスクにおいて、BERT、RoBERTa、DistilBERTに適用される。
  • 微調整済み重みではなく、バイナリマスクのみを保存することで、パラメータ効率的なアンサンブルが可能になる。
  • 損失関数の形状の類似性を評価するため、微調整済みモデルとマスク済みモデルを直線セグメントに沿って補間するモード接続性分析が実施される。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み重みに対してバイナリマスクを学習することで、多様なNLPタスクで微調整と同等の性能を達成できるか?
  • RQ2複数の下流タスクを展開する際、マスキングのメモリ効率は微調整と比べてどの程度優れているか?
  • RQ3マスクされたモデルが学習する表現は、下流タスクの性能に十分な情報を含んでいるか?
  • RQ4マスキングと微調整が見つけた最小値は、損失関数の形状上で接続されており、類似した最適化経路をたどっているか?
  • RQ5異なるモデルやタスクにおいて、マスキング機構の性能に影響を与える要因は何か?

主な発見

  • マスキングは、MRPC、SST-2、CoNLL-2003を含む11の多様なNLPタスクにおいて、微調整と同等の性能を達成し、有意に精度が低下しない。
  • マスキングのメモリフットプリントは顕著に削減され、タスクごとに1パラメータあたり1ビットのみで済むため、エッジデバイス上でのマルチタスク展開に最適である。
  • 内部評価により、マスクされたモデルが下流タスクに適した汎用的で情報豊富な表現を抽出していることが確認された。
  • 損失関数の形状解析により、マスキングと微調整が見つけた最小値が、ほぼ一定のテスト精度を維持する直線セグメントで接続されており、最適化の質が類似していることが示された。
  • BERTの上位レイヤーのマスクは、タスク間でより相違しており、深いレイヤーにタスク固有性が強いことが示唆され、微調整の研究結果とも整合的である。
  • 異なるランダム初期化のもとでもマスクの性能が類似しており、複数の有効なサブネットワークが存在することが支持され、ロットリーチケット仮説とも整合的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。