[論文レビュー] Continual Domain-Tuning for Pretrained Language Models
本稿では、事前学習された言語モデル(例:BERT、RoBERTa)のドメイン適応における継続的学習(CL)手法、特にエラスティック・ウェイト・コンソリデーション(EWC)を提案し、継続的忘却を軽減する。EWCは、元のドメイン知識を保持するようにパラメータ更新を制約することで、標準的なドメイン適応(SDT)と比較してわずかな計算コスト増加で、下流タスクのパフォーマンスとドメインシフトに対するロバスト性を向上させる。
Pre-trained language models (LM) such as BERT, DistilBERT, and RoBERTa can be tuned for different domains (domain-tuning) by continuing the pre-training phase on a new target domain corpus. This simple domain tuning (SDT) technique has been widely used to create domain-tuned models such as BioBERT, SciBERT and ClinicalBERT. However, during the pretraining phase on the target domain, the LM models may catastrophically forget the patterns learned from their source domain. In this work, we study the effects of catastrophic forgetting on domain-tuned LM models and investigate methods that mitigate its negative effects. We propose continual learning (CL) based alternatives for SDT, that aim to reduce catastrophic forgetting. We show that these methods may increase the performance of LM models on downstream target domain tasks. Additionally, we also show that constraining the LM model from forgetting the source domain leads to downstream task models that are more robust to domain shifts. We analyze the computational cost of using our proposed CL methods and provide recommendations for computationally lightweight and effective CL domain-tuning procedures.
研究の動機と目的
- 事前学習された言語モデルを新しいドメインに適応する際の標準的ドメイン適応(SDT)における継続的忘却の影響を調査すること。
- 継続的学習(CL)手法が、ドメイン適応中に元のドメイン知識の忘却を軽減できるかどうかを評価すること。
- 前向きおよび後向きの転送を向上させるCL手法を同定すること(両方のドメインにおける下流タスクのパフォーマンス向上を目的)。
- CLベースのドメイン適応の計算コストを分析し、実用的導入に適した軽量で効果的な手法を提案すること。
- 微調整中に元のドメイン表現を保持することで、下流モデルのドメインシフトに対するロバスト性を向上させること。
提案手法
- L2正則化、エラスティック・ウェイト・コンソリデーション(EWC)、経験再利用(ER)、勾配エピソード記憶(GEM)、正則化ヘブシアン(RH)の5つの代表的なCL手法をドメイン適応設定に適応する。
- EWCを用いて、小規模な元ドメインデータ(WikiText)のサンプルからフィッシャー情報行列の近似を計算し、保存すべき重要なパラメータを同定する。
- 重要なパラメータの大きな更新を防ぐために、CL制約をターゲットドメインコーパスにおける継続的事前学習中に適用する。
- 事前学習には標準的なマスクド言語モデル(MLM)損失を使用し、抽出的質問応答および自然言語推論タスクで微調整する。
- 前向き転送(元の事前学習がターゲットタスクに与える影響)と後向き転送(ターゲット微調整が元のタスクに与える影響)を主な評価指標として用いる。
- 各手法の計算コストを比較し、EWCとL2はSDTとほぼ同等の効率であるのに対し、GEMとRHはミニバッチごとの勾配計算が必要なため、約2倍のコストがかかると指摘する。
実験結果
リサーチクエスチョン
- RQ1標準的ドメイン適応(SDT)における継続的忘却は、ターゲットドメインの下流タスクのパフォーマンスにどのように影響するか?
- RQ2ドメイン適応における事前学習言語モデルの元ドメイン知識の忘却を最も効果的に軽減するCL手法はどれか?
- RQ3CLベースのドメイン適応手法は、SDTと比較して前向き転送(ターゲットタスクのパフォーマンス向上)と後向き転送(元タスクのパフォーマンス維持)を向上させるか?
- RQ4CLベースのドメイン適応の計算コストはどの程度で、パフォーマンスと効率のバランスが取れている手法はどれか?
- RQ5CLベースのドメイン適応モデルは、下流微調整におけるドメインシフトに対してロバスト性を向上させることができるか?
主な発見
- エラスティック・ウェイト・コンソリデーション(EWC)は、パフォーマンスと計算効率のバランスが最も優れており、SDTと比較して優れた後向き転送を示し、前向き転送においても競争力を持つ。
- RHは平均的にEWCよりも前向き転送で優れるが、著しく計算コストが高いため、大規模モデルには実用的でない。
- EWCは、SDTよりも下流タスクの出力変数に関する情報を保持する潜在表現を生成しており、より優れた特徴学習が行われていることを示している。
- EWCで微調整した重みで初期化された下流モデルは、ドメインシフト(例:ターゲットから元ドメインへの転送)に対してよりロバストであり、一般化性能が向上している。
- DistilBERTのような小規模モデルでは、EWCのパフォーマンスが劣るため、GEMやRHがより良い代替手段であるが、計算コストは高い。
- L2およびEWCは計算コストの増加が最小限(SDTとほぼ同等)であり、実世界の導入に最も適している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。