[論文レビュー] Recall and Learn: Fine-tuning Deep Pretrained Language Models with Less Forgetting
本稿では、事前学習データにアクセスできない状況下で、事前学習とダウンストリームタスクを同時に学習することで、深層事前学習言語モデルの微調整中に継続的忘却を軽減するためのリコールと学習メカニズムを提案する。Pretraining Simulationを導入し、事前学習重みのみを用いて知識を再構築し、Objective Shiftingにより段階的にダウンストリームタスクに焦点を当てる。BERT-baseを用いたGLUEベンチマークで最先端の結果を達成し、広範な採用を促進するためのオープンソースのRecAdam最適化手法を公開する。
Deep pretrained language models have achieved great success in the way of pretraining first and then fine-tuning. But such a sequential transfer learning paradigm often confronts the catastrophic forgetting problem and leads to sub-optimal performance. To fine-tune with less forgetting, we propose a recall and learn mechanism, which adopts the idea of multi-task learning and jointly learns pretraining tasks and downstream tasks. Specifically, we propose a Pretraining Simulation mechanism to recall the knowledge from pretraining tasks without data, and an Objective Shifting mechanism to focus the learning on downstream tasks gradually. Experiments show that our method achieves state-of-the-art performance on the GLUE benchmark. Our method also enables BERT-base to achieve better performance than directly fine-tuning of BERT-large. Further, we provide the open-source RecAdam optimizer, which integrates the proposed mechanisms into Adam optimizer, to facility the NLP community.
研究の動機と目的
- 深層事前学習言語モデルの微調整中に発生する継続的忘却を解消すること。
- 大規模な事前学習データにアクセスできない状況下で、事前学習タスクとダウンストリームタスクのマルチタスク学習を可能にすること。
- 動的目的重み付けを用いて、事前学習からの知識保持と効果的なダウンストリームタスク学習のバランスを図ること。
- これらのメカニズムを統合した実用的な最適化手法を開発し、NLP分野の研究および応用分野における容易な導入を可能にすること。
提案手法
- 事前学習データにアクセスできない状況下で、事前学習重みのみを用いて、マスクされた言語モデルなど、事前学習の目的を再構築するPretraining Simulationメカニズムを提案する。
- 訓練中に事前学習タスクの損失重みを徐々に減らし、ダウンストリームタスクの損失重みを増やすことで、段階的にダウンストリームタスクに焦点を当てるObjective Shiftingメカニズムを導入する。
- 凍結された事前学習モデルのログティクスと勾配を用いて、パラメータ効率的かつ微分可能に事前学習タスクの監督をシミュレートする手法を設計する。
- リコールと学習メカニズムをAdam最適化手法に統合し、即挿し可能なオープンソースのRecAdam最適化手法を提供する。
- 事前学習モデルのパラメータから近似された2次正則化項を用いて、学習の安定化と忘却の低減を図る。
- 訓練エポックに伴い、事前学習タスクに焦点を当てる段階からダウンストリームタスクに焦点を当てる段階へと移行する動的損失重み付け戦略を採用する。
実験結果
リサーチクエスチョン
- RQ1事前学習データにアクセスできない状況下でも、事前学習言語モデルの微調整にマルチタスク学習を効果的に適用できるか?
- RQ2事前学習モデルのパラメータのみを用いて、ダウンストリーム微調整中に事前学習の知識をどのように再現・保持できるか?
- RQ3どのような動的損失重み付け戦略が、事前学習知識の保持とダウンストリームタスク学習の両面で良好なバランスを実現できるか?
- RQ4統合学習メカニズムは、従来の微調整手法に比べ、ダウンストリーム性能と忘却低減の両面で優れているか?
主な発見
- 提案手法はGLUEベンチマークで最先端の性能を達成し、従来の微調整手法や既存のベースラインを上回った。
- BERT-baseに本手法を適用した結果、BERT-largeを直接微調整した場合よりも優れた性能を示し、顕著な忘却低減効果を確認した。
- ランダム初期化でも強力な性能を発揮したため、リコールメカニズムが事前学習知識を効果的に再取得できていることが示された。
- 提案されたメカニズムを統合したRecAdam最適化手法は、最小限の実装コストで複数のNLPタスクにおいて一貫した性能向上を達成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。