[論文レビュー] Knowledge Inheritance for Pre-trained Language Models
本稿では、事前学習済みで小型の言語モデルから知識蒸留を用いて、より大きな言語モデルを効率的に訓練するフレームワーク「知識継承(KI)」を提案する。事前学習段階で知識蒸留を補助的監視として活用することで、KIは訓練の効率性とデータ効率性を顕著に向上させ、収束が速く、性能が優れるようになる。特にリソースが限られた環境やドメイン適応の場面で顕著な効果を示す。
Recent explorations of large-scale pre-trained language models (PLMs) have revealed the power of PLMs with huge amounts of parameters, setting off a wave of training ever-larger PLMs. However, it requires tremendous computational resources to train a large-scale PLM, which may be practically unaffordable. In addition, existing large-scale PLMs are mainly trained from scratch individually, ignoring that many well-trained PLMs are available. To this end, we explore the question how could existing PLMs benefit training large-scale PLMs in future. Specifically, we introduce a pre-training framework named "knowledge inheritance" (KI) and explore how could knowledge distillation serve as auxiliary supervision during pre-training to efficiently learn larger PLMs. Experimental results demonstrate the superiority of KI in training efficiency. We also conduct empirical analyses to explore the effects of teacher PLMs' pre-training settings, including model architecture, pre-training data, etc. Finally, we show that KI could be applied to domain adaptation and knowledge transfer.
研究の動機と目的
- 大規模事前学習言語モデル(PLM)をゼロから訓練する際の高い計算コストとリソース消費を低減すること。
- 既存で良好に訓練済みのPLMが、より大きなPLMの訓練効率を向上させる方法を探る。
- より小さなPLMから得られる知識が、次第に大きなモデルへと繰り返し継承可能かどうかを調査する。
- モデルアーキテクチャ、データ、学習目的といった、教師PLMの事前学習設定が知識継承の効果に与える影響を検討する。
- KIフレームワークをドメイン適応に拡張し、より大きなPLMが、より小さなドメイン特化型教師モデルを用いて、新しいドメインに効率的に適応できるようにする。
提案手法
- より小さな事前学習済み教師PLMから知識蒸留を用いて、より大きな学生PLMの訓練をガイドするフレームワーク「知識継承(KI)」を導入する。
- 学生モデルの自己教師付き事前学習フェーズ中に、教師モデルのソフトラベルを用いて補助的監視を適用する。
- マスクされたトークンにおける学生モデルの出力ロジットを教師モデルの出力と一致させるように、知識蒸留損失を用いることで、事前学習段階での知識伝達を強化する。
- 教師と学生モデル間のアーキテクチャの柔軟な一致を許容し、パラメータリサイクル手法で一般的に見られる厳密なアーキテクチャ制約を回避する。
- 一般事前学習およびドメイン適応の両方の文脈にKIを適用し、複数のドメイン特化型小規模PLMを教師として用いることで、大規模PLMの特定ドメインにおける性能を向上させる。
- モデルアーキテクチャやデータ分布を含む、事前学習設定に基づいて最適な教師を選択する戦略を実装する。
実験結果
リサーチクエスチョン
- RQ1事前に訓練済みの小型PLMから知識を蒸留することで、ゼロから訓練を開始する大規模PLMの訓練効率が向上するか?
- RQ2知識継承を、次第にサイズが増大する複数のPLMに順次適用可能か? すなわち、世代を超えて蓄積的知識伝達が可能か?
- RQ3教師PLMの異なる事前学習設定(モデルアーキテクチャ、事前学習データ、学習目的など)が、知識継承の効果に与える影響は何か?
- RQ4KIにより、大規模で事前に訓練済みのPLMが、より小さなドメイン特化型教師モデルから恩恵を受けることでドメイン適応が向上するか?
- RQ5特にリソースが限られた状況下で、KIと自己学習(self-learning)の訓練効率およびデータ効率を比較すると、どちらが優れているか?
主な発見
- KIは訓練効率を顕著に向上させる:同じ訓練予算でも、KIは自己学習に比べて最終的なパープレキシティ(PPL)が低く、下流タスクの性能も優れている。
- KIはデータ効率性も向上させる:ドメイン特化型データが限られた状況では、KIと自己学習の性能差が広がり、KIがリソースが限られた環境でより効果的であることが示された。
- KIはマルチドメイン知識伝達を可能にする:大規模PLMは複数のドメイン特化型教師から同時に知識を吸収でき、合成CS:BIOデータを用いた実験で、全ドメインで性能が向上した。
- 順次的知識継承は実現可能である:知識は次第に大きなPLMの世代にわたって蓄積され、伝達可能であり、蓄積的学習の可能性を示した。
- KIはドメイン適応において自己学習を上回る:ドメイン特化型データが極めて少ない状況下でも、KIは自己学習よりも優れた性能を発揮し、自己学習はリソースが限られた状況で過学習しやすい傾向にある。
- 教師モデルの選択が重要である:実証的分析により、多様なデータで事前学習され、適切なアーキテクチャを持つ教師モデルが、より優れた知識伝達をもたらすことが示された。これは、KIの成功において教師選択が鍵要因であることを示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。