Skip to main content
QUICK REVIEW

[論文レビュー] Lifelong Language Knowledge Distillation

Yung-Sung Chuang, Shang‐Yu Su|arXiv (Cornell University)|Oct 5, 2020
Topic Modeling参考文献 22被引用数 5
ひとこと要約

本稿では、生涯的言語学習(LLL)を向上させるために、各新しいタスクの学習中に、タスク固有の教師モデルが主なLLLモデルに知識を蒸留する手法である「生涯的言語知識蒸留(L2KD)」を提案する。各タスクごとに一時的な教師モデルを用いた知識蒸留により、深刻な忘却を軽減し、序列生成およびテキスト分類タスクの両方で、マルチタスク学習のベースラインと2%-3%以内の性能を達成する。メモリの追加コストは最小限に抑えられる。

ABSTRACT

It is challenging to perform lifelong language learning (LLL) on a stream of different tasks without any performance degradation comparing to the multi-task counterparts. To address this issue, we present Lifelong Language Knowledge Distillation (L2KD), a simple but efficient method that can be easily applied to existing LLL architectures in order to mitigate the degradation. Specifically, when the LLL model is trained on a new task, we assign a teacher model to first learn the new task, and pass the knowledge to the LLL model via knowledge distillation. Therefore, the LLL model can better adapt to the new task while keeping the previously learned knowledge. Experiments show that the proposed L2KD consistently improves previous state-of-the-art models, and the degradation comparing to multi-task models in LLL tasks is well mitigated for both sequence generation and text classification tasks.

研究の動機と目的

  • 順次に多様なNLPタスクを学習する際の、生涯的言語学習(LLL)における深刻な忘却問題に対処すること。
  • マルチタスク学習との性能差を縮小することで、LAMOLなどの既存のLLL手法を改善すること。
  • 過去のモデルを保存する必要がなく、モデル容量を増加させない、記憶効率の高い手法を開発すること。
  • 新規のタスクごとに、タスク固有の教師モデルを用いたLLLにおける知識蒸留を検討すること。
  • 異なる蒸留戦略(単語レベルおよびシーケンスレベル)が、タスク間での知識保持にどのように寄与するかを評価すること。

提案手法

  • 各タスクの受信時に、新規に訓練されたタスク固有の教師モデルを、知識のソースとして用意する。
  • 主なLLLモデル(学生)は、訓練中に教師の予測を模倣することで、知識蒸留を実行する。
  • 知識蒸留には、単語レベル(ソフトラベル間の交差エントロピー損失)およびシーケンスレベル(パープレクサティベースの目的関数)の両方の目的関数を適用する。
  • 蒸留後、教師モデルは破棄され、永続的保存や追加のモデル容量を必要としない。
  • 本手法は、NLPタスクを質問応答と言語モデリング形式に統一するLAMOLフレームワークに統合されている。
  • 一般化および記憶の向上を図るため、QAおよび言語モデリングの両訓練フェーズに蒸留を適用する。

実験結果

リサーチクエスチョン

  • RQ1新規のタスク固有の教師モデルからの知識蒸留は、生涯的言語学習における深刻な忘却を軽減できるか?
  • RQ2L2KDは、マルチタスク学習および既存のLLL手法と比較して、性能と忘却軽減の観点で優れているか?
  • RQ3単語レベルとシーケンスレベルのどちらの蒸留戦略が、LLLにおける最良の性能と一般化をもたらすか?
  • RQ4LLLモデルは教師の行動を完全に再現しているのか、それとも未学習の例への転送性を保持しているのか?
  • RQ5L2KDは、メモリやモデル容量の増加なしに、効率的に適用可能か?

主な発見

  • L2KDは、評価されたすべての設定で一貫して性能を向上させ、マルチタスク学習との差を最大で2%-3%まで縮小した。
  • 序列生成タスクでは、L2KDに単語レベルの蒸留を適用した場合、Yelpデータセットで99.2%の精度を達成し、ベースラインのLAMOLモデルを上回った。
  • テキスト分類タスクでは、L2KDに単語レベルの蒸留を適用した場合、精度をLAMOLの75.48%から77.11%まで向上させ、教師が正しく予測した例(グループA)で顕著な向上を示した。
  • 教師の行動を完全に再現していないことが示された。誤って予測された教師の例(グループB)では、性能が安定またはわずかに向上しており、知識統合の堅牢性が裏付けられた。
  • シーケンスレベルの蒸留(Seq-KD)は、単語レベルの蒸留と同等の結果を示し、ソフトラベルを用いたシーケンス蒸留では、TCベンチマークで76.8%の精度を達成した。
  • 教師モデルの追加トレーニング時間は最小限であり、追加のメモリも不要であるため、実世界の展開において実用的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。