Skip to main content
QUICK REVIEW

[論文レビュー] MKD: a Multi-Task Knowledge Distillation Approach for Pretrained Language Models

Linqing Liu, Huan Wang|arXiv (Cornell University)|Nov 9, 2019
Topic Modeling参考文献 45被引用数 19
ひとこと要約

本稿では、複数の自然言語処理(NLP)タスクにわたるマルチタスク BERT ティーチャーから、軽量な学生モデルを一括して知識蒸留するマルチタスク知識蒸留フレームワーク MKD を提案する。多様なタスクからの共有表現を活用することで、MKD は高速な推論を実現しつつ、最先端の性能を達成する。外部コーパスを用いないで、推論速度において BERT-PKD や TinyBERT を上回り、精度では同等またはそれを上回る。

ABSTRACT

Pretrained language models have led to significant performance gains in many NLP tasks. However, the intensive computing resources to train such models remain an issue. Knowledge distillation alleviates this problem by learning a light-weight student model. So far the distillation approaches are all task-specific. In this paper, we explore knowledge distillation under the multi-task learning setting. The student is jointly distilled across different tasks. It acquires more general representation capacity through multi-tasking distillation and can be further fine-tuned to improve the model in the target domain. Unlike other BERT distillation methods which specifically designed for Transformer-based architectures, we provide a general learning framework. Our approach is model agnostic and can be easily applied on different future teacher model architectures. We evaluate our approach on a Transformer-based and LSTM based student model. Compared to a strong, similarly LSTM-based approach, we achieve better quality under the same computational constraints. Compared to the present state of the art, we reach comparable results with much faster inference speed.

研究の動機と目的

  • 大規模な事前学習済み言語モデルの高い計算コストと推論遅延を低減すること。
  • タスク特化型の知識蒸留の限界を克服すること、すなわち、各新しいタスクに対して再訓練を必要とすること。
  • 多様な学生アーキテクチャに適用可能な汎用的でモデルに依存しない蒸留フレームワークを開発すること。
  • 蒸留中にマルチタスク学習を活用することで、学生モデルの性能と推論速度を向上させること。
  • 蒸留中に大規模な外部テキストコーパスへの依存を軽減し、データの可用性とプライバシー準拠性を高めること。

提案手法

  • 複数の NLP タスクにわたるマルチタスク BERT ティーチャーから、学生モデルを一括して蒸留することで、共有表現学習を可能にする。
  • 蒸留プロセスは複数のタスクの知識を同時に活用し、学生モデルの一般化性能と頑健性を向上させる。
  • フレームワークはモデルに依存せず、Transformer をベースとする学生モデルおよびLSTM をベースとする学生モデルの両方へ適用可能である。
  • 外部学習データを必要とせず、ダウンストリームタスクのデータのみに依存するため、タスク間の知識伝達が可能である。
  • LSTM をベースとする学生モデルにバイアテンション機構を組み込み、シーケンスモデリング能力を強化する。
  • 語彙サイズの削減とレアワードの処理向上を目的に、WordPiece トークン化を採用する。

実験結果

リサーチクエスチョン

  • RQ1マルチタスク蒸留は、多様な NLP タスクにわたる蒸留された学生モデルの性能と一般化能力を向上させることができるか?
  • RQ2複数のタスクから同時に蒸留することで、タスク特化型蒸留と比較して推論が高速化され、効率性が向上するか?
  • RQ3大規模な外部テキストコーパスへの依存を回避しつつ、競争力のある性能を維持できる蒸留フレームワークは構築可能か?
  • RQ4アテンション機構の導入は、軽量なLSTMベースの学生モデルの性能にどのような影響を与えるか?
  • RQ5異なるトークン化戦略が、蒸留の有効性に与える影響は何か?

主な発見

  • MKD-LSTM は、Distilled BiLSTM よりも高速な推論(2.93s)を達成しながらも、より高い精度を維持しており、優れた効率性と性能を示している。
  • BERT-PKD や TinyBERT と比較して、外部学習データを一切使用せず、同等またはより優れた性能を達成している。
  • 全タスクで学習したマルチタスク蒸留 LSTM モデルは、単一タスク蒸留と比較して RTE タスクで 1.4 ポints 高い性能を示しており、タスク間知識共有の利点が明確に裏付けられている。
  • LSTM 学生モデルに組み込まれたバイアテンション機構は、単純な BiLSTM と比較して顕著な性能向上をもたらし、6 つのデータセットで 2.2–6.1 ポイントの向上が確認された。
  • WordPiece トークン化は語彙サイズを削減し、レアワードの処理を改善することで、単語レベルのトークン化よりも優れた全体的な性能をもたらした。
  • MKD は、4 つのタスクにわたる 7 つのデータセットで最先端の結果を達成し、精度と推論速度の両面で、既存の蒸留手法を上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。