Skip to main content
QUICK REVIEW

[論文レビュー] Generation-Distillation for Efficient Natural Language Understanding in Low-Data Settings

Luke Melas-Kyriazi, George Han|arXiv (Cornell University)|Jan 25, 2020
Topic Modeling参考文献 18被引用数 7
ひとこと要約

本稿では、大規模言語モデル(GPT-2)を用いて合成学習例を生成し、微調整されたBERTモデルが小規模な学生ネットワークに知識を蒸留する、生成蒸留(generation-distillation)という手法を提案する。この手法は、AG News、DBPedia、Yahoo AnswersでBERTの98%の精度を達成し、パラメータ数を300倍も削減した。また、従来の蒸留手法よりも3倍少ないパラメータで優れた性能を発揮する。

ABSTRACT

Over the past year, the emergence of transfer learning with large-scale language models (LM) has led to dramatic performance improvements across a broad range of natural language understanding tasks. However, the size and memory footprint of these large LMs makes them difficult to deploy in many scenarios (e.g. on mobile phones). Recent research points to knowledge distillation as a potential solution, showing that when training data for a given task is abundant, it is possible to distill a large (teacher) LM into a small task-specific (student) network with minimal loss of performance. However, when such data is scarce, there remains a significant performance gap between large pretrained LMs and smaller task-specific models, even when training via distillation. In this paper, we bridge this gap with a novel training approach, called generation-distillation, that leverages large finetuned LMs in two ways: (1) to generate new (unlabeled) training examples, and (2) to distill their knowledge into a small network using these examples. Across three low-resource text classification datsets, we achieve comparable performance to BERT while using 300x fewer parameters, and we outperform prior approaches to distillation for text classification while using 3x fewer parameters.

研究の動機と目的

  • 低データ環境下における小規模なタスク固有モデルと大規模事前学習言語モデルの性能格差を埋める。
  • モバイル端末などのリソース制約のあるデバイスへの大規模言語モデル(例:BERT)の導入を容易にする。
  • 生成的手法による訓練データの拡張を通じて、低データ環境下での知識蒸留の性能を向上させる。
  • データ生成と蒸留を組み合わせることで、標準的な蒸留やゼロから学習する手法よりも優れた性能を達成できることを示すこと。

提案手法

  • 小規模なラベル付きデータセット上で微調整された大規模言語モデル(GPT-2)を用い、元のデータのスタイルに合わせた合成されたラベルなし学習例を生成する。
  • 生成された例を用いて、微調整されたBERTモデルから知識蒸留により小規模な学生モデル(CNN)を訓練する。
  • 蒸留では、KLダイバージェンス損失を介してBERTのソフトラベル確率を用いることで、より豊かな監視信号を保持する。
  • 学生モデルは、元のラベル付きデータと生成された合成データの組み合わせを用いて訓練され、蒸留プロセスが一般化性能を向上させる。
  • 一般化性能を評価するため、KimスタイルのCNNとResNetスタイルのCNNの2種類の学生アーキテクチャを評価する。
  • 本手法は、3つの低リソーステキスト分類ベンチマーク(AG News、DBPedia、Yahoo Answers)で評価される。

実験結果

リサーチクエスチョン

  • RQ1大規模言語モデルからのデータ生成が、低データテキスト分類における小規模タスク固有モデルの性能向上に寄与するか?
  • RQ2合成データ生成と組み合わせた微調整済みBERTモデルからの知識蒸留が、より優れた結果をもたらすか?
  • RQ3低データ環境下において、生成蒸留の性能が標準的な蒸留やゼロから学習する手法と比べてどのように異なるか?
  • RQ4提案手法が、大幅に少ないパラメータ数でBERTと同等の性能を達成できるか?
  • RQ5学生モデルのアーキテクチャの選択が、生成蒸留パイプラインの有効性に影響を及ぼすか?

主な発見

  • AG Newsでは、1,124パラメータのわずかな学生モデルで89.9%の精度を達成し、BERT-Largeと同等の性能を発揮するが、パラメータ数は300倍も削減されている。
  • DBPediaでは、同じ1,124パラメータの学生モデルで96.3%の精度に達し、従来の蒸留手法を1.7ポイント上回っている。
  • Yahoo Answersでは、1,091パラメータのモデルで65.0%の精度を達成し、前回の最先端手法を1.6ポイント上回りながらも、パラメータ数は3倍も削減されている。
  • 生成例の数を増やすことで性能が向上し、500個の合成例(クラスあたり50個)でのみ60%の精度に達し、データ量が増えるにつれてさらに向上する。
  • Yahoo Answersでは、BERTのソフトラベルを用いた蒸留が、生成例をハードラベルでラベル付けする手法よりも1.3ポイント優れており、ソフトラベル監視の利点が裏付けられている。
  • 本手法はアーキテクチャに依存せず汎用的であり、KimスタイルおよびResNetスタイルの両方の学生モデルが、標準的な蒸留手法よりも一貫して性能向上を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。