Skip to main content
QUICK REVIEW

[論文レビュー] A Short Study on Compressing Decoder-Based Language Models

Tianda Li, Yassir El Mesbahi|arXiv (Cornell University)|Oct 16, 2021
Topic Modeling参考文献 30被引用数 4
ひとこと要約

本論文は、層の切り詰めとデータクリーニングを用いて、初めから微調整なしで学習するGPT-2モデルの圧縮手法を提案する。訓練時間は著しく短縮されているが、下流タスクにおいてDistilGPT-2を上回る性能を達成している。本手法では擬似一様な切り詰め戦略を導入し、データクリーニングが効率性と性能の両方を向上させることを示している。

ABSTRACT

Pre-trained Language Models (PLMs) have been successful for a wide range of natural language processing (NLP) tasks. The state-of-the-art of PLMs, however, are extremely large to be used on edge devices. As a result, the topic of model compression has attracted increasing attention in the NLP community. Most of the existing works focus on compressing encoder-based models (tiny-BERT, distilBERT, distilRoBERTa, etc), however, to the best of our knowledge, the compression of decoder-based models (such as GPT-2) has not been investigated much. Our paper aims to fill this gap. Specifically, we explore two directions: 1) we employ current state-of-the-art knowledge distillation techniques to improve fine-tuning of DistilGPT-2. 2) we pre-train a compressed GPT-2 model using layer truncation and compare it against the distillation-based method (DistilGPT2). The training time of our compressed model is significantly less than DistilGPT-2, but it can achieve better performance when fine-tuned on downstream tasks. We also demonstrate the impact of data cleaning on model performance.

研究の動機と目的

  • BERTのようなエンコーダベースのモデルとは異なり、GPT-2のようなデコーダベースのモデルの圧縮に関する研究が不足しているという問題に取り組む。
  • 最先端の知識蒸留と教師なし手法を用いて、DistilGPT-2の微調整性能を向上させること。
  • より大きな教師モデルからより小さなGPT-2モデルを初期化するための層切り詰め手法を検討し、より速い事前学習を実現することを目的とする。
  • データクリーニングが事前学習の効率性と下流タスクの性能に与える影響を評価すること。
  • 知識蒸留を用いず、初めから学習した圧縮GPT-2モデルが、下流タスクにおいてDistilGPT-2を上回ることを示すこと。

提案手法

  • 12層のGPT-2-xl教師モデルから、擬似一様な層切り詰めを用いて6層のGPT-2学生モデルを事前学習する。
  • OpenWebTextデータセットに対して、HTMLの除去、短い文の削除、アルファベット・数字以外のノイズの除去、重複データの削除を施し、データセットサイズを65.5%まで削減する。
  • 教師モデルのパラメータを層ごとに均等に分配する擬似一様初期化戦略を採用する。
  • 微調整のための知識蒸留手法として、Annealing-KD、MATE-KD、RAIL-KDをベンチマークする。
  • ゼロショットと微調整済みのパープレキシティおよび正答率スコアを用いて、Wikitext103およびSuperGLUEベンチマークで性能を評価する。
  • 知識蒸留を用いても用いなくても事前学習したモデルの訓練時間と性能を比較する。

実験結果

リサーチクエスチョン

  • RQ1知識蒸留手法は、下流NLPタスクにおけるDistilGPT-2の微調整性能を向上させることができるか?
  • RQ2層切り詰めを用いて初めから学習した圧縮GPT-2モデルは、下流タスクの性能と訓練効率の面で、DistilGPT-2を上回ることができるか?
  • RQ3OpenWebTextデータセットのデータクリーニングは、事前学習時間と最終的なモデル性能にどのような影響を与えるか?
  • RQ4どの層切り詰め戦略が、より大きな教師モデルからより小さなGPT-2モデルを初期化する際に最も優れた性能を発揮するか?
  • RQ5知識蒸留を用いず、初めから学習した蒸留GPT-2モデルは、DistilGPT-2を上回る性能を達成できるか?

主な発見

  • 擬似一様な切り詰めとクリーニング済みデータを用いて事前学習したモデルは、微調整後、Wikitext103でテストパープレキシティ22.42を達成し、ゼロショットではDistilGPT-2の21.13を上回ったが、訓練時間は著しく短縮された。
  • クリーニング済みOpenWebTextデータセットを用いて事前学習したモデルは、訓練時間を42時間(DistilGPT-2の768時間と比較)に短縮し、7つの下流タスクのうち5つで同等またはより優れた性能を達成した。
  • 擬似一様な切り詰め戦略は他の初期化手法を上回り、Wikitext103で45.93のゼロショットパープレキシティを達成し、DistilGPT-2の45.26に近く、優れた性能を示した。
  • データクリーニングにより、OpenWebTextデータセットのサイズは3億3200万件から1億1400万件に削減され、事前学習時間は94%短縮されたが、モデル性能は維持または向上した。
  • クリーニング済みデータセットの10%を用いて事前学習したモデルは、微調整後のパープレキシティ22.42を達成し、教師モデルのパラメータ数の約1/3であるにもかかわらず、DistilGPT-2の21.13と同等の性能を示した。
  • SuperGLUEベンチマークでは、クリーニング済みデータで事前学習したモデルが7つのタスクのうち5つで最先端の性能を達成し、BoolQでは77.64%の正答率、WSCでは73.74%の正答率を記録し、多くの場合でDistilGPT-2を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。