Skip to main content
QUICK REVIEW

[論文レビュー] Efficient Transformer-based Large Scale Language Representations using Hardware-friendly Block Structured Pruning

Bingbing Li, Zhenglun Kong|arXiv (Cornell University)|Sep 17, 2020
Topic Modeling参考文献 32被引用数 5
ひとこと要約

この論文では、リソース制約のあるデバイスへの大規模なTransformer言語モデルの効率的デプロイメントを目的として、ハードウェアにやさしいブロック構造のプルーニング手法を提案する。ブロックプルーニングに再重み付けされたグループLasso正則化を統合することで、GLUEベンチマーク上でBERT、RoBERTa、DistilBERTの各モデルにおいて、最大5.0倍のモデル圧縮を達成しつつ、精度の低下を最小限に抑えられる。この手法は、さらなる圧縮を可能にする知識蒸留とは直交的である。

ABSTRACT

Pre-trained large-scale language models have increasingly demonstrated high accuracy on many natural language processing (NLP) tasks. However, the limited weight storage and computational speed on hardware platforms have impeded the popularity of pre-trained models, especially in the era of edge computing. In this work, we propose an efficient transformer-based large-scale language representation using hardware-friendly block structure pruning. We incorporate the reweighted group Lasso into block-structured pruning for optimization. Besides the significantly reduced weight storage and computation, the proposed approach achieves high compression rates. Experimental results on different models (BERT, RoBERTa, and DistilBERT) on the General Language Understanding Evaluation (GLUE) benchmark tasks show that we achieve up to 5.0x with zero or minor accuracy degradation on certain task(s). Our proposed method is also orthogonal to existing compact pre-trained language models such as DistilBERT using knowledge distillation, since a further 1.79x average compression rate can be achieved on top of DistilBERT with zero or minor accuracy degradation. It is suitable to deploy the final compressed model on resource-constrained edge devices.

研究の動機と目的

  • エッジデバイスにおける大規模な事前学習済みTransformerモデルの高い計算コストおよびストレージコストを軽減すること。
  • モデルの精度を維持しつつ、モデルサイズと推論コストを著しく削減できるハードウェアにやさしいプルーニング手法を開発すること。
  • 自然言語処理モデルは、コンピュータビジョンモデルと比較して非一様な構文的・意味的構造を持つため、スパarsityにより感受性が高いため、高い圧縮率を達成できること。
  • 既存のモデル圧縮技術(例:知識蒸留)と互換性を持たせ、順次適用することでさらなるサイズ削減を可能にすること。

提案手法

  • 重み行列に対してブロック構造のプルーニングを適用し、複数の重みブロックを同時に削除することで、ハードウェア効率を維持する。
  • 各ブロックごとにペナルティ項を動的に調整できる再重み付けされたグループLasso正則化を導入し、柔軟で効果的なスパarsity誘導を実現する。
  • 通常の学習損失とブロック単位のL2ノルムペナルティを組み合わせた混合損失関数を用い、微調整段階でプルーニングを誘導する。
  • 繰り返しの重み付け再計算によりプルーニングプロセスを最適化し、精度の低下を最小限に抑えつつ高い圧縮率を達成する。
  • BERT、RoBERTa、DistilBERTにこの手法を適用し、ブロック数、微調整エポック数、ペナルティ係数のアブレーションスタディを実施する。
  • 複数の自然言語処理タスクにおける精度と圧縮効率を測定するため、GLUEベンチマークを用いて手法を検証する。

実験結果

リサーチクエスチョン

  • RQ1再重み付けされたグループLassoを用いたブロック構造のプルーニングは、大規模なTransformerモデルにおいて顕著な精度低下を伴わずに高い圧縮率を達成できるか?
  • RQ2プルーニング構造におけるブロック数が、モデル性能およびスパarsityの柔軟性に与える影響は何か?
  • RQ3圧縮率と精度のバランスを最適化するための最適なペナルティ係数と微調整エポック数は何か?
  • RQ4提案手法は知識蒸留と互換性があり、さらなるモデル圧縮を可能にするか?
  • RQ5この手法は、BERT、RoBERTa、DistilBERTといった多様な事前学習モデルに効果的に適用可能か?

主な発見

  • 提案手法は、GLUEタスク全体でBERTおよびRoBERTaに対して最大5.0倍のモデル圧縮を達成し、精度の低下はゼロまたは最小限に抑えられた。
  • DistilBERTでは平均1.79倍の圧縮率を達成し、精度の損失は最小限に抑えられ、知識蒸留とは直交的であることが示された。
  • ブロック数を増やす(ブロックサイズを小さくする)ことで性能が向上し、DistilBERTでは768ブロックでCoLAタスクで最高のMCCスコア53.4を達成した。
  • 16エポックの微調整により、4または8エポックよりも精度が向上し、BERT BASEではSTS-Bのスピアマン相関係数が84.2から84.6に上昇した。
  • ペナルティ係数3e-4が最適な精度をもたらし、BERT BASEではMNLIタスクで82.9%の精度を達成した。一方、高い値(1e-3)では顕著な精度低下が見られた。
  • 異なるランダムシードに対して結果が安定しており、SST-2、CoLA、STS-B、MRPCの各タスクで5回のシードランで性能のばらつきが最小限に抑えられていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。