Skip to main content
QUICK REVIEW

[論文レビュー] NxMTransformer: Semi-Structured Sparsification for Natural Language Understanding via ADMM

Connor Holmes, Minjia Zhang|arXiv (Cornell University)|Oct 28, 2021
Non-Destructive Testing Techniques参考文献 29被引用数 6
ひとこと要約

NxMTransformerは、大規模な事前学習済みTransformerモデルにおけるNxM半構造的スパarsityをADMMに基づくフレームワークで導入する新規手法であり、自然言語理解タスクにおいて現在の最良手法よりもGLUEスコアを1.7ポイント向上させつつ、ハードウェア効率を維持している。本手法は制約付き最適化を用いて、モデルのファインチューニングとスパarsity制約を同時に最適化することで、現代のスパース推論ハードウェア上で実装可能な高精度なモデルを実現している。

ABSTRACT

Natural Language Processing (NLP) has recently achieved success by using huge pre-trained Transformer networks. However, these models often contain hundreds of millions or even billions of parameters, bringing challenges to online deployment due to latency constraints. Recently, hardware manufacturers have introduced dedicated hardware for NxM sparsity to provide the flexibility of unstructured pruning with the runtime efficiency of structured approaches. NxM sparsity permits arbitrarily selecting M parameters to retain from a contiguous group of N in the dense representation. However, due to the extremely high complexity of pre-trained models, the standard sparse fine-tuning techniques often fail to generalize well on downstream tasks, which have limited data resources. To address such an issue in a principled manner, we introduce a new learning framework, called NxMTransformer, to induce NxM semi-structured sparsity on pretrained language models for natural language understanding to obtain better performance. In particular, we propose to formulate the NxM sparsity as a constrained optimization problem and use Alternating Direction Method of Multipliers (ADMM) to optimize the downstream tasks while taking the underlying hardware constraints into consideration. ADMM decomposes the NxM sparsification problem into two sub-problems that can be solved sequentially, generating sparsified Transformer networks that achieve high accuracy while being able to effectively execute on newly released hardware. We apply our approach to a wide range of NLP tasks, and our proposed method is able to achieve 1.7 points higher accuracy in GLUE score than current practices. Moreover, we perform detailed analysis on our approach and shed light on how ADMM affects fine-tuning accuracy for downstream tasks. Finally, we illustrate how NxMTransformer achieves performance improvement with knowledge distillation.

研究の動機と目的

  • モデルサイズに起因する高い遅延のため、大規模な事前学習済みNLPモデルの展開を困難にする課題に対処すること。
  • ハードウェア制約を尊重しつつ、モデル精度を保持する半構造的スパarsity(NxM)をTransformerに効果的に適用できること。
  • 再訓練にかかるコストを回避し、下流タスクへの転移性を維持する、原理的かつハードウェアに配慮したスパース化手法の開発。
  • 圧縮モデルにおけるNxMスパarsityと知識蒸留を組み合わせた際の相互適合性と性能向上の可能性を調査すること。
  • 密度のある事前学習済み表現を維持しつつ、新興のNxMスパースハードウェア上で効率的な推論を可能にするフレームワークを提供すること。

提案手法

  • ハードウェアに配慮したスパarsityパターンをファインチューニングの目的関数に統合することで、NxMスパarsityの誘導を制約付き最適化問題として定式化する。
  • 問題を2つの逐次的サブ問題(重み更新とスパarsity制約の強制)に分解するために、交替方向乗数法(ADMM)を用いる。
  • 双対上昇と拡張ラグランジュを用いて、下流NLPタスクでのファインチューニング中に反復的にNxM制約を強制する。
  • 本手法をBERTおよびDistilBERTモデルに適用し、元の事前学習済み重みの再訓練を必要とせずにスパarsityを適用する。
  • 知識蒸留と統合し、学生モデルにNxMスパarsityを適用することで、パラメータ数を削減しつつも高い精度を維持する。
  • 元の事前学習済み重みを保持することで、既存の密度モデルとの互換性を維持し、ファインチューニング中にのみスパarsityを適用する。

実験結果

リサーチクエスチョン

  • RQ1ADMMに基づく最適化は、下流性能を損なうことなく、大規模な事前学習済みTransformerにNxM半構造的スパarsityを効果的に誘導できるか?
  • RQ2標準的なファインチューニングおよび既存のスパース化手法と比較して、ADMMによるNxMスパarsityは精度とハードウェア効率の面でどのように異なるか?
  • RQ3NxMスパarsityを知識蒸留と組み合わせることで、さらにモデルを圧縮しつつも高い精度を維持できるか、その程度はどの程度か?
  • RQ4ADMMに基づくスパース化手法は、リソースが限られた下流NLPタスクにおけるモデルの一般化能力を保持できるか?
  • RQ5スパarsityの影響は、すでに圧縮済みのモデル(例:DistilBERT)においても顕在化するか?また、本手法は、圧縮済みモデルでさえも構造的冗長性を明らかにするか?

主な発見

  • NxMTransformerは、標準的なNLPベンチマークにおいて、現在の最良手法よりも平均GLUEスコアを1.7ポイント向上させた。
  • 本手法は、元のBERT baseモデルの98.4%の精度を維持しながらNxMスパarsityを適用しており、優れた性能保持を示している。
  • DistilBERTに適用した場合、本手法はパラメータ数を32%削減(66.6Mから45.3Mに)したにもかかわらず、蒸留モデルの97.6%の精度を維持した。
  • 平均GLUEスコアにおいて、標準的なDistilBERTよりも2ポイント高い性能を示しており、層内スパarsityによる優れた冗長性の捉え方を示している。
  • 本手法は、事前学習済み重みの再訓練を必要とせず、高精度かつハードウェア最適化されたモデルを実現しており、転移性を維持している。
  • 結果から、知識蒸留を経た後でさえも、高圧縮モデルに「勝利のチケット(winning tickets)」が存在する可能性が示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。