Skip to main content
QUICK REVIEW

[論文レビュー] Adapting by Pruning: A Case Study on BERT

Yang Gao, Nicolò Colombo|arXiv (Cornell University)|May 7, 2021
Artificial Intelligence in Games参考文献 28被引用数 10
ひとこと要約

本稿では、事前学習されたBERTモデルからタスクに不要な接続を削除しつつ、残りの重みをすべて保持する新しいモデル適応パラダイム「pruningによる適応(adapting by pruning)」を提案する。この手法により、微調整済みモデルと同等の性能を達成しつつ、パラメータを最大50%削減可能である。本手法は、プルーニングを微分可能最適化問題として定式化し、プルーニングされた重みの再活性化(connection recovery)が、高スパースリティ下での性能向上に不可欠であることを示している。

ABSTRACT

Adapting pre-trained neural models to downstream tasks has become the standard practice for obtaining high-quality models. In this work, we propose a novel model adaptation paradigm, adapting by pruning, which prunes neural connections in the pre-trained model to optimise the performance on the target task; all remaining connections have their weights intact. We formulate adapting-by-pruning as an optimisation problem with a differentiable loss and propose an efficient algorithm to prune the model. We prove that the algorithm is near-optimal under standard assumptions and apply the algorithm to adapt BERT to some GLUE tasks. Results suggest that our method can prune up to 50% weights in BERT while yielding similar performance compared to the fine-tuned full model. We also compare our method with other state-of-the-art pruning methods and study the topological differences of their obtained sub-networks.

研究の動機と目的

  • リソース制約のあるデバイスにおける微調整済みBERTモデルの高い推論コストを低減するため、重みの再学習を伴わずにモデルサイズを縮小すること。
  • 微調整によるパラメータ拡張を回避するため、BERTのアーキテクチャと事前学習済み重みを再利用するモデル適応パラダイムの開発。
  • 特に高スパースリティ下で、微調整なしに高性能なサブネットワークを達成できるかどうかを調査すること。
  • ロットリートicketやマグニチュードベースのプルーニング手法と比較して、プルーニングされたサブネットワークの構造的性質および感度特性を分析すること。
  • 本手法のフレームワークで優れた性能を実現する要因(特に接続再活性化)を特定すること。

提案手法

  • プルーニングプロセスを、最適なマスクを特定して下流タスクの性能を最大化することを目的とした、バイナリマスク上の微分可能最適化問題として定式化する。
  • 学習可能なパラメータθを用いたマスクの連続的リラクゼーションを採用し、確率的勾配降下法(SGD)による勾配ベース最適化を可能にする。
  • モデル効率性と性能のトレードオフを制御するため、微分可能なスパースリティ正則化を適用する。
  • 標準的なマグニチュードベースやロットリートicketプルーニングとは異なり、後続の学習ステップでプルーニングされた接続を再活性化できる動的プルーニング戦略を導入する。
  • 2段階の訓練プロセスを採用:まずマスクパラメータθを学習し、次に最終的なマスクを適用して事前学習済み重みを保持した上で、タスク固有のレイヤーのみを微調整する。
  • 温度制御されたシグモイド関数を用いてバイナリマスクを近似し、マスク選択プロセスにおけるバックプロパゲーションを可能にする。

実験結果

リサーチクエスチョン

  • RQ1事前学習済みBERTモデルからタスクに不要な接続をプルーニングすることで、フル微調整と同等の性能を達成しつつモデルサイズを縮小できるか?
  • RQ2高スパースリティ下で、本手法の性能が最先端のマグニチュードベースおよびロットリートicketプルーニング手法と比較してどのように差をつけるか?
  • RQ3特にスパースサブネットワークにおいて、プルーニングされた重みを再活性化する「接続再活性化」が、高い性能を達成するために果たす役割は何か?
  • RQ4本手法で得られたプルーニングサブネットワークは、重みの再初期化やマスクシャッフルに対して感受性が高く、選択された接続が構造的に重要であることを示唆しているか?
  • RQ5同じプルーニングサブネットワークを複数のタスクに再利用でき、最小限の再学習でデバイス上での適応が可能になるか?

主な発見

  • 提案手法は、GLUEベンチマークタスクにおいて、フル微調整済みBERTと同等の性能を達成しつつ、モデルのパラメータを最大50%まで削減可能である。
  • スパースリティ0.99(99%プルーニング)の状態でも、SST-2では50.9%の精度、MNLIでは32.8%の精度を維持し、同スパースリティレベルで他のプルーニング手法を上回る性能を示した。
  • 本手法で得られたサブネットワークは、重みの再初期化やマスクシャッフルに対して顕著に感受性を示しており、選択された接続が構造的に重要であり、ランダムに分布しているわけではないことを示している。
  • MNLIの0.99スパースリティサブネットワークにおいて、接続再活性化は全接続の12.3%を占めており、このメカニズムを無効化すると、特に高スパースリティ下で性能が著しく低下する。
  • 本手法とロットリートicketプルーニングの性能差は、スパースリティが高くなるにつれて拡大しており、接続再活性化が高性能プルーニングを実現する鍵要因であることが示唆される。
  • 同じ事前学習済みモデルを複数のタスクに再利用可能であり、タスク固有のバイナリマスクのみをダウンロードすることで、モバイルデバイスにおけるデータ転送量とストレージコストを削減できる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。