Skip to main content
QUICK REVIEW

[論文レビュー] Exploring Weight Importance and Hessian Bias in Model Pruning

Mingchen Li, Yahya Sattar|arXiv (Cornell University)|Jun 19, 2020
Adversarial Robustness in Machine Learning参考文献 60被引用数 5
ひとこと要約

本論文は、ヘッセ行列に基づく、大きさに基づく、および自然な重要性という3つの重要性基準を比較することで、モデルのプルーニングに関する原理的な分析を提示する。その結果、ヘッセ行列の構造がプルーニング性能に顕著な暗黙のバイアスを引き起こすことが明らかになった。また、ヘッセ行列に基づくプルーニングが特徴共分散のスケーリングに対してロバストであるのに対し、重みの大きさとヘッセ行列の重要性が乖離する場合、特に不適切な初期化のもとでは、大きさに基づくプルーニングが崩壊的に失敗することを示す正確な漸近式を導出している。

ABSTRACT

Model pruning is an essential procedure for building compact and computationally-efficient machine learning models. A key feature of a good pruning algorithm is that it accurately quantifies the relative importance of the model weights. While model pruning has a rich history, we still don't have a full grasp of the pruning mechanics even for relatively simple problems involving linear models or shallow neural nets. In this work, we provide a principled exploration of pruning by building on a natural notion of importance. For linear models, we show that this notion of importance is captured by covariance scaling which connects to the well-known Hessian-based pruning. We then derive asymptotic formulas that allow us to precisely compare the performance of different pruning methods. For neural networks, we demonstrate that the importance can be at odds with larger magnitudes and proper initialization is critical for magnitude-based pruning. Specifically, we identify settings in which weights become more important despite becoming smaller, which in turn leads to a catastrophic failure of magnitude-based pruning. Our results also elucidate that implicit regularization in the form of Hessian structure has a catalytic role in identifying the important weights, which dictate the pruning performance.

研究の動機と目的

  • 過パラメータ化モデルにおけるプルーニングの根本的メカニズム、特にヘッセ行列構造と重みの重要性の役割を理解すること。
  • ヘッセ行列に基づく、大きさに基づく、自然な重要性という3つのプルーニング基準のロバスト性とパフォーマンスを比較すること。
  • ヘッセ行列構造が引き起こす暗黙のバイアスが、プルーニングの結果にどのように影響するかを定量化すること、特に線形モデルおよび2層ReLUネットワークにおいて。
  • 重みの大きさが大きくても、なぜ大きさに基づくプルーニングが失敗するのかを特定し、適切な初期化の役割を説明すること。
  • 共分散のスケーリングを制御した状況下で、プルーニング手法の正確な漸近的パフォーマンス式を導出することにより、精密な比較を可能にすること。

提案手法

  • ラベルを維持しつつ特徴共分散行列(ヘッセ行列)の対角スケーリングを施すことで、等価な線形問題のクラスを構築し、ヘッセ行列バイアスの制御された分析を可能にする。
  • 高次元極限におけるプルーニングパフォーマンスの正確な漸近式を導出し、ヘッセ行列および自然な重要性はスケーリング不変性を示すが、大きさに基づく重要性は脆さを示すことを明らかにする。
  • 2層ReLUネットワークに対しては、簡略化された初期化モデルを用いて、ヘッセ行列構造が学習ダイナミクスと重みの寄与度にどのように影響するかを分析する。
  • 「より大きなヘッセ行列がより多く獲得する」という定理を導入し、トレーニング中に重みグループの相対的寄与度をヘッセ行列バイアスによって定量化する。
  • 高次元確率の道具、特に集中不等式および極限定理を用いて、大規模なサンプルおよびネットワークサイズの下での最適化とプルーニングの挙動を分析する。
  • 一般化誤差およびプルーニングによる精度損失の解析的表現を、次元が大きい極限において導出し、プルーニングパフォーマンスを比較する。

実験結果

リサーチクエスチョン

  • RQ1特徴共分散のスケーリング(ヘッセ行列構造)は、線形モデルにおける大きさに基づくプルーニングとヘッセ行列に基づくプルーニングのパフォーマンスにどのように影響するか?
  • RQ2なぜ過パラメータ化された設定において、重みの大きさが大きくても、大きさに基づくプルーニングが失敗するのか?
  • RQ3ヘッセ行列構造が、プルーニングパフォーマンスを向上または悪化させるような暗黙のバイアスをどれほど引き起こすのか?
  • RQ4適切な初期化は、深層ネットワークにおける重みの大きさとヘッセ行列に基づく重要性の整合性にどのように影響するか?
  • RQ5高次元設定において、異なるプルーニング基準のパフォーマンスを比較するための正確な漸近式を導出できるか?

主な発見

  • ヘッセ行列に基づく重要性および自然な重要性は、特徴共分散行列(ヘッセ行列)の対角スケーリングに対して不変であるが、大きさに基づく重要性はそのスケーリングに対して極めて感受性が高く、過決定設定では脆くなる。
  • 過パラメータ化された設定ではヘッセ行列構造が重要になる:ヘッセ行列からの暗黙のバイアスは、ヘッセ行列に基づくプルーニングのパフォーマンスを向上させる一方で、大きさに基づくプルーニングのパフォーマンスを低下させる。
  • 本論文は、プルーニング手法間のパフォーマンス差を正確に捉える正確な漸近式を導出し、主成分の共分散方向が重要な重みとずれている場合に負のバイアスが生じることを明らかにした。
  • 2層ReLUネットワークでは、ヘッセ行列構造が学習ダイナミクスを支配し、ヘッセ行列値が大きい重みは、その大きさが小さくても学習への寄与度が高くなる。
  • 「より大きなヘッセ行列がより多く獲得する」という定理を確立し、ヘッセ行列に基づく重要性が、特に過パラメータ化された設定において、トレーニング中の寄与度を決定づける支配的要因であることを示した。
  • 重みの大きさとヘッセ行列の重要性が逆方向に進む場合、これは適切なトレーニング後でも発生しうるが、最適化における暗黙のバイアスのため、大きさに基づくプルーニングは崩壊的に失敗する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。