Skip to main content
QUICK REVIEW

[論文レビュー] Provable Benefits of Overparameterization in Model Compression: From Double Descent to Pruning Neural Networks

Xiangyu Chang, Yingcong Li|arXiv (Cornell University)|Dec 16, 2020
Sparse and Compressive Sensing Techniques被引用数 4
ひとこと要約

本稿は、モデル圧縮における過パラメータ化の理論的分析を提供し、最適な特徴量が事前に分かっているとしても、プリューニングの前段階で大きなモデルを訓練することで、初期に小さなモデルを訓練するのよりも一般化性能が向上することを示している。また、プリューニングされたモデルにおいて新たなデュアルデセント曲線を確立し、特徴量が相関している場合にのみ、再訓練が有益であることを証明している。

ABSTRACT

Deep networks are typically trained with many more parameters than the size of the training dataset. Recent empirical evidence indicates that the practice of overparameterization not only benefits training large models, but also assists - perhaps counterintuitively - building lightweight models. Specifically, it suggests that overparameterization benefits model pruning / sparsification. This paper sheds light on these empirical findings by theoretically characterizing the high-dimensional asymptotics of model pruning in the overparameterized regime. The theory presented addresses the following core question: "should one train a small model from the beginning, or first train a large model and then prune?". We analytically identify regimes in which, even if the location of the most informative features is known, we are better off fitting a large model and then pruning rather than simply training with the known informative features. This leads to a new double descent in the training of sparse models: growing the original model, while preserving the target sparsity, improves the test accuracy as one moves beyond the overparameterization threshold. Our analysis further reveals the benefit of retraining by relating it to feature correlations. We find that the above phenomena are already present in linear and random-features models. Our technical approach advances the toolset of high-dimensional analysis and precisely characterizes the asymptotic distribution of over-parameterized least-squares. The intuition gained by analytically studying simpler models is numerically verified on neural networks.

研究の動機と目的

  • プリューニングの前段階で大きなモデルを訓練することで、モデルサイズが増加しても一般化性能が向上する理由を理解すること。
  • 理論的分析を通じて、過パラメータ化が軽量でスパースなモデルの構築に寄与するかどうかという未解決の問いに答えること。
  • 高次元における漸近的状況下での、特に過パラメータ化領域におけるプリューニングモデルの一般化性能を特徴付けること。
  • 特に特徴量の相関がその有効性に与える影響を踏まえて、プリューニング後の再訓練の役割を調査すること。
  • 過パラメータ化された最小二乗法の分布的特徴付け(DC)を構築し、プリューニングの結果を正確に予測できるようにすること。

提案手法

  • 過パラメータ化された最小二乗回帰の解の分布的特徴付け(DC)を導入し、プリューニング後のテスト誤差を正確に予測可能にする。
  • 線形ガウス型同値性を用いて、線形モデルから得られた理論的結果を非線形なランダム特徴モデルへ拡張する。
  • 訓練・プリューニング・再訓練のパイプラインを分析し、プリューニングおよび再訓練後のモデル重みの漸近的分布を導出する。
  • スパarsityと過パラメータ化の関数としてプリューニングモデルのリスクを定式化し、テスト誤差におけるデュアルデセント行動を同定する。
  • 導出された分布的モデルを用いて、特徴量の相関が再訓練のパフォーマンスに与える影響を定量的に評価する。
  • ランダム特徴モデルおよびCIFAR-10のResNet-20を用いた広範な数値シミュレーションを通じて、理論的予測の妥当性を検証する。

実験結果

リサーチクエスチョン

  • RQ1最適なスパース構造が事前に分かっている場合でも、過パラメータ化がプリューニングされたモデルの一般化性能を向上させるか?
  • RQ2モデル幅が過パラメータ化の閾値を超えて増加する際、プリューニングモデルのテスト誤差にデュアルデセント曲線が現れるか?
  • RQ3プリューニング後に再訓練を行うことが有益となる条件は何か?また、特徴量の相関はその有効性にどのように影響するか?
  • RQ4過パラメータ化された最小二乗法の解の分布は、プリューニング性能とどのように関係するか?
  • RQ5線形モデルからの理論的予測は、非線形ニューラルネットワークにおけるプリューニングダイナミクスを正確に記述できるか?

主な発見

  • 最適なサポート(スパース構造)が事前に分かっていても、過パラメータ化されたモデルをプリューニングすることで、同じ最適特徴量を持つ小さなモデルを初期から訓練するよりも低いテスト誤差を達成できる。
  • プリューニングされたモデルのテスト誤差に、新たなデュアルデセント行動が現れる:モデル幅が過パラメータ化の閾値を超えて増加するにつれて、リスクが低下する。
  • 特徴量が相関がない場合、プリューニング後の再訓練には固定された余剰リスク $ \sigma^2 / (n-2) $ が存在し、プリューニングのセットとは無関係に一定である。
  • プリューニングに起因するバイアス項は $ (1 - \zeta)^2 c^{\star 2} $ として定量的に評価され、ここで $ \zeta $ はプリューニング後に保持される信号の割合を表す。
  • 理論的DCは、ランダム特徴モデルおよびCIFAR-10のResNet-20においてプリューニング性能を正確に予測でき、深層ネットワークへの一般化の可能性を裏付けた。
  • 特徴量の相関が再訓練の有効性を決定づける:相関が高い場合には再訓練が不可欠であるが、相関が低い場合には再訓練がパフォーマンスを低下させる可能性がある。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。