Skip to main content
QUICK REVIEW

[論文レビュー] Sanity-Checking Pruning Methods: Random Tickets can Win the Jackpot

Jingtong Su, Yihang Chen|arXiv (Cornell University)|Sep 22, 2020
Software Testing and Debugging Techniques参考文献 46被引用数 13
ひとこと要約

この論文は、ニューラルネットワークのスプライシングにおける根幹的な仮定に挑戦し、データ依存の「イニシャル・チケット」とは対照的に、ランダムなサブネットワーク(「ランダムチケット」)が非構造的スプライシングにおいても性能を同等または上回ることを示している。訓練データを破壊するセービティーチェックと、スプライシングされた重みをレイヤー単位で再配置することで、著者らは、データ依存性やアーキテクチャの構造が高性能を達成するために本質的でないことを示した。これにより、新しいゼロショット手法「ランダムチケット」と、さらに精度を向上させるハイブリッド手法が開発された。

ABSTRACT

Network pruning is a method for reducing test-time computational resource requirements with minimal performance degradation. Conventional wisdom of pruning algorithms suggests that: (1) Pruning methods exploit information from training data to find good subnetworks; (2) The architecture of the pruned network is crucial for good performance. In this paper, we conduct sanity checks for the above beliefs on several recent unstructured pruning methods and surprisingly find that: (1) A set of methods which aims to find good subnetworks of the randomly-initialized network (which we call "initial tickets"), hardly exploits any information from the training data; (2) For the pruned networks obtained by these methods, randomly changing the preserved weights in each layer, while keeping the total number of preserved weights unchanged per layer, does not affect the final performance. These findings inspire us to choose a series of simple \emph{data-independent} prune ratios for each layer, and randomly prune each layer accordingly to get a subnetwork (which we call "random tickets"). Experimental results show that our zero-shot random tickets outperform or attain a similar performance compared to existing "initial tickets". In addition, we identify one existing pruning method that passes our sanity checks. We hybridize the ratios in our random ticket with this method and propose a new method called "hybrid tickets", which achieves further improvement. (Our code is publicly available at https://github.com/JingtongSu/sanity-checking-pruning)

研究の動機と目的

  • スプライシング手法が効果的なサブネットワークを発見するために訓練データを利用しなければならないという広く共有された信念に挑戦すること。
  • スプライシングされたネットワークのアーキテクチャ的構造が性能に真に不可欠であるかどうかを検証すること。
  • 訓練データに依存しないゼロショットスプライシング手法を開発し、競争力あるまたは優れた性能を達成すること。
  • 厳密なセービティーチェックに合格するスプライシング手法を同定し、それをハイブリッド化することでさらなる性能向上を達成すること。

提案手法

  • 2つのセービティーチェックを提案:スプライシング段階でのデータ破壊と、スパarsityを維持しながらアーキテクチャの構造を破壊するレイヤー単位の重み再配置。
  • ICLR 2019–2020の4つの最近の非構造的スプライシング手法を対象とし、それらを「イニシャルチケット」と「部分的に訓練されたチケット」に分類する。
  • 各レイヤーごとに固定された、データに依存しないスプライシング比を適用し、訓練データを一切使用せずに重みをランダムに選択することで「ランダムチケット」を設計する。
  • セービティーチェックに合格する既存の手法(学習率リウィンド)を同定し、そのレイヤー単位のスプライシング比とランダムチケットの初期化を組み合わせて「ハイブリッドチケット」を構築する。
  • CIFAR-10およびCIFAR-100での性能を評価するために、標準的な再訓練を用いて得られたサブネットワークを訓練する。
  • レイヤー単位の再配置を敵対的テストとして用い、性能がアーキテクチャの変更に対して不変であることを確認することで、手法の堅牢性を検証する。

実験結果

リサーチクエスチョン

  • RQ1スプライシング手法は、効果的なサブネットワークを発見するために、訓練データの情報を真に必要としているのか?
  • RQ2スプライシングされたネットワークの特定のアーキテクチャが、高い性能を達成するために不可欠なのか?
  • RQ3訓練データに依存しないゼロショットスプライシング手法は、データ依存の「イニシャルチケット」手法を上回るか、同等の性能を達成できるのか?
  • RQ4データを通過するスプライシング手法とランダムスプライシング比を組み合わせたハイブリッド手法は、さらなる性能向上をもたらすのか?

主な発見

  • 『イニシャルチケット』に分類されるスプライシング手法は、訓練データをスプライシング段階で破壊しても性能に変化がなく、訓練データを意味的に活用していないことが示された。
  • 保持された重みをレイヤー単位で再配置することで元のアーキテクチャを破壊しても性能に劣化が生じないため、アーキテクチャの構造が本質的でないことが示された。
  • 各レイヤーごとに固定された、データに依存しないスプライシング比を用いて生成されたランダムチケットは、CIFAR-10およびCIFAR-100においてイニシャルチケットと同等または優れた性能を達成した。
  • 学習率リウィンドのスプライシング比とランダムチケットの初期化を組み合わせたハイブリッドチケット手法は、特に高スパarsityレベルでさらなる精度向上を達成した。
  • VGG19を用いたCIFAR-10(98%スパarsity)では、ハイブリッドチケットが93.52%の精度を達成し、学習率リウィンド(10.00%)とOBD(93.49%)を上回った。これは顕著な向上を示している。
  • 画像分類データセットImageNetに対しても一般化が確認されており、並行して発表された研究でも裏付けられていることから、この結果は小規模データセットに限定されないことが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。