Skip to main content
QUICK REVIEW

[論文レビュー] Pruning untrained neural networks: Principles and Analysis

Soufiane Hayou, Jean-François Ton|arXiv (Cornell University)|Feb 19, 2020
Machine Learning and Data Classification参考文献 36被引用数 10
ひとこと要約

この論文は、ニューラルネットワークの初期化時におけるプリンティングの理論的分析を提示し、完全なレイヤーのプリンティングを回避するなど、訓練可能で構造的整合性を持つスパース構造を創出する原理的アプローチを提案する。このアプローチは理論的保証を通じて構造的整合性と訓練可能性を確保し、複数のアーキテクチャで一貫した性能向上が確認された。

ABSTRACT

Overparameterized Neural Networks (NN) display state-of-the art performance. However, there is a growing need for smaller, energy-efficient, neural networks to be able to use machine learning applications on devices with limited computational resources. A popular approach consists of using pruning techniques. While these techniques have traditionally focused on pruning pre-trained NN (LeCun et al., 1990; Hassibi et al., 1993), recent work by Lee et al. (2018) has shown promising results when pruning at initialization. However, such procedures remain unsatisfactory as the resulting pruned networks can be difficult to train and, for instance, they do not prevent one layer being fully pruned. In this paper we provide a comprehensive theoretical analysis of pruning at initialization and training of sparse architectures. This allows us to propose novel principled approaches which we validate experimentally on a variety of NN architectures.

研究の動機と目的

  • リソース制約のあるデバイス向けにエネルギー効率的で小型のニューラルネットワークを構築する挑戦に応える。
  • 初期化段階で失敗する既存の非構造的プリンティング手法の限界(例:完全なレイヤーのプリンティング)を克服する。
  • 初期化段階からネットワーク構造と訓練可能性を保つ理論的根拠に基づくプリンティング技術を開発する。
  • 原理的な設計を通じて、多様なアーキテクチャにわたるプリントネットワークのロバスト性と一般化能力を確保する。

提案手法

  • ネットワーク初期化におけるプリンティングの包括的な理論的分析を実施し、構造的および最適化的性質に焦点を当てる。
  • 理論的洞察から導かれた新しいプリンティング基準を導入し、初期化時のスパarsityパターンを指針とする。
  • プリントされたアーキテクチャが十分な接続性と勾配フローを維持するように保証する。
  • フィードフォワードおよび畳み込みネットワークを含む、複数のニューラルネットワークアーキテクチャにおいて、提案手法を実験的に検証する。
  • 理論的分析を用いて、初期化後に完全なレイヤーがプリントされてしまうような極端なケースを回避する。
  • プリントされたネットワークが訓練可能であり、一般化性能に優れる条件を確立する。

実験結果

リサーチクエスチョン

  • RQ1初期化時にスパース接続を持つニューラルネットワークが訓練可能であることを保証する理論的条件は何か?
  • RQ2初期化時のプリンティングをどのように設計すれば、完全なレイヤーのプリントや構造的崩壊を回避できるか?
  • RQ3初期化段階での重み選択を制御する原則は何か? これにより最適化ダイナミクスがどのように維持されるか?
  • RQ4理論的保証が異なるネットワークアーキテクチャにわたって実効的にどのように反映されるか?
  • RQ5初期化時にプリントされたスパースアーキテクチャは、密度の高い事前学習済みモデルと同等の性能を達成できるか?

主な発見

  • 理論的分析により、構造的条件および勾配フロー条件を満たせば、初期化時のプリンティングでも訓練可能性が保たれることを明らかにした。
  • 提案手法により、従来のアプローチでよく見られる完全なレイヤーのプリントが防止された。
  • 提案手法により作成されたスパースアーキテクチャは、さまざまなネットワークアーキテクチャで競争力ある性能を達成した。
  • 理論的洞察により、最適化安定性と一般化能力を維持するプリンティング戦略の設計が可能になった。
  • 実験的検証により、プリントされたネットワークが多様なアーキテクチャにわたって訓練可能で効果的であることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。