Skip to main content
QUICK REVIEW

[論文レビュー] A Unified Framework for Soft Threshold Pruning

Yanqi Chen, Zhengyu Ma|arXiv (Cornell University)|Feb 25, 2023
Sparse and Compressive Sensing Techniques被引用数 6
ひとこと要約

本論文は、ソフトスレッショルドプニングを反復的シャーピング・スレッショルドイング・アルゴリズム(ISTA)に統一的に理論的枠組みで結びつけるもので、L1正則化最適化問題の暗黙的解として定式化する。L1正則化係数を安定化させる最適で時間不変のスレッショルドスケジューラを導出し、ResNet-50、MobileNet-V1、ImageNet 上のSEW ResNet-18 において、最小限のハイパーパrameterチューニングで、あらゆるSGDで訓練されたモデルに広く適用可能な、最先端のプニング性能を達成する。

ABSTRACT

Soft threshold pruning is among the cutting-edge pruning methods with state-of-the-art performance. However, previous methods either perform aimless searching on the threshold scheduler or simply set the threshold trainable, lacking theoretical explanation from a unified perspective. In this work, we reformulate soft threshold pruning as an implicit optimization problem solved using the Iterative Shrinkage-Thresholding Algorithm (ISTA), a classic method from the fields of sparse recovery and compressed sensing. Under this theoretical framework, all threshold tuning strategies proposed in previous studies of soft threshold pruning are concluded as different styles of tuning $L_1$-regularization term. We further derive an optimal threshold scheduler through an in-depth study of threshold scheduling based on our framework. This scheduler keeps $L_1$-regularization coefficient stable, implying a time-invariant objective function from the perspective of optimization. In principle, the derived pruning algorithm could sparsify any mathematical model trained via SGD. We conduct extensive experiments and verify its state-of-the-art performance on both Artificial Neural Networks (ResNet-50 and MobileNet-V1) and Spiking Neural Networks (SEW ResNet-18) on ImageNet datasets. On the basis of this framework, we derive a family of pruning methods, including sparsify-during-training, early pruning, and pruning at initialization. The code is available at https://github.com/Yanqi-Chen/LATS.

研究の動機と目的

  • 既存のソフトスレッショルドプニング手法に理論的根拠が欠如していること、特に恣意的または学習可能なスレッショルドスケジューリングに依存していることに対処すること。
  • ソフトスレッショルドプニングにおける多様なスレッショルドチューニング戦略を、一つの最適化フレームワークに統合すること。
  • L1正則化係数を時間的に安定させる最適なスレッショルドスケジューラを導出し、時間不変の目的関数を保証すること。
  • モデル固有のチューニングを必要とせず、人工的およびスパイキングニューラルネットワークを含む多様なモデルに対して原理的プニングを可能にすること。

提案手法

  • 反復的シャーピング・スレッショルドイング・アルゴリズム(ISTA)を用いて、ソフトスレッショルドプニングをL1正則化最適化問題の暗黙的解として再定式化する。
  • すべての先行スレッショルドスケジューリング戦略が、L1正則化項を異なる方法でチューニングしていることに着目する。
  • L1正則化係数を時間的に一定に保つ最適なスレッショルドスケジューラを導出する。これにより、安定した目的関数が保証される。
  • 訓練中スパース化、早期プニング、初期化時のプニングを含む、プニング手法の族を同一のフレームワークで定式化する。
  • 本フレームワークをResNet-50、MobileNet-V1、SEW ResNet-18 で検証し、すべての設定で一貫した性能向上を示す。
  • コードを公開したLATS(学習可能な適応的スレッショルドスケジューラ)として本手法を実装する。

実験結果

リサーチクエスチョン

  • RQ1ソフトスレッショルドプニングは、ISTA などの確立された最適化アルゴリズムとどのように正式に結びつけられるか?
  • RQ2先行のソフトスレッショルドプニング手法で用いられる異なるスレッショルドスケジューリング戦略の理論的根拠は何か?
  • RQ3既存のソフトスレッショルドプニング技術を説明・改善できる統一的フレームワークを導出できるか?
  • RQ4L1正則化係数を訓練全体にわたり安定させる最適なスレッショルドスケジューラを導出することは可能か?
  • RQ5提案されたフレームワークは、異なるネットワークアーキテクチャおよびスパarsityレベル、さらにはスパイキングニューラルネットワークにも一般化可能か?

主な発見

  • 提案されたフレームワークにより、ソフトスレッショルドプニングがL1正則化最適化問題に対する暗黙のISTAソルバーに等価であることが示され、既存手法に理論的基盤が与えられる。
  • すべての先行スレッショルドスケジューリング戦略が、L1正則化項を異なる方法でチューニングするものであることが示され、一つの最適化的視点からそれらの行動が統一される。
  • 導出された最適なスレッショルドスケジューラは、L1正則化係数を一定に保ち、時間不変の目的関数を実現し、一般化性能の向上をもたらす。
  • ImageNet において、ResNet-50 では99.04%のスパarsityでトップ-1精度88.88%を達成し、最先端の性能を示す。
  • SEW ResNet-18 では、71.18%のスパarsityで60.11%のトップ-1精度、92.57%のスパarsityで53.74%のトップ-1精度を達成し、先行手法を上回る。
  • フレームワークにより、再訓練やハイパーパrameter探索を必要とせず、訓練中スパース化、早期プニング、初期化時のプニングを含むプニング戦略の族が可能になる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。