Skip to main content
QUICK REVIEW

[論文レビュー] Make Sharpness-Aware Minimization Stronger: A Sparsified Perturbation Approach

Peng Mi, Li Shen|arXiv (Cornell University)|Oct 11, 2022
Advanced Neural Network Applications被引用数 16
ひとこと要約

本稿では、全パラメータの摂動ではなく、バイナリマスクを介してスパースな摂動を適用する、より効率的なSharpness-Aware Minimization(SAM)の変種、Sparse SAM(SSAM)を提案する。Fisher情報またはダイナミックスパーストレーニングを用いて摂動に適した重要なパラメータを同定することで、SSAMは最大50%のスパarsityと半分の計算コストで、SAMと同等またはそれ以上の一般化性能を達成する。収束速度は $O(\log T/\sqrt{T})$ と同一を維持する。本手法はCIFAR-10、CIFAR-100、ImageNetで検証され、トレーニングのオーバーヘッドを削減しながら最先端の性能を達成した。

ABSTRACT

Deep neural networks often suffer from poor generalization caused by complex and non-convex loss landscapes. One of the popular solutions is Sharpness-Aware Minimization (SAM), which smooths the loss landscape via minimizing the maximized change of training loss when adding a perturbation to the weight. However, we find the indiscriminate perturbation of SAM on all parameters is suboptimal, which also results in excessive computation, i.e., double the overhead of common optimizers like Stochastic Gradient Descent (SGD). In this paper, we propose an efficient and effective training scheme coined as Sparse SAM (SSAM), which achieves sparse perturbation by a binary mask. To obtain the sparse mask, we provide two solutions which are based onFisher information and dynamic sparse training, respectively. In addition, we theoretically prove that SSAM can converge at the same rate as SAM, i.e., $O(\log T/\sqrt{T})$. Sparse SAM not only has the potential for training acceleration but also smooths the loss landscape effectively. Extensive experimental results on CIFAR10, CIFAR100, and ImageNet-1K confirm the superior efficiency of our method to SAM, and the performance is preserved or even better with a perturbation of merely 50% sparsity. Code is availiable at https://github.com/Mi-Peng/Sparse-Sharpness-Aware-Minimization.

研究の動機と目的

  • Sharpness-Aware Minimization(SAM)の高い計算コストを軽減すること、これは全パラメータの摂動によりトレーニング時間が2倍に増加するため。
  • SAMにおける全モデルパラメータへの無差別な摂動が、必要であるか、あるいは非効率であるかを調査すること。
  • 一般化性能を維持しながら計算オーバーヘッドを削減するスパース摂動機構を開発すること。
  • 提案手法の収束速度がSAMと同一であることを理論的に証明し、整合性を保証すること。
  • 多様なモデルとデータセットを用いて手法を検証し、効率性とパフォーマンスの向上を確認すること。

提案手法

  • 学習可能またはデータ駆動のバイナリマスクを用いて、モデルパラメータのサブセットにのみ摂動を適用するSAMの変種、Sparse SAM(SSAM)を提案する。
  • マスク生成戦略を2つ導入:SSAM-FはFisher情報を用いて摂動に影響を与える高いインパクトを持つパラメータを選択する。SSAM-Dはダイナミックスパーストレーニングを用い、パラメータとスパースティマスクを同時に最適化する。
  • 摂動をマスクされたパラメータにのみ適用することで、1ステップあたりの勾配計算数を削減し、標準的なSAMと比較して計算コストを約50%削減する。
  • 2段階の最適化プロセスを採用:まず、マスクされたサブセット上で摂動方向を計算し、次に摂動勾配を用いてモデルを更新する。
  • 理論的分析により、非凸確率的設定下でSSAMはSAMと同一の収束速度 $O(\log T/\sqrt{T})$ を達成することが証明された。
  • 実験では2:4スパースオペレーションを採用したが、ハードウェア加速は将来の依存に依存する。

実験結果

リサーチクエスチョン

  • RQ1SAMにおける全パラメータ摂動は、損失関数の平坦化と一般化性能の向上に不可欠であるか?
  • RQ2全パラメータではなく、一部のパラメータにのみスパース摂動を適用することで、SAMと同等またはそれ以上の一般化性能を達成できるか?
  • RQ3Fisher情報またはダイナミックスパース選択が、ランダムまたは均一選択よりも効果的で効率的であるか?
  • RQ4スパース摂動下でもSAMの収束速度を維持できるか、理論的整合性が保証されるか?
  • RQ5画像分類ベンチマークでモデルの精度を損なわずに達成可能なスパarsityの程度はどの程度か?

主な発見

  • SSAMはCIFAR-10およびCIFAR-100で、摂動マスクに50%のスパarsityを適用しても、SAMと同等またはそれ以上のテスト精度を達成した。
  • ResNet18およびWideResNet28-10では、50%スパarsityのSSAMがCIFAR-100でSAMを上回り、$\rho = 0.1$ の条件下で84.20%のトップ1精度を達成した。
  • SSAM-Fは$N_F = 128$サンプルでCIFAR-10で96.84%の精度を達成し、全SAMと同等の性能を示した。Fisher情報の計算コストは全バッチ推定と比較して90%削減された。
  • アブレーションスタディにより、ランダムまたはシャープな重みに基づくマスキングは性能を低下させることが確認され、Fisherベースおよびダイナミックスパース戦略の有効性が裏付けられた。
  • マスクの更新頻度は性能に顕著な影響を与える:更新間隔を長くすると精度が低下し、最適な収束のためには頻繁なマスク更新が不可欠であることが示された。
  • ダイナミックマスク更新を採用したSSAM-Dは、ResNet50を用いてImageNetで77.25%のトップ1精度を達成し、SAMと同等のパフォーマンスを維持しながら計算負荷を削減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。