Skip to main content
QUICK REVIEW

[論文レビュー] Low-Pass Filtering SGD for Recovering Flat Optima in the Deep Learning Optimization Landscape

Devansh Bisla, Jing Wang|arXiv (Cornell University)|Jan 20, 2022
Neural Networks and Applications被引用数 4
ひとこと要約

本稿では、損失関数の局所的変動を平滑化することで、一般化性能が優れる平坦な極小値に勾配降下法を誘導する、低域フィルタリングを用いた最適化手法LPF-SGDを提案する。ガウスカーネルを用いた畳み込みにより損失関数を平滑化し、その勾配を最適化することで、SGD や SAM といった最先端手法に比べて優れた一般化性能を達成する。理論的にも、一般化誤差が小さい解への収束を保証する。

ABSTRACT

In this paper, we study the sharpness of a deep learning (DL) loss landscape around local minima in order to reveal systematic mechanisms underlying the generalization abilities of DL models. Our analysis is performed across varying network and optimizer hyper-parameters, and involves a rich family of different sharpness measures. We compare these measures and show that the low-pass filter-based measure exhibits the highest correlation with the generalization abilities of DL models, has high robustness to both data and label noise, and furthermore can track the double descent behavior for neural networks. We next derive the optimization algorithm, relying on the low-pass filter (LPF), that actively searches the flat regions in the DL optimization landscape using SGD-like procedure. The update of the proposed algorithm, that we call LPF-SGD, is determined by the gradient of the convolution of the filter kernel with the loss function and can be efficiently computed using MC sampling. We empirically show that our algorithm achieves superior generalization performance compared to the common DL training strategies. On the theoretical front, we prove that LPF-SGD converges to a better optimal point with smaller generalization error than SGD.

研究の動機と目的

  • 深層学習の一般化性能と相関する、損失関数の鋭さを最も強く予測できる、最もロバストな測定指標を同定すること。
  • 同定された鋭さ測定指標を活用して、平坦な極小値を能動的に探索する最適化アルゴリズムを開発すること。
  • LPF-SGD が標準的な SGD よりも一般化誤差が小さい解に収束することを示す理論的保証を提供すること。
  • 複数のアーキテクチャやハイパーパramータ設定において、提案手法が既存手法(SAM など)よりも一般化性能に優れていることを実験的に検証すること。

提案手法

  • 本稿では、損失関数をガウスカーネルで畳み込むことで、局所的な変動を平滑化し、広範囲にわたる平坦な領域を強調する低域フィルタ(LPF)に基づく鋭さ測定指標を導入する。
  • LPF-SGD アルゴリズムは、モンテカルロサンプリングを用いて平滑化された損失関数の勾配を計算し、高次元パラメータ空間における効率的な最適化を可能にする。
  • 本手法は、LPF を用いた鋭さによって特定された平坦な極小値が一般化性能に良いと仮定しており、学習をそのような領域に誘導する。
  • 理論的分析により、滑らかさおよびリプシッツ連続性の弱い仮定の下で、LPF-SGD が標準的な SGD よりも一般化誤差が小さい解に収束することを証明している。
  • 本手法は、スキップ接続やバッチ正則化の有無を問わず、さまざまなネットワークアーキテクチャ、幅、最適化ハイパーパramータ(学習率、バッチサイズ、重み減衰、モーメンタム)を用いて評価されている。
  • LPF を用いた鋭さ測定指標は、複数の既存の鋭さ指標と比較され、テスト精度との相関が高く、データおよびラベルノイズに対してロバストであることが実験的に示された。

実験結果

リサーチクエスチョン

  • RQ1多様なアーキテクチャやハイパーパramータ設定において、深層学習モデルの一般化性能を最も正確に予測できる鋭さ測定指標は何か?
  • RQ2損失関数の損失関数の低域フィルタリングを用いて、一般化性能を向上させる実用的な最適化アルゴリズムを設計できるか?
  • RQ3LPF-SGD は、標準的な SGD や SAM といった最先端手法に比べて、より優れた一般化性能を達成するか?
  • RQ4データおよびラベルノイズ下で、LPF を用いた鋭さ測定指標はどのように振る舞い、モデル容量の増加に伴うテスト精度におけるダブルデセント現象を正しく反映するか?
  • RQ5LPF-SGD に対して、収束性および一般化誤差に関する理論的保証をどのように確立できるか?

主な発見

  • LPF を用いた鋭さ測定指標は、評価されたすべてのモデルおよびハイパーパramータ設定において、一般化性能との相関が最も高く、既存の鋭さ指標を上回った。
  • LPF-SGD アルゴリズムは、複数のベンチマークデータセットおよびネットワークアーキテクチャにおいて、標準的な SGD や最先端の SAM 手法に比べ、優れたテスト精度を達成した。
  • LPF を用いた測定指標は、データおよびラベルノイズに対してロバストであり、モデル容量の増加に伴うテスト精度におけるダブルデセント現象を的確に捉えていた。
  • 理論的分析により、LPF-SGD が一般化誤差の境界が SGD よりも速く減少する解に収束することが示された。一般化誤差境界比は $ O(1/T^{ ilde{p}-p}) $ のオーダーで減少する。
  • フィルターカーネルの共分散行列の最小固有値が十分に大きい($ \sigma_- > \alpha/\beta $)場合、フィルター幅を増加させることで、一般化誤差境界比が減少し、一般化性能の向上が確認された。
  • 実験的結果により、LPF-SGD がノイズのある学習条件下でも一貫して平坦な極小値を探索することが確認され、それらが一般化性能に良いと関連していることが裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。