Skip to main content
QUICK REVIEW

[論文レビュー] Understanding symmetries in deep networks

Vijay Badrinarayanan, Bamdev Mishra|arXiv (Cornell University)|Nov 3, 2015
Generative Adversarial Networks and Image Synthesis参考文献 21被引用数 21
ひとこと要約

この論文では、深層ネットワークにおける複雑な対称性を解消するために、畳み込みフィルタ重みを単位ノルム多様体に制約することを提案する。多様体制約付きSGDにより単位ノルム制約を強制することで、MNISTおよびSegNetにおいて計算効率を損なわずにテスト精度が向上し、標準的なバッチ正則化や単位正規化初期化を用いた基本的なSGDを上回る。

ABSTRACT

Recent works have highlighted scale invariance or symmetry present in the weight space of a typical deep network and the adverse effect it has on the Euclidean gradient based stochastic gradient descent optimization. In this work, we show that a commonly used deep network, which uses convolution, batch normalization, reLU, max-pooling, and sub-sampling pipeline, possess more complex forms of symmetry arising from scaling-based reparameterization of the network weights. We propose to tackle the issue of the weight space symmetry by constraining the filters to lie on the unit-norm manifold. Consequently, training the network boils down to using stochastic gradient descent updates on the unit-norm manifold. Our empirical evidence based on the MNIST dataset shows that the proposed updates improve the test performance beyond what is achieved with batch normalization and without sacrificing the computational efficiency of the weight updates.

研究の動機と目的

  • 標準的なSGD最適化を妨げる現代の深層ネットワークにおける重み空間の複雑な対称性を特定・分析すること。
  • バッチ正則化ネットワークにおけるスケール不変性および再パラメータ化対称性が引き起こす最適化軌道の不安定性とばらつきを解消すること。
  • ネットワークアーキテクチャを変更せずに、計算効率が高く、対称性に不変な最適化手法を提案し、一般化性能を向上させること。
  • 単位ノルム重み制約が、標準的なバッチ正則化や単位正規化初期化を用いた基本的SGDよりも優れたテスト性能をもたらすことを示すこと。

提案手法

  • 著者らは、畳み込み、バッチ正則化、ReLU、マックスプーリング、ソフトマックスを含む2層のCNNアーキテクチャ(ArchBN)を分析し、フィルタの対角スケーリング下での連続的対称性を同定する。
  • バッチ正則化の単位分散性のおかげで、損失関数が再パラメータ化 W̃₁ = αW₁ および W̃₂ = βW₂ に対して不変であることを示す。ここで α および β は対角行列である。
  • これを解決するために、すべてのフィルタ重みを単位ノルム多様体に制約する手法を提案し、SGDをリーマン多様体上の最適化に変換する。
  • 提案された更新則(表1)は、各更新後に単位ノルム多様体への射影を伴う確率的勾配降下法であり、対称性不変性を保証する。
  • MATLABを用い、Manoptを用いて実装し、MNISTおよびSegNetに適用する。重み減衰などの追加ハイパーパrameterは一切使用しない。
  • 訓練プロトコルでは、学習率の段階的減少、早期停止、検証ベースの学習率選択を用い、評価の信頼性を確保する。

実験結果

リサーチクエスチョン

  • RQ1バッチ正則化、ReLU、マックスプーリングを用いた標準的な深層ネットワークに、どのような重み空間の対称性が存在するか?
  • RQ2これらの対称性は、標準的なユークリッド空間におけるSGDの収束性と性能にどのように影響を与えるか?
  • RQ3フィルタ重みを単位ノルム多様体に制約することで、一般化性能が向上し、計算効率を損なわずに改善できるか?
  • RQ4提案された対称性不変最適化は、標準的なバッチ正則化および単位正規化初期化を用いた基本的SGDと比較してどのように異なるか?

主な発見

  • MNISTデータセットでは、4層ネットワークに対して提案された単位ノルム(UN)更新法が平均テスト誤差 0.0179 ± 0.0025 を達成し、バランス型SGD(B-SGD)の 0.0204 ± 0.0027 を上回った。
  • UN法はB-SGDと比較してテスト誤差の分散を低減し、複数回の実行におけるより安定した学習を示した。
  • 4層ネットワークでは、UN更新法が平均および分散の両面で最小のテスト誤差を達成し、より深いアーキテクチャにおいて優位性を示した。
  • 追加のハイパーパrameterを導入せずに、効果的に正則化として機能した。
  • セマンティックセグメンテーションのSegNetにおける定性的な結果は、提案された更新法が大規模なネットワークに対してもスケーラブルであることを示し、成功した学習が可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。