Skip to main content
QUICK REVIEW

[論文レビュー] $\mathcal{G}$-SGD: Optimizing ReLU Neural Networks in its Positively Scale-Invariant Space

Qi Meng, Shuxin Zheng|arXiv (Cornell University)|Feb 11, 2018
Stochastic Gradient Optimization Techniques参考文献 34被引用数 4
ひとこと要約

本稿では、ReLUニューラルネットワークを、正のスケール不変性を持つ空間と呼ばれるG-spaceと呼ばれる空間で訓練する新しい最適化アルゴリズムG-SGDを提案する。G-spaceは、正の重みスケーリングに対して不変な値をとる基本パスから構成される。逆連鎖則と重み配分を用いた効率的な勾配計算によりG-spaceで最適化することで、正則化を施した場合、CIFAR-10とCIFAR-100の両方で標準的なSGDよりも顕著に優れた一般化性能を達成し、それぞれ94.67%および75.20%のテスト精度を達成する。

ABSTRACT

It is well known that neural networks with rectified linear units (ReLU) activation functions are positively scale-invariant. Conventional algorithms like stochastic gradient descent optimize the neural networks in the vector space of weights, which is, however, not positively scale-invariant. This mismatch may lead to problems during the optimization process. Then, a natural question is: \emph{can we construct a new vector space that is positively scale-invariant and sufficient to represent ReLU neural networks so as to better facilitate the optimization process }? In this paper, we provide our positive answer to this question. First, we conduct a formal study on the positive scaling operators which forms a transformation group, denoted as $\mathcal{G}$. We show that the value of a path (i.e. the product of the weights along the path) in the neural network is invariant to positive scaling and prove that the value vector of all the paths is sufficient to represent the neural networks under mild conditions. Second, we show that one can identify some basis paths out of all the paths and prove that the linear span of their value vectors (denoted as $\mathcal{G}$-space) is an invariant space with lower dimension under the positive scaling group. Finally, we design stochastic gradient descent algorithm in $\mathcal{G}$-space (abbreviated as $\mathcal{G}$-SGD) to optimize the value vector of the basis paths of neural networks with little extra cost by leveraging back-propagation. Our experiments show that $\mathcal{G}$-SGD significantly outperforms the conventional SGD algorithm in optimizing ReLU networks on benchmark datasets.

研究の動機と目的

  • ReLUネットワークの正のスケール不変性と、標準的な重み空間における非不変な最適化の不一致を解消すること。
  • ReLUニューラルネットワークを完全に表現できる正のスケール不変性を持つベクトル空間(G-space)を形式的に定義すること。
  • G-spaceで最適化する際に計算コストをほとんど増加させない効率的な確率的勾配降下法(G-SGD)を設計すること。
  • G-spaceでの最適化が一般化性能を向上させることを実験的に検証すること、特に高い正のスケール不変性が成立する状況での有効性を示すこと。

提案手法

  • ReLUネットワークの出力を保つ正のスケーリング作用素の群Gを定義する。
  • パス値(パスに沿った重みの積)がGに対して不変であることを証明し、弱い条件下ですべてのパス値がReLUネットワークを完全に表現できることを示す。
  • 線形独立なパスの最小集合(基本パス)を同定し、それらの値ベクトルが次元が低い不変なG-spaceを張ることを示す。
  • 逆連鎖則と重み配分を用いた勾配計算手法を構築し、基本パス値に関する勾配を効率的に逆伝播可能にする。
  • 標準的なバックプロパゲーションを最小限に修正することで、全重みベクトルの代わりに基本パス値ベクトルを最適化するG-SGDを実装する。
  • 正則化をG-spaceに統合する(例:基本パスノルム)ことで、さらなる一般化性能の向上を図る。

実験結果

リサーチクエスチョン

  • RQ1ReLUニューラルネットワークを完全に表現できる正のスケール不変性を持つ空間を構築できるか?
  • RQ2この不変空間(G-space)で最適化することで、重み空間における標準的なSGDと比較して、より優れた最適化ダイナミクスと一般化性能が得られるか?
  • RQ3G-spaceの次元は元の重み空間と比べてどの程度で、最適化効率にどのような影響を与えるか?
  • RQ4正のスケール不変性の程度が、G-SGDとSGDの性能差に与える影響は何か?
  • RQ5G-spaceにおける正則化は、重み空間における重みノルム正則化と比較して、一般化性能をさらに向上させられるか?

主な発見

  • CIFAR-10ではG-SGDが94.67%のテスト精度を達成し、重み減衰を施したSGD(91.25%)を上回り、報告済みSOTAより3.42ポイント高い性能を示した。
  • CIFAR-100では、基本パス正則化を施したG-SGDが75.20%のテスト精度を達成し、重み減衰を施したSGD(74.39%)を0.81ポイント上回った。
  • G-SGDの性能向上は、正のスケール不変性が高くなるほど顕著に増大し、ネットワーク構造がより不変である状況ではG-spaceでの最適化がより効果的であることが確認された。
  • G-spaceにおける勾配計算は逆連鎖則と重み配分により効率的に実現可能であり、G-SGDは最小限の計算コスト増加で性能向上を達成した。
  • G-spaceの次元は、重み空間よりH小さいことが示された。ここでHは隠れユニットの総数を表し、有効自由度の顕著な削減を示している。
  • G-spaceにおける正則化(例:基本パスノルム)は、重み空間における重み減衰よりも効果的であり、不変かつ次元が低い空間で最適化することの利点を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。