Skip to main content
QUICK REVIEW

[論文レビュー] Implicit Convex Regularizers of CNN Architectures: Convex Optimization of Two- and Three-Layer Networks in Polynomial Time

Tolga Ergen, Mert Pilancı|arXiv (Cornell University)|Jun 26, 2020
Stochastic Gradient Optimization Techniques被引用数 4
ひとこと要約

この論文は、ReLU活性化関数を用いた2層および3層の畳み込みニューラルネットワーク(CNN)の訓練における、最初の多項式時間の凸最適化定式化を提案する。半無限双対性を活用して、同等の凸計画問題を導出する。アーキテクチャ上の選択肢—例えばプーリングの種別や重み共有—が、ℓ₁、ℓ₂、およびノルムの形で暗黙の凸正則化項を生じさせることを明らかにし、データサイズ、次元、ニューロン数に関して多項式時間でグローバル最適化を可能にする。

ABSTRACT

We study training of Convolutional Neural Networks (CNNs) with ReLU activations and introduce exact convex optimization formulations with a polynomial complexity with respect to the number of data samples, the number of neurons, and data dimension. More specifically, we develop a convex analytic framework utilizing semi-infinite duality to obtain equivalent convex optimization problems for several two- and three-layer CNN architectures. We first prove that two-layer CNNs can be globally optimized via an $\\ell_2$ norm regularized convex program. We then show that multi-layer circular CNN training problems with a single ReLU layer are equivalent to an $\\ell_1$ regularized convex program that encourages sparsity in the spectral domain. We also extend these results to three-layer CNNs with two ReLU layers. Furthermore, we present extensions of our approach to different pooling methods, which elucidates the implicit architectural bias as convex regularizers.

研究の動機と目的

  • ReLU活性化関数を用いた非凸CNNの訓練における理論的理解の不足に対処すること。
  • 計算的に実行可能である、浅いCNNのグローバル最適な訓練手法を開発すること。
  • プーリングや重み共有といったアーキテクチャ的選択が最適化問題にどのように暗黙の正則化をもたらすかを特定すること。
  • CNNアーキテクチャと信号処理や圧縮センシング分野で知られる古典的な凸正則化項との関係を確立すること。
  • 2層および3層のCNNにReLUユニットを用いた訓練のための多項式時間フレームワークを提供すること。

提案手法

  • 半無限双対性を用いて、ReLU活性化関数を有する2層および3層CNNの同等の凸計画問題を導出する。
  • ReLUおよび畳み込み層の構造を活用することで、非凸な訓練問題を有限次元の凸計画問題に変換する。
  • ラグランジュ双対性および強い双対性を適用し、多項式時間で解ける双対定式を導出する。
  • 変数変換を導入し、双対問題を暗黙の正則化を捉える新しい変数で表現する。
  • アーキテクチャに応じてℓ₁、ℓ₂、またはノルムに相当する正則化項を持つ同等の凸計画問題を導出する。
  • さまざまなプーリング戦略(マックスプーリング、平均プーリング、フラットネーション)を分析し、それらが異なる凸正則化項をもたらすことを示す。

実験結果

リサーチクエスチョン

  • RQ1ReLU活性化関数を用いた2層および3層CNNは、多項式時間でグローバル最適化可能か?
  • RQ2重み共有およびプーリングを伴うReLU CNNのアーキテクチャが、暗黙の正則化としてどのような凸正則化項をもたらすか?
  • RQ3マックスプーリングと平均プーリングなどの異なるプーリング機構は、CNNにおける暗黙の正則化にどのように影響するか?
  • RQ4浅いCNNの訓練を、既知の正則化項を持つ有限次元凸最適化問題に再定式化可能か?
  • RQ5循環畳み込みとReLU活性化関数は、最適化の多様性にどのように寄与するか?

主な発見

  • ReLU活性化関数を有する2層CNNは、ℓ₂ノルム正則化付きの凸計画問題によりグローバル最適化可能である。
  • 1つのReLU層を有する多層循環CNNは、スペクトル領域におけるスパarsityを促進するℓ₁正則化付きの凸計画問題に等価である。
  • 2つのReLU層を有する3層CNNは、暗黙のℓ₁ノルム正則化付きの凸計画問題によりグローバル最適化可能である。
  • マックスプーリングや平均プーリングといったプーリング戦略は、ℓ₁からノルムに至るまでの異なる凸正則化項をもたらす。
  • 提案された凸定式化は、データサンプル数、データ次元、ニューロン数に関して多項式時間で解ける。
  • このフレームワークは、CNNのアーキテクチャ的選択が、既知の凸正則化項を暗黙的に強制することを明らかにし、CNNの訓練を確立された凸最適化および信号処理理論と結びつける。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。