Skip to main content
QUICK REVIEW

[論文レビュー] Global Optimality Beyond Two Layers: Training Deep ReLU Networks via Convex Programs

Tolga Ergen, Mert Pilancı|arXiv (Cornell University)|Oct 11, 2021
Sparse and Compressive Sensing Techniques被引用数 5
ひとこと要約

本稿は、複数の3層部分ネットワークを有する深層ReLUネットワークの学習を、グループl1ノルム正則化を用いて、グローバルに解ける凸最適化問題に正確に再定式化する凸最適化フレームワークを導入する。固定幅ネットワークでは多項式時間のグローバル最適性を証明し、凸双対性を通じて隠れたスパarsity誘導型の暗黙的正則化機構を明らかにする。

ABSTRACT

Understanding the fundamental mechanism behind the success of deep neural networks is one of the key challenges in the modern machine learning literature. Despite numerous attempts, a solid theoretical analysis is yet to be developed. In this paper, we develop a novel unified framework to reveal a hidden regularization mechanism through the lens of convex optimization. We first show that the training of multiple three-layer ReLU sub-networks with weight decay regularization can be equivalently cast as a convex optimization problem in a higher dimensional space, where sparsity is enforced via a group $\ell_1$-norm regularization. Consequently, ReLU networks can be interpreted as high dimensional feature selection methods. More importantly, we then prove that the equivalent convex problem can be globally optimized by a standard convex optimization solver with a polynomial-time complexity with respect to the number of samples and data dimension when the width of the network is fixed. Finally, we numerically validate our theoretical results via experiments involving both synthetic and real datasets.

研究の動機と目的

  • 成功した深層ReLUネットワーク学習の背後にある暗黙的正則化機構を理解すること。
  • 非凸な深層ネットワーク学習を凸最適化問題に変換する統一的フレームワークを構築すること。
  • 固定ネットワーク幅の場合に、同等の凸問題が多項式時間でグローバル最適化可能であることを証明すること。
  • 凸形式におけるスパarsityと元の非凸アーキテクチャにおける有効な部分ネットワーク数の間の直接的な対応関係を確立すること。
  • 従来の2層凸再定式化を、任意の凸損失関数および重み減衰正則化を有するより深い、複数部分ネットワーク構造に一般化すること。

提案手法

  • 複数の3層部分ネットワークを有する深層ReLUネットワーク学習問題を、重み減衰正則化を伴う非凸最適化問題として定式化する。
  • 凸双対性を適用して、部分ネットワークパラメータにグループl1ノルム正則化を用いてスパarsityを強制する高次元空間における同等の凸問題を導出する。
  • Fenchel共役双対性を用いて双対問題を導出し、元の問題と凸形式の間の強い双対性および正確な同等性を保証する。
  • 非凸問題と凸問題の同等性を可能にするリスケーリング変換(補題1)を導入する。
  • ネットワーク幅が固定されている場合に、サンプル数および次元数に関して多項式時間で同等の凸問題がグローバル最適化可能であることを証明する。
  • 行列Fノルム正則化とトレースに基づくFenchel共役を用いて、ベクトル出力への拡張を実現する。

実験結果

リサーチクエスチョン

  • RQ1複数の3層ReLU部分ネットワークを有する深層ReLUネットワークの学習は、正確に凸最適化問題に再定式化可能か?
  • RQ2深層ReLUネットワークの成功の背後にある暗黙的正則化機構は何か。そして、それを明示的に特定できるか?
  • RQ3凸再定式化により、元の非凸問題が多項式時間でグローバル最適化可能か?
  • RQ4凸形式におけるスパarsityは、元のアーキテクチャにおける有効な部分ネットワーク数とどのように関係するか?
  • RQ5このフレームワークは、任意の凸損失関数および重み減衰正則化に一般化可能か?

主な発見

  • 重み減衰正則化を伴う複数の3層ReLU部分ネットワークの学習は、グループl1ノルム正則化を用いた高次元空間における凸最適化問題に正確に同等である。
  • ネットワーク幅が固定されている場合に、サンプル数および次元数に関して多項式時間で同等の凸問題がグローバル最適化可能である。
  • 凸形式におけるスパarsityは、元の非凸アーキテクチャにおける有効な部分ネットワーク数の削減と直接的に対応する。
  • 暗黙的正則化機構はグループl1ノルム正則化として明らかになり、高次元空間における特徴選択を促進する。
  • このフレームワークは、従来の2層凸再定式化を、任意の凸損失関数(二乗損失、交差エントロピー損失、ヒンジ損失など)を含むより深いアーキテクチャに一般化する。
  • 合成データおよび実データを用いた数値実験により、理論的同等性および凸最適化アプローチの有効性が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。