Skip to main content
QUICK REVIEW

[論文レビュー] Guaranteed Recovery of One-Hidden-Layer Neural Networks via Cross Entropy

Haoyu Fu, Yuejie Chi|arXiv (Cornell University)|Feb 18, 2018
Stochastic Gradient Optimization Techniques参考文献 39被引用数 5
ひとこと要約

この論文は、ガウス分布入力のもとで、クロスエントロピー損失を用いた勾配降下法による1層隠れ層ニューラルネットワークの訓練におけるグローバル収束を確立する。十分なサンプル数のもとで、真の重みの局所的近傍において、経験的リスク関数が強い凸性および滑らかさを示すことを証明する。勾配降下法は、この近傍に初期化された場合、真の解に近い解へ線形収束する。また、テンソルベースの手法により、この近傍内での初期化が可能となり、反復毎の再サンプリングを必要とせずに、保証された回復が達成される。

ABSTRACT

We study model recovery for data classification, where the training labels are generated from a one-hidden-layer neural network with sigmoid activations, also known as a single-layer feedforward network, and the goal is to recover the weights of the neural network. We consider two network models, the fully-connected network (FCN) and the non-overlapping convolutional neural network (CNN). We prove that with Gaussian inputs, the empirical risk based on cross entropy exhibits strong convexity and smoothness {\em uniformly} in a local neighborhood of the ground truth, as soon as the sample complexity is sufficiently large. This implies that if initialized in this neighborhood, gradient descent converges linearly to a critical point that is provably close to the ground truth. Furthermore, we show such an initialization can be obtained via the tensor method. This establishes the global convergence guarantee for empirical risk minimization using cross entropy via gradient descent for learning one-hidden-layer neural networks, at the near-optimal sample and computational complexity with respect to the network input dimension without unrealistic assumptions such as requiring a fresh set of samples at each iteration.

研究の動機と目的

  • クロスエントロピー損失で訓練される1層隠れ層ニューラルネットワークにおけるモデル回復の理論的保証の欠如に対処すること。
  • ガウス分布入力のもとで、真の重みの周囲における経験的リスク関数の強い凸性および滑らかさを確立すること。
  • 初期化を局所的近傍に置いた場合、勾配降下法が真の重みに近い解へ線形収束することを示すこと。
  • 反復毎の再サンプリングを必要とせず、良好な初期化を達成するためのテンソルベースの手法を開発すること。
  • 分類タスクにおけるモデル回復のための近似的に最適なサンプル数および計算複雑度を達成すること。

提案手法

  • 十分なサンプルサイズのもとで、ガウス入力のもとで、クロスエントロピー損失関数が真の重みの局所的近傍において強い凸性および滑らかさを示すことを証明する。
  • バーゼンの不等式を用いて、全ニューロンに同時に、高階モーメント(例:$\bm{P}_2$, $\bm{R}_3$)の推定誤差を抑え、個々のニューロンごとの解析ではなく、同時に扱う。
  • 3次モーメントを用いて各ニューロンの重みベクトルの方向と大きさを推定するテンソルベースの初期化手法を導入する。
  • 重みベクトルのノルム$\|\bm{w}_i^\star\|$に関する情報を抽出するために、活性化関数の3次モーメントを含む量$Q_1$を定義する。
  • $Q_1$の推定値を用いて、逆関数$m_{3,i}(\cdot)$を用いた最小二乗問題を解くことで、$\|\bm{w}_i^\star\|$を推定する。
  • 推定係数の符号の一貫性を用いて、重みの大きさの符号を回復し、正確な初期化を可能にする。

実験結果

リサーチクエスチョン

  • RQ11層隠れ層ニューラルネットワークのクロスエントロピー損失関数は、真の値の近傍で強い凸性および滑らかさを示すか?
  • RQ2初期化をこの近傍に置いた場合、勾配降下法は真の値に近い解へ線形収束するか?
  • RQ3テンソルベースの手法により、反復毎の再サンプリングを必要とせず、強い凸性領域内での信頼性のある初期化が可能か?
  • RQ4入力次元に関して、保証された回復のためのサンプル複雑度は近似的に最適か?
  • RQ5同じ仮定のもとで、全結合ネットワークおよび非重複畳み込みネットワークへの解析の拡張は可能か?

主な発見

  • 十分に大きなサンプルサイズのもとで、クロスエントロピー損失に基づく経験的リスク関数は、真の値の近傍で強い凸性および滑らかさを示す。
  • 初期化をこの近傍に置いた場合、勾配降下法は真の値から$O(1/\sqrt{K})$の距離にある点へ線形収束する。
  • 必要なサンプル複雑度は$n \geq d \cdot \text{poly}(K, \kappa, t, \log d)$であり、入力次元$d$に関して近似的に最適性を達成する。
  • テンソル手法により、強い凸性領域内での初期化が可能となり、反復毎の再サンプリングを回避できる。
  • ガウス入力のもとで、全結合ネットワークおよび非重複畳み込みネットワークの両方に対して解析が有効である。
  • 同様に、活性化関数が均一である必要はなく、仮定2における緩い条件に依存している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。