Skip to main content
QUICK REVIEW

[論文レビュー] Learning Two Layer Rectified Neural Networks in Polynomial Time

Ainesh Bakshi, Rajesh Jayaram|arXiv (Cornell University)|Nov 5, 2018
Machine Learning and Algorithms参考文献 53被引用数 12
ひとこと要約

本稿では、ガウス分布に従う入力の下で、2層ReLUニューラルネットワークにおける重み行列の正確な回復のための最初の多項式時間アルゴリズムを提示する。ノイズなしの場合に正確な回復を達成し、平均ゼロのサブガウスノイズが存在するノイズありの場合には近似回復を達成する。低ランク行列回復とReLU活性化関数の組み合わせ的性質を活用する。

ABSTRACT

Consider the following fundamental learning problem: given input examples $x \in \mathbb{R}^d$ and their vector-valued labels, as defined by an underlying generative neural network, recover the weight matrices of this network. We consider two-layer networks, mapping $\mathbb{R}^d$ to $\mathbb{R}^m$, with $k$ non-linear activation units $f(\cdot)$, where $f(x) = \max \{x , 0\}$ is the ReLU. Such a network is specified by two weight matrices, $\mathbf{U}^* \in \mathbb{R}^{m imes k}, \mathbf{V}^* \in \mathbb{R}^{k imes d}$, such that the label of an example $x \in \mathbb{R}^{d}$ is given by $\mathbf{U}^* f(\mathbf{V}^* x)$, where $f(\cdot)$ is applied coordinate-wise. Given $n$ samples as a matrix $\mathbf{X} \in \mathbb{R}^{d imes n}$ and the (possibly noisy) labels $\mathbf{U}^* f(\mathbf{V}^* \mathbf{X}) + \mathbf{E}$ of the network on these samples, where $\mathbf{E}$ is a noise matrix, our goal is to recover the weight matrices $\mathbf{U}^*$ and $\mathbf{V}^*$. In this work, we develop algorithms and hardness results under varying assumptions on the input and noise. Although the problem is NP-hard even for $k=2$, by assuming Gaussian marginals over the input $\mathbf{X}$ we are able to develop polynomial time algorithms for the approximate recovery of $\mathbf{U}^*$ and $\mathbf{V}^*$. Perhaps surprisingly, in the noiseless case our algorithms recover $\mathbf{U}^*,\mathbf{V}^*$ exactly, i.e., with no error. To the best of the our knowledge, this is the first algorithm to accomplish exact recovery. For the noisy case, we give the first polynomial time algorithm that approximately recovers the weights in the presence of mean-zero noise $\mathbf{E}$. Our algorithms generalize to a larger class of rectified activation functions, $f(x) = 0$ when $x\leq 0$, and $f(x) > 0$ otherwise.

研究の動機と目的

  • 2層ReLUニューラルネットワークの重み行列を入力-ラベルペアから学習するという根本的問題に取り組む。
  • ラベルがノイズで汚されている状況において、近似および正確な重み行列回復のための多項式時間アルゴリズムを開発する。
  • ReLUを越えるより広範な整流活性化関数のクラスへの回復保証を拡張する。
  • 重み行列U*がフル列ランクでない場合に、固定パrameter化可能(fixed-parameter tractable)なアルゴリズムを提供する。
  • 多項式時間内に正確な回復が可能となる理論的条件を確立する。

提案手法

  • ノイズのある観測値Aから隠れ層の表現U*f(V*X)を回復するために、核ノルム最小化による低ランク行列回復を活用する。
  • ゴルフィングスキームと双対証明の構築を用いて、低ランク回復の凸緩和の一意性と正しさを証明する。
  • ReLU活性化関数の組み合わせ的および幾何的性質を応用し、ノイズなしの場合の正確な回復を可能にする。
  • V*とU*に非一貫性(incoherence)および条件数の制約を課すことにより、多項式的サンプル複雑度の下で安定な回復を保証する。
  • Eがs-スパース(s ≤ γnm)であるスパarsityに基づくノイズモデルを採用し、一般のノイズ下での回復を可能にする。
  • 核ノルムとl1ノルム正則化を用いた凸最適化問題に問題を還元し、多項式時間で解けるようにする。

実験結果

リサーチクエスチョン

  • RQ1ガウス分布に従う入力の下で、2層ReLUネットワークの重み行列を多項式時間で回復できるか?
  • RQ2ラベルがノイズなしで、入力がi.i.d.ガウス分布に従う場合、U*とV*の正確な回復は可能か?
  • RQ3ラベルが平均ゼロのサブガウスノイズで汚されている場合、多項式時間での近似回復を達成できるか?
  • RQ4U*とV*にどのような構造的仮定が必要か、多項式時間での回復を保証するためか?
  • RQ5この回復フレームワークは、ReLUを越えるより一般的な整流活性化関数へ拡張可能か?

主な発見

  • 本稿は、ガウス入力の下でノイズなしの場合にU*とV*の正確な回復を達成する最初の多項式時間アルゴリズムを提示する。
  • 平均ゼロのサブガウスノイズが存在するノイズありの場合、アルゴリズムは多項式時間で近似回復を達成し、回復誤差がノイズレベルで有界である。
  • U*の列が正規直交であり、μ-非一貫性(μ-incoherent)であり、かつk ≤ m / (O((κ(V*))²√(k log n)μ + μ + (κ(V*))⁴ log n) log² n) である場合、正確な回復が可能である。
  • サンプル複雑度nはd, m, k, およびV*の条件数に関して多項式的であり、実用的設定においても実行可能である。
  • 核ノルムとl1ノルム最小化を用いた凸緩和により、因子分解形U*f(V*X)を正確に回復する。
  • U*がフル列ランクでない場合の固定パrameter化可能(fixed-parameter tractable)なアルゴリズムを提供し、kをパrameterとしている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。