Skip to main content
QUICK REVIEW

[論文レビュー] Learning ReLU Networks via Alternating Minimization

Gauri Jagatap, Chinmay Hegde|arXiv (Cornell University)|Jun 20, 2018
Neural Networks and Applications参考文献 20被引用数 7
ひとこと要約

この論文は、ReLUニューラルネットワークの訓練のための交互最小化アルゴリズムを提案する。このアルゴリズムは、ReLU活性化パターンの推定と、重みを更新するための最小二乗問題の解法を交互に繰り返す。本研究は、1隠れ層のReLUネットワークおよびスキップ接続を有するResNet型アーキテクチャの訓練に対して、初めて線形収束保証を提供する。訓練に必要なサンプル数はO(dk² poly(log d))で、学習率などのハイパーパrameterのチューニングは、訓練エポック数以外は不要である。

ABSTRACT

We propose and analyze a new family of algorithms for training neural networks with ReLU activations. Our algorithms are based on the technique of alternating minimization: estimating the activation patterns of each ReLU for all given samples, interleaved with weight updates via a least-squares step. The main focus of our paper are 1-hidden layer networks with $k$ hidden neurons and ReLU activation. We show that under standard distributional assumptions on the $d-$dimensional input data, our algorithm provably recovers the true `ground truth' parameters in a linearly convergent fashion. This holds as long as the weights are sufficiently well initialized; furthermore, our method requires only $n=\widetilde{O}(dk^2)$ samples. We also analyze the special case of 1-hidden layer networks with skipped connections, commonly used in ResNet-type architectures, and propose a novel initialization strategy for the same. For ReLU based ResNet type networks, we provide the first linear convergence guarantee with an end-to-end algorithm. We also extend this framework to deeper networks and empirically demonstrate its convergence to a global minimum.

研究の動機と目的

  • 勾配降下法で一般的に見られるハイパーパrameterチューニングを回避する、ReLUネットワークの訓練のための新しいアルゴリズムフレームワークの開発。
  • 標準的な分布的仮定の下で、1隠れ層ReLUネットワークの訓練に対して、保証付き収束性を提供すること。
  • スキップ接続を有する残差ネットワーク(ResNets)へのフレームワークの拡張と、新たな初期化戦略の提案。
  • より深いネットワークにおける実験的妥当性の検証を行い、グローバル最小値への収束を示すこと。

提案手法

  • アルゴリズムは、すべてのサンプルに対してReLU活性化パターン(符号)を固定し、その後重みを更新するための最小二乗問題を解くのを交互に繰り返す。
  • 各サンプルについて、現在の重み推定に基づいて、各ReLUニューロンの活性状態(オン/オフ)を推定する。
  • 重み更新ステップでは、現在の活性化パターンを用いて線形方程式系を解き、ネットワークを区分線形モデルとして扱う。
  • この手法は、各活性化パターン領域内でReLUネットワークを線形モデルとして扱う「線形化のテクニック」を用いる。
  • ResNet型ネットワークの場合、同型初期化(identity initialization)を用いる。これにより、テンソル分解に基づく複雑な初期化を必要とせず収束が可能になる。
  • 層ごとに交互最小化を適用することで、より深いネットワークへの拡張が可能であり、実験的にゼロの訓練損失への収束が確認された。

実験結果

リサーチクエスチョン

  • RQ1交互最小化が、標準的な仮定の下で、1隠れ層ReLUネットワークの訓練に対して、保証付きの線形収束を達成できるか?
  • RQ2本手法は、特に複雑なアーキテクチャにおいて、標準的な勾配降下法を上回る成功確率を示せるか?
  • RQ3アイデンティティ初期化のような単純な初期化戦略が、ReLU活性化を有するResNet型アーキテクチャの収束を保証できるか?
  • RQ4真のネットワークパラメータを回復するためのサンプル複雑度はどの程度必要か?
  • RQ5交互最小化フレームワークは、実験的に成功する形で、より深いReLUネットワークへ拡張可能か?

主な発見

  • 標準的仮定の下で、パラメータ推定誤差をεにまで低下させるために、O(log 1/ε)の訓練エポックで線形収束を達成する。
  • 1隠れ層ネットワークでは、n = eO(dk²)のサンプルが必要であり、実際にはO(dk² poly(log d))である。
  • 本手法は、エンドツーエンドのアルゴリズムとして、ReLU活性化を有するResNet型ネットワークの訓練に対して、初めて線形収束保証を提供する。
  • 本手法はパラメータフリーであり、学習率やその他のハイパーパrameterは、訓練エポック数以外は一切不要である。
  • 実験的結果から、特にネットワークの複雑度が高くなると、標準的な勾配降下法に比べて成功確率が向上することが示された。
  • 十分なサンプル数があれば、より深いReLUネットワークにおいても、ゼロの訓練損失への収束が確認されたが、深さ≥2に対する厳密な保証は未解決の課題のままである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。