Skip to main content
QUICK REVIEW

[論文レビュー] On the Convergence Rate of Training Recurrent Neural Networks

Zeyuan Allen-Zhu, Yuanzhi Li|arXiv (Cornell University)|Oct 29, 2018
Advanced Neural Network Applications参考文献 66被引用数 47
ひとこと要約

本論文は、勾配降下法と確率的勾配降下法が過パラメータ化の下で Elman RNNs with ReLU をほぼゼロの訓練誤差まで訓練できることを証明し、多層ネットワークの新しい解析ツールを提供する。

ABSTRACT

How can local-search methods such as stochastic gradient descent (SGD) avoid bad local minima in training multi-layer neural networks? Why can they fit random labels even given non-convex and non-smooth architectures? Most existing theory only covers networks with one hidden layer, so can we go deeper? In this paper, we focus on recurrent neural networks (RNNs) which are multi-layer networks widely used in natural language processing. They are harder to analyze than feedforward neural networks, because the $ extit{same}$ recurrent unit is repeatedly applied across the entire time horizon of length $L$, which is analogous to feedforward networks of depth $L$. We show when the number of neurons is sufficiently large, meaning polynomial in the training data size and in $L$, then SGD is capable of minimizing the regression loss in the linear convergence rate. This gives theoretical evidence of how RNNs can memorize data. More importantly, in this paper we build general toolkits to analyze multi-layer networks with ReLU activations. For instance, we prove why ReLU activations can prevent exponential gradient explosion or vanishing, and build a perturbation theory to analyze first-order approximation of multi-layer networks.

研究の動機と目的

  • ReLU が RNN での訓練を安定化させ、勾配が消失/爆発するのを回避する理由を理解する。
  • RNN が非縮退データ上でほぼゼロの訓練誤差になるよう、勾配法を用いて効率的に訓練できることを示す。
  • ReLU 活性化を用いた多層ネットワークを分析する一般的な道具箱を開発する。
  • 穏当な仮定の下で深い RNN や関連損失関数への拡張を示す。
  • 過パラメータ化が多層アーキテクチャで SGD が悪い局所解を回避するのにどう寄与するかを明らかにする。

提案手法

  • 古典的な Elman RNN を ReLU 活性化で分析し、A,B はランダムに初期化された状態で隠れ層の重み W を訓練する。
  • GD/SGD が初期化をランダムなガウス分布として開始し、T = poly(n,d,L,δ^{-1}, log(1/ε)) 回の反復で f(W) ≤ ε を達成することを証明する。
  • 第一オーダー挙動を特徴づける Polyak-Łojasiewicz 型の勾配下界(定理3)と半滑性性質(定理4)を導入する。
  • 過パラメータ化と誘導されたランダム性を活用して、L 層にわたる勾配の成長を制御し、指数的な爆発を回避する前向き/後向き伝播解析を開発する。
  • 深層 RNN への拡張および他のリプシッツ滑らかな損失に対する頑健性の結果を提供する。

実験結果

リサーチクエスチョン

  • RQ1ReLU 活性化は長い時間展望における消失/爆発勾配を回避して RNN の訓練を安定化させるか?
  • RQ2穏やかな仮定の下で、勾配ベースの方法を用いて多層 RNN をほぼゼロの訓練誤差になるよう効率的に訓練できるか?
  • RQ3過パラメータ化は多層 RNN における収束性と悪い局所 minima の回避にどう影響するか?
  • RQ4結果を深層 RNN および他のリプシッツ滑らかな損失関数へ拡張できるか?

主な発見

  • GD と SGD の両方が過パラメータ化の下で ε-訓練誤差へ収束し、反復回数は T = poly(n,d,L,δ^{-1}) · log(1/ε)。
  • 収束率は非凸性と多層構造にもかかわらず、実質的に log(1/ε) に対して線形である。
  • 勾配下界と半滑性の一対の技術的結果が収束を支え、偽の局所 minima に対抗する。
  • ReLU 活性化は L 層にまたがる勾配の指数的爆発や消失を防ぐのに役立つ。
  • データが層をまたいで分離可能であることを前提として、隠れ層の重み W のみを訓練していても結果は成立する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。