Skip to main content
QUICK REVIEW

[論文レビュー] Theoretical Issues in Deep Networks: Approximation, Optimization and Generalization

Tomaso Poggio, Andrzej Banburski|arXiv (Cornell University)|Aug 25, 2019
Stochastic Gradient Optimization Techniques参考文献 23被引用数 19
ひとこと要約

この論文は、近似、最適化、一般化の3つの核心的側面を分析することで、深層学習の理論的基盤を提供する。深層畳み込みネットワークが合成関数を近似する際、浅層ネットワークに比べて指数関数的に優れていること、過パラメータ化された設定において確率的勾配降下法(SGD)がグローバルミニマに収束すること、勾配降下法における暗黙のノルム制御が明示的正則化なしに一般化を可能にすること——これらは深層学習理論における主要な謎を解明する。

ABSTRACT

While deep learning is successful in a number of applications, it is not yet well understood theoretically. A satisfactory theoretical characterization of deep learning however, is beginning to emerge. It covers the following questions: 1) representation power of deep networks 2) optimization of the empirical risk 3) generalization properties of gradient descent techniques --- why the expected error does not suffer, despite the absence of explicit regularization, when the networks are overparametrized? In this review we discuss recent advances in the three areas. In approximation theory both shallow and deep networks have been shown to approximate any continuous functions on a bounded domain at the expense of an exponential number of parameters (exponential in the dimensionality of the function). However, for a subset of compositional functions, deep networks of the convolutional type can have a linear dependence on dimensionality, unlike shallow networks. In optimization we discuss the loss landscape for the exponential loss function and show that stochastic gradient descent will find with high probability the global minima. To address the question of generalization for classification tasks, we use classical uniform convergence results to justify minimizing a surrogate exponential-type loss function under a unit norm constraint on the weight matrix at each layer -- since the interesting variables for classification are the weight directions rather than the weights. Our approach, which is supported by several independent new results, offers a solution to the puzzle about generalization performance of deep overparametrized ReLU networks, uncovering the origin of the underlying hidden complexity control.

研究の動機と目的

  • 深層学習が明示的正則化なしに優れた性能を発揮する理由を理論的に理解するという理論的ギャップを埋めること。
  • 特に合成関数に対して、深層ネットワークの表現力が浅層ネットワークに比べてどのように特徴づけられるかを明らかにすること。
  • 過パラメータ化された深層ネットワークにおいて、確率的勾配降下法(SGD)がどのようにグローバルミニマに収束するかを説明すること。
  • 過パラメータ化された深層ネットワークにおける一般化のパラドックスを、暗黙の正則化メカニズムの同定によって解明すること。
  • 近似、最適化、一般化の理論的知見を、一貫した枠組みで統合すること。

提案手法

  • 合成的・階層的・局所的構造を持つ関数クラスを用いた近似効率の分析により、深層ネットワークが次元に線形依存で近似可能であることを示した。
  • 指数型損失関数の損失関数の形状を研究し、グローバルミニマが他の臨界点よりも非退化(非ゼロ固有値を有する)であることを示した。
  • 分類に特化したダイナミクスをモデル化するため、各層の重み行列に単位ノルム制約を課した制約付き最適化フレームワークを導入した。
  • 標準的勾配降下法と重み正規化の臨界点が等価であることを導出し、暗黙のL2ノルム制御を示した。
  • 一様収束理論と構造的補題を用いて、過パラメータ化された設定における一般化を正当化した。
  • CIFAR-10における実験的検証により、訓練データ数を超えるパラメータ数であっても、期待誤差が増加しないことを示した。

実験結果

リサーチクエスチョン

  • RQ1なぜ深層畳み込みネットワークは、合成関数に対して浅層ネットワークに比べて指数的近似優位性を達成するのか?
  • RQ2複雑な損失関数の形状を持つ過パラメータ化された深層ネットワークにおいて、確率的勾配降下法(SGD)がどのようにグローバルミニマに収束するのか?
  • RQ3過パラメータ化された深層ネットワークで明示的正則化なしに一般化が可能となるメカニズムは何か?
  • RQ4勾配降下法がどのように暗黙のノルム制御を実現し、一般化にどのような役割を果たすのか?
  • RQ5重み正規化、勾配降下法のダイナミクス、暗黙の正則化の理論的関係は何か?

主な発見

  • 局所的・階層的な合成性を持つ深層畳み込みネットワークは、次元に線形依存で関数を近似可能であるのに対し、浅層ネットワークは指数的パラメータ数を要する。
  • 指数型損失関数では、グローバルミニマは他の臨界点よりも非退化(非ゼロ固有値を有する)であり、SGDがグローバルミニマに高確率で収束する理由が説明できる。
  • 標準的勾配降下法は、重み方向にL2ノルムの単位制約を暗黙的に強制する。これは、同一の臨界点を持つ制約付き最適化問題を解くのと等価である。
  • 勾配降下法における暗黙のノルム制御は、明示的正則化が存在しない過パラメータ化されたReLUネットワークでも一般化を可能にする正則化の一種である。
  • 重み正規化と勾配降下法のダイナミクスは、臨界点構造において数学的に等価であり、重み正規化の成功の理論的根拠を示唆する。
  • CIFAR-10における実験結果から、パラメータ数が訓練サンプル数を超える場合でも、期待分類誤差が安定しており、明示的正則化なしの一般化に関する理論的主張を支持する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。