Skip to main content
QUICK REVIEW

[論文レビュー] Universal Approximation Power of Deep Residual Neural Networks via Nonlinear Control Theory

Paulo Tabuada, Bahman Gharesifard|arXiv (Cornell University)|Jul 12, 2020
Model Reduction and Neural Networks参考文献 33被引用数 21
ひとこと要約

この論文は、深層残差ニューラルネットワークをアンサンブル制御系としてモデル化し、微分幾何的制御理論を適用することで、その普遍的近似能力を確立している。特定の活性化関数を用いることで、これらのネットワークは訓練データを正確に記憶可能であり、コンパクト集合上で任意の連続関数を任意の精度で近似可能であると証明しており、必要なニューロン数に対する最適な境界を導出している。

ABSTRACT

In this paper, we explain the universal approximation capabilities of deep residual neural networks through geometric nonlinear control. Inspired by recent work establishing links between residual networks and control systems, we provide a general sufficient condition for a residual network to have the power of universal approximation by asking the activation function, or one of its derivatives, to satisfy a quadratic differential equation. Many activation functions used in practice satisfy this assumption, exactly or approximately, and we show this property to be sufficient for an adequately deep neural network with $n+1$ neurons per layer to approximate arbitrarily well, on a compact set and with respect to the supremum norm, any continuous function from $\mathbb{R}^n$ to $\mathbb{R}^n$. We further show this result to hold for very simple architectures for which the weights only need to assume two values. The first key technical contribution consists of relating the universal approximation problem to controllability of an ensemble of control systems corresponding to a residual network and to leverage classical Lie algebraic techniques to characterize controllability. The second technical contribution is to identify monotonicity as the bridge between controllability of finite ensembles and uniform approximability on compact sets.

研究の動機と目的

  • 非線形制御理論のツールを用いて、深層残差ニューラルネットワークの普遍的近似能力を確立すること。
  • 従来の研究では無限大の幅を仮定していたが、本研究では幅が有界な深層ネットワークに焦点を当て、その制限を克服すること。
  • 重みを制御入力として用い、複数のサンプル点を制御するアンサンブル制御系として深層残差ネットワークをモデル化すること。
  • サンプル点の開かつ稠密な部分多様体上で可制御性を保証する活性化関数を同定すること。
  • 普遍的近似に必要なニューロン数に対する最適な境界を導出すること。

提案手法

  • 訓練データの記憶を、非線形制御系のアンサンブルに対する可制御性問題として定式化する。
  • 各残差ネットワーク層を、重みを制御入力とし、サンプル点を初期状態とする制御系としてモデル化する。
  • 微分幾何的制御理論からのリー代数的技法を用いて、アンサンブル系の可制御性を分析する。
  • 単調性の概念を適用することで、有限アンサンブルの可制御性を無限アンサンブル近似へと拡張する。
  • 可制御性を保証する活性化関数の条件(特に、高次導関数が消えないもの)を導出する。
  • バーデモンデ型行列の行列式解析を用いて、可制御性が活性化関数の最高次項にのみ依存することを示す。

実験結果

リサーチクエスチョン

  • RQ1幅が有界な深層残差ニューラルネットワークは、コンパクト集合上で任意の連続関数を普遍的に近似可能か?
  • RQ2制御理論的手法を用いて、どのクラスの活性化関数が深層残差ネットワークにおける普遍的近似を可能にするか?
  • RQ3訓練データの記憶を、アンサンブル制御系における可制御性問題としてどのように定式化できるか?
  • RQ4この設定において、普遍的近似に必要なニューロン数の最適な境界は何か?
  • RQ5残差ネットワークアーキテクチャの構造は、浅いネットワークと比べてどのようにより優れた近似を可能にするか?

主な発見

  • 活性化関数の2階微分が開かつ稠密な集合上で非ゼロである深層残差ネットワークは、普遍的近似を達成可能である。
  • 活性化関数の最高次項が支配的である場合、可制御性が保証され、低次の項は可制御性に影響しない。
  • 可制御性行列の行列式は、活性化関数の最高次係数にのみ依存し、低次の項には依存しない。
  • 可制御性を達成する重み行列の集合は、パrameter空間において開かつ稠密であるため、近似性質は一般に成り立つ。
  • 必要なニューロン数は最適に境界付けられており、サンプル点の数と入力空間の次元に明示的な依存関係を持つ。
  • 単調性の議論により、有限アンサンブルの可制御性を無限アンサンブル近似へと拡張でき、コンパクト集合上で一様収束が保証される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。