Skip to main content
QUICK REVIEW

[論文レビュー] On the Turnpike to Design of Deep Neural Nets: Explicit Depth Bounds

Timm Faulwasser, Arne-Jens Hempel|arXiv (Cornell University)|Jan 8, 2021
Model Reduction and Neural Networks参考文献 25被引用数 4
ひとこと要約

本稿では、ターンパイクおよび分散性の性質を活用することで、深層ニューラルネットワーク(DNN)の明示的で最適な深さの上限を導出する、新しい最適制御フレームワークを提案する。DNNの学習を有限区間の最適制御問題(OCP)としてモデル化し、正則化を用いて厳密な分散性を強制することで、数値的に検証された解析的に計算可能な深さの上限を導出している。Two Spiral Taskにおける数値的検証では、特にℓ∞-ノルム正則化を用いた場合、過剰な見積もりにならない非保守的な推定値が得られている。

ABSTRACT

It is well-known that the training of Deep Neural Networks (DNN) can be formalized in the language of optimal control. In this context, this paper leverages classical turnpike properties of optimal control problems to attempt a quantifiable answer to the question of how many layers should be considered in a DNN. The underlying assumption is that the number of neurons per layer -- i.e., the width of the DNN -- is kept constant. Pursuing a different route than the classical analysis of approximation properties of sigmoidal functions, we prove explicit bounds on the required depths of DNNs based on asymptotic reachability assumptions and a dissipativity-inducing choice of the regularization terms in the training problem. Numerical results obtained for the two spiral task data set for classification indicate that the proposed estimates can provide non-conservative depth bounds.

研究の動機と目的

  • 最長時間にわたり経験的に残っている、最適なDNNの深さを特定する課題を、定量的設計問題として再定式化すること。
  • 定常的幅と漸近的到達可能性の仮定の下で、DNNの明示的かつ解析的に導出された深さ上限を提供すること。
  • 訓練OCPにおける厳密な分散性を誘発する正則化項を設計するための構成的メソッドを確立すること。
  • 分類タスクにおける数値実験を用いて、導出された上限のきつさと実用的意義を評価すること。
  • 特にターンパイクおよび分散性理論を用いた最適制御ツールをDNNアーキテクチャ設計に応用することで、システム理論と深層学習を橋渡しすること。

提案手法

  • フィードフォワードDNNの学習を、深さを離散的時間ステップとして扱う有限区間最適制御問題(OCP)として定式化する。
  • ターンパイク理論を適用し、OCP解における中心的で安定した領域を同定し、それがネットワークの最適な学習経路に対応することを示す。
  • 段階コストにおける正則化項を設計することで、OCPに厳密な分散性条件を課し、ターンパイクの存在を保証する。
  • 漸近的到達可能性の仮定と、分散性によって誘発されるOCPの構造を用いて、明示的な深さ上限を導出する。
  • a-posterioriの深さ推定を計算するために、ℓ2およびℓ∞の2種類の状態ペナルティを採用し、特にℓ∞がはるかにきつい上限をもたらすことを確認する。
  • Two Spiral Task上で結果を数値的に検証し、実際の学習性能および収束性と比較して上限を評価する。

実験結果

リサーチクエスチョン

  • RQ1ターンパイクおよび分散性理論を用いて、DNNの明示的かつ非保守的な深さ上限を導出できるか?
  • RQ2OCPの段階コストにおける正則化の選択が、導出された深さ上限にどのように影響するか?
  • RQ3導出された深さ上限はきつくて実用的意味を持つものなのか、特に経験的学習挙動と比較してどうか?
  • RQ4ℓ∞-ノルム正則化は、特にデータセットサイズが増加する際、ℓ2と比較してはるかにきつい深さ推定をもたらすのか?
  • RQ5ターゲット状態への漸近的到達可能性が、DNNにおける成功した分類に十分であるとされる程度はどの程度か?

主な発見

  • 本手法により、分散性およびターンパイク理論に基づくDNNの明示的深さ上限が得られた。本研究の知見では、これが初めての解析的導出である。
  • 段階コストにおけるℓ∞-ノルム正則化を用いることで、Two Spiral Taskにおいて6.31から11.06の範囲ではるかにきつい深さ推定が得られ、データセットサイズが増加しても同様の推定が維持される。
  • 一方、ℓ2に基づく上限はデータセットサイズの増加に伴い著しく増加し、D=500では最大6,830に達するなど、標準的な正則化ではスケーラビリティに劣ることが示された。
  • 数値的結果から、a-posterioriの深さ推定が過剰に保守的ではないことが示され、最良の推定値は観察された学習挙動と非常に近接している。
  • ℓ∞-ノルムに基づく上限は、ノイズのあるデータに対しても安定しており、平均して7〜8の周辺に集中し続けることから、データ摂動に対して強い耐性を示す。
  • 本研究では、ターゲット状態への到達可能性が分類に十分であるが、必要ではないことが判明した。今後の研究では、より一般的な定式化の余地があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。