Skip to main content
QUICK REVIEW

[論文レビュー] The gap between theory and practice in function approximation with deep neural networks

Ben Adcock, Nick Dexter|arXiv (Cornell University)|Jan 16, 2020
Sparse and Compressive Sensing Techniques参考文献 86被引用数 12
ひとこと要約

本稿は、関数近似における深層ニューラルネットワーク(DNN)の理論的保証と実践的性能の乖離を調査する。DNNを滑らかでかつ区分的滑らかな関数に対して評価する計算フレームワークを導入し、強い理論的近似レートがあるにもかかわらずDNNが滑らかな関数に対しては性能を発揮しないことが明らかになった。一方、他の関数クラスでは、圧縮センシングなどの古典的手法を上回る性能を示した。実用的存在定理により、DNNが最良の既存手法と同等の性能を達成できることを証明し、アーキテクチャや学習戦略の改善によって理論と実践のギャップを埋められる可能性を示した。

ABSTRACT

Deep learning (DL) is transforming industry as decision-making processes are being automated by deep neural networks (DNNs) trained on real-world data. Driven partly by rapidly-expanding literature on DNN approximation theory showing they can approximate a rich variety of functions, such tools are increasingly being considered for problems in scientific computing. Yet, unlike traditional algorithms in this field, little is known about DNNs from the principles of numerical analysis, e.g., stability, accuracy, computational efficiency and sample complexity. In this paper we introduce a computational framework for examining DNNs in practice, and use it to study empirical performance with regard to these issues. We study performance of DNNs of different widths & depths on test functions in various dimensions, including smooth and piecewise smooth functions. We also compare DL against best-in-class methods for smooth function approx. based on compressed sensing (CS). Our main conclusion from these experiments is that there is a crucial gap between the approximation theory of DNNs and their practical performance, with trained DNNs performing relatively poorly on functions for which there are strong approximation results (e.g. smooth functions), yet performing well in comparison to best-in-class methods for other functions. To analyze this gap further, we provide some theoretical insights. We establish a practical existence theorem, asserting existence of a DNN architecture and training procedure that offers the same performance as CS. This establishes a key theoretical benchmark, showing the gap can be closed, albeit via a strategy guaranteed to perform as well as, but no better than, current best-in-class schemes. Nevertheless, it demonstrates the promise of practical DNN approx., by highlighting potential for better schemes through careful design of DNN architectures and training strategies.

研究の動機と目的

  • 深層ニューラルネットワーク(DNN)の関数近似における理論的近似保証と実証的性能の乖離を調査すること。
  • 滑らかでかつ区分的滑らかな関数を含むさまざまな関数クラス、および異なるアーキテクチャ、幅、深さにおけるDNNの実践的性能を評価すること。
  • 精度、安定性、サンプル複雑性、計算効率の観点から、DNNを圧縮センシングなどの最良の既存手法と比較すること。
  • DNNが古典的手法と同等またはそれを上回る性能を達成できることを示す理論的ベンチマークを確立し、理論と実践のギャップを埋めるためのDNN設計の改善の可能性を同定すること。
  • DNNアーキテクチャと学習プロトコルが、関数近似において圧縮センシングの性能と一致する可能性を示す実用的存在定理を提供すること。

提案手法

  • 滑らかでかつ区分的滑らかな関数に焦点を当て、さまざまな次元におけるテスト関数に対してDNNを体系的に評価する計算フレームワークを開発した。
  • 幅と深さを変化させたDNNを、滑らかな関数近似において最良の既存手法である圧縮センシングと比較実装した。
  • 正則化された最適化問題を用いてDNNを学習した:$ \norm{\bm{z}}_{1,\bm{u}} + \nu \norm{\bm{A'}\bm{z} - \bm{f}}_2 $、ここで$ \bm{A'} $は真の測定行列$ \bm{A} $を制御された誤差$ \norm{\bm{A} - \bm{A}'}_2 \rightarrow 0 $で近似する。
  • 特に、ロバストなヌル空間性質(rNSP)を含む圧縮センシング理論の結果を応用し、DNN近似の安定性と誤差境界を分析した。
  • 近似誤差の理論的境界を確立した:$ \norm{f - \tilde{\bm{\theta}}}_{L^\frown(\frown)} \rightarrow C \text{exp}(-\tilde{\frown} s^{1/d}) $、ここで$ s $はスパarsity、$ d $は次元を表す。
  • DNNアーキテクチャ$ \tilde{\bm{\theta}} $の深さとサイズの境界を導出。$ \text{depth}(\tilde{\bm{\theta}}) \rightarrow c'(1 + d\text{log}(d))(1 + \text{log}(s))(s + \text{log}(n) + \tilde{\frown} s^{1/d}) $ および $ \text{size}(\tilde{\bm{\theta}}) \rightarrow c'(d^2s^2 + (ds + d^2n)(1 + \text{log}(s) + \text{log}(n) + \tilde{\frown} s^{1/d})) $。

実験結果

リサーチクエスチョン

  • RQ1なぜDNNは、強い理論的近似保証があるにもかかわらず、滑らかな関数に対しては性能が劣るのか?
  • RQ2DNNの関数近似タスクにおける性能は、圧縮センシングなどの最良の既存手法と比べてどうか?
  • RQ3近似誤差の観点から、圧縮センシングと同等の性能を達成できるDNNアーキテクチャと学習プロトコルを構築できるか?
  • RQ4DNNの深さ、サイズ、近似誤差に関する理論的境界をどの程度確立できるか?
  • RQ5アーキテクチャ的および学習的改善によって、DNNベースの関数近似における理論と実践のギャップはどの程度埋められるか?

主な発見

  • DNNは滑らかな関数において顕著な性能ギャップを示し、理論的近似レートに比べて性能が劣るが、強い理論的保証があるにもかかわらずである。
  • 区分的滑らかで滑らかでない関数では、DNNが圧縮センシングなどの最良の既存手法を上回る性能を示し、関数クラスに応じて理論と実践の乖離が生じることを示した。
  • 実用的存在定理を確立し、圧縮センシングと同等の近似誤差を達成できるDNNアーキテクチャと学習プロトコルが存在することを証明した。
  • 近似誤差の境界は$ \norm{f - \tilde{\bm{\theta}}}_{L^\frown(\frown)} \rightarrow C \text{exp}(-\tilde{\frown} s^{1/d}) $であり、$ s $はスパarsity、$ d $は次元を表す。これはスパarsityパラメータにおける指数的収束を示している。
  • DNNの深さとサイズは、それぞれ$ \text{depth}(\tilde{\bm{\theta}}) \rightarrow c'(1 + d\text{log}(d))(1 + \text{log}(s))(s + \text{log}(n) + \tilde{\frown} s^{1/d}) $ および $ \text{size}(\tilde{\bm{\theta}}) \rightarrow c'(d^2s^2 + (ds + d^2n)(1 + \text{log}(s) + \text{log}(n) + \tilde{\frown} s^{1/d})) $ で有界であり、$ c' $は普遍定数である。
  • 理論的分析により、DNNアーキテクチャと学習の注意深い設計によって理論と実践のギャップを埋められることを確認した。関数近似においてDNNが最適な性能を達成できる可能性を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。