Skip to main content
QUICK REVIEW

[論文レビュー] Deep Network Approximation: Achieving Arbitrary Accuracy with Fixed Number of Neurons

Zuowei Shen, Haizhao Yang|arXiv (Cornell University)|Jul 6, 2021
Neural Networks and Applications参考文献 43被引用数 15
ひとこと要約

本稿では、周期的三角波関数とソフトシグノイド関数を組み合わせた、新規で単純かつ計算可能な活性化関数を提案する。この関数により、固定された有限な幅(36d(2d+1))と深さ(11)を持つ順方向型ニューラルネットワークが、d次元ハイパーキューブ上の任意の連続関数を普遍的に近似可能である。主な貢献は、パラメータを調整することで任意の小さな誤差内で任意の連続関数を近似可能であることを証明し、固定サイズのネットワークが普遍的近似能力を持つことを確立したことである。

ABSTRACT

This paper develops simple feed-forward neural networks that achieve the universal approximation property for all continuous functions with a fixed finite number of neurons. These neural networks are simple because they are designed with a simple, computable, and continuous activation function $σ$ leveraging a triangular-wave function and the softsign function. We first prove that $σ$-activated networks with width $36d(2d+1)$ and depth $11$ can approximate any continuous function on a $d$-dimensional hypercube within an arbitrarily small error. Hence, for supervised learning and its related regression problems, the hypothesis space generated by these networks with a size not smaller than $36d(2d+1) imes 11$ is dense in the continuous function space $C([a,b]^d)$ and therefore dense in the Lebesgue spaces $L^p([a,b]^d)$ for $p\in [1,\infty)$. Furthermore, we show that classification functions arising from image and signal classification are in the hypothesis space generated by $σ$-activated networks with width $36d(2d+1)$ and depth $12$ when there exist pairwise disjoint bounded closed subsets of $\mathbb{R}^d$ such that the samples of the same class are located in the same subset. Finally, we use numerical experimentation to show that replacing the rectified linear unit (ReLU) activation function by ours would improve the experiment results.

研究の動機と目的

  • 固定サイズのニューラルネットワークで普遍的近似を可能にする単純かつ計算可能な活性化関数の開発を目的とする。
  • 幅 36d(2d+1)、深さ 11 の深層順方向ネットワークが、[a,b]^d 上の任意の連続関数を任意の誤差内で近似可能であることを証明すること。
  • 追加の1層を用いて、分類関数を正確に表現できることを示すこと。
  • 回帰および分類タスクにおけるこの活性化関数の近似性能について理論的裏付けを提供すること。

提案手法

  • 活性化関数 σ は、以下のように定義される区分的関数として構築される:σ₁(x) = |x|(x ∈ [-1,1])、周期2で拡張され、σ₂(x) = x/(|x|+1)(x < 0)であり、周期性と高い非線形性を併せ持つハイブリッド関数を形成する。
  • アフィン変換をパrameter化するO(d²)個の非ゼロパラメータを用いた11層の非線形層の合成をネットワークが使用する。
  • 三角波成分の周期性とソフトシグノイド関数の非線形性を活用し、ステップ関数をシミュレートし、任意の連続関数を近似する。
  • 数学的帰納法を用いて、出力集合 {τ(wa₁), ..., τ(wa_J)} が [0,1]^J で稠密であることを示し、普遍的近似を可能にする。
  • 任意の ε > 0 に対して、固定サイズのネットワークがパラメータを調整することで、任意の f ∈ C([a,b]^d) を ε の誤差内で近似可能であることを保証する。
  • 分類関数 ∑ r_j · 1_{E_j}(互いに素な閉集合 E_j と相異なる有理数 r_j)を正確に実現するために、2つのニューロンを有する追加の隠れ層を用いる。

実験結果

リサーチクエスチョン

  • RQ1固定サイズの深層ニューラルネットワークに、単純かつ計算可能な活性化関数を適用することで、d次元ハイパーキューブ上の連続関数を普遍的に近似可能か?
  • RQ2周期的および非線形成分を組み合わせた提案された活性化関数は、パラメータの調整のみで任意の連続関数を近似可能か?
  • RQ3このようなネットワークは、ℝ^d の互いに素な有界閉集合上に定義された分類関数を正確に表現可能か?
  • RQ4この活性化関数を用いて普遍的近似を達成するための最小のネットワーク幅と深さは何か?
  • RQ5提案された活性化関数は、実用的な学習タスクにおいて標準的なReLUと比較して、数値的にどのように性能を発揮するか?

主な発見

  • 幅 36d(2d+1)、深さ 11、提案された活性化関数 σ を用いた深層ニューラルネットワークは、パラメータを調整することで、[a,b]^d 上の任意の連続関数を任意の小さな誤差 ε で近似可能である。
  • 幅 36d(2d+1)、深さ 11 の σ-活性化ネットワークの仮説空間は C([a,b]^d) で稠密であり、したがって p ∈ [1, ∞) に対して L^p([a,b]^d) に対しても稠密である。
  • 幅 2 の追加隠れ層を用いることで、任意の分類関数 ∑_{j=1}^J r_j · 1_{E_j}(J ∈ ℕ⁺、相異なる有理数 r_j、互いに素な有界閉集合 E_j ⊆ ℝ^d)を正確に表現可能である。
  • ネットワークアーキテクチャは最大で 5437(d+1)(2d+1) 個の非ゼロパラメータを必要とし、パrameter数は目的関数や所望の精度 ε とは独立している。
  • 数値実験の結果、ReLU を提案された活性化関数に置き換えることで、実用的学習タスクにおける性能が向上することが示された。
  • 活性化関数 σ が基本的普遍活性化関数(EUAF)であることが証明され、このネットワークは EUAF ネットワークと呼ばれるようになり、固定サイズの普遍近似器の新たなクラスを確立した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。