Skip to main content
QUICK REVIEW

[論文レビュー] Minimal Width for Universal Property of Deep RNN

Changhoon Song, Geonho Hwang|arXiv (Cornell University)|Nov 25, 2022
Stochastic Gradient Optimization Techniques被引用数 9
ひとこと要約

この論文は、ReLU活性化関数を用いた深く狭い再帰的ニューラルネットワーク(RNN)が、有限のシーケンスを$\mathbb{R}^{d_x}$から$\mathbb{R}^{d_y}$への連続関数または$L^p$関数を普遍的に近似できることを証明している。連続関数の場合の最小幅は$d_x + d_y + 3$、$L^p$関数の場合の最小幅は$\max\{d_x+1, d_y\}$であり、シーケンス長に依存しない。この結果により、深く狭いRNNにおける普遍的近似のための最小幅のタイトな上限が確立される。

ABSTRACT

A recurrent neural network (RNN) is a widely used deep-learning network for dealing with sequential data. Imitating a dynamical system, an infinite-width RNN can approximate any open dynamical system in a compact domain. In general, deep networks with bounded widths are more effective than wide networks in practice; however, the universal approximation theorem for deep narrow structures has yet to be extensively studied. In this study, we prove the universality of deep narrow RNNs and show that the upper bound of the minimum width for universality can be independent of the length of the data. Specifically, we show that a deep RNN with ReLU activation can approximate any continuous function or $L^p$ function with the widths $d_x+d_y+2$ and $\max\{d_x+1,d_y\}$, respectively, where the target function maps a finite sequence of vectors in $\mathbb{R}^{d_x}$ to a finite sequence of vectors in $\mathbb{R}^{d_y}$. We also compute the additional width required if the activation function is $ anh$ or more. In addition, we prove the universality of other recurrent networks, such as bidirectional RNNs. Bridging a multi-layer perceptron and an RNN, our theory and proof technique can be an initial step toward further research on deep RNNs.

研究の動機と目的

  • 深く狭いRNNが逐次関数を普遍的に近似できるために必要な最小幅を特定すること。
  • 最小幅の上限がシーケンス長に依存しないことを証明することで、効率的な深く狭いアーキテクチャの実現を可能にすること。
  • 双方向RNN、GRU、LSTMを含むさまざまなRNNバージョンへの普遍的近似結果の拡張。
  • 連続関数や$L^p$関数を含むさまざまな関数クラスに対する最小幅のタイトな上限を提供すること。
  • 明示的なRNNアーキテクチャの構築により、深く狭いネットワークと普遍的近似の理論的ギャップを埋めること。

提案手法

  • 入力シーケンスの任意の線形結合をシミュレートできるように、トークン単位のリフトマップと修正されたTRNNセルの再帰的合成を用いたReLU活性化関数を備えた深層RNNを構築する。
  • 二段階アーキテクチャを採用:過去の入力を重み付き和として計算する前方パス、次に行列逆行列技術を用いて目的関数を再構築する逆方向パス。
  • 二項係数行列と下三角行列系を用いて、各時刻における目的出力の回復に必要な重みを求める。
  • 補題26を適用して、目的関数近似から導かれる線形系を満たす逆方向パスの重み$\bar{b}_i[t]$を求める。
  • ゼロにおける微分可能性を満たす非ReLU活性化関数(例:シグモイド、tanh)に対しても、同様の構成を適用する。
  • 前方および逆方向RNNを組み合わせることで、過去および未来の依存関係を捉える双方向RNNにフレームワークを拡張する。

実験結果

リサーチクエスチョン

  • RQ1ReLU活性化関数を用いた深く狭いRNNが、コンパクト領域上での連続関数を普遍的に近似できるために必要な最小幅は何か?
  • RQ2深層RNNにおける普遍的近似のための最小幅の上限が、シーケンス長に依存しないか?
  • RQ3$L^p$関数近似において、連続関数近似と比較して最小幅要件はどのように変化するか?
  • RQ4シグモイドやtanhなどの非ReLU活性化関数を用いる場合、追加で必要な幅はどれくらいか?
  • RQ5双方向RNNやGRU、LSTMなどの他のRNNバージョンに対しても、普遍的近似性を拡張できるか?

主な発見

  • ReLU活性化関数を用いた深層RNNは、$\mathcal{K}$を$\mathbb{R}^{d_x}$のコンパクト部分集合とするとき、任意の連続関数$f: \mathcal{K} \to \mathbb{R}^{d_y}$を幅$d_x + d_y + 3$で普遍的に近似可能である。
  • $\mathcal{K}$上での$L^p$関数近似において、最小幅は$\max\{d_x+1, d_y\} + 1$で抑えられる。
  • $\mathbb{R}^{d_x}$上での$L^p$関数近似において、ReLU活性化関数を用いる場合、最小幅は正確に$\max\{d_x+1, d_y\}$である。
  • シグモイドやtanh(ゼロにおける微分可能性および非ゼロ導関数を満たす)などの非ReLU活性化関数を用いる場合、最小幅は連続関数に対して$d_x + d_y + 4$に増加する。
  • この構成は、双方向RNN、GRU、LSTMに対しても一般化され、標準RNNと同一の最小幅の上限が得られる。
  • 最小幅はシーケンス長$N$に依存しないため、深く狭いRNNがシーケンス長が長くなっても幅を増やさずに普遍的近似を達成できることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。