Skip to main content
QUICK REVIEW

[論文レビュー] Expressive power of recurrent neural networks

Valentin Khrulkov, Alexander Novikov|arXiv (Cornell University)|Nov 2, 2017
Tensor decomposition and applications参考文献 19被引用数 9
ひとこと要約

この論文は、再帰的ニューラルネットワーク(RNN)の表現力の理論的基盤を、テンソルトレース(TT)分解と結びつけることで確立し、浅いネットワークがTT-RNNの表現能力を再現するには指数関数的に多くの幅が必要であることを証明している。主な貢献は、同等の浅いネットワークの幅に対する指数的下界の確立であり、これはRNNが画像パッチのような順序付きで構造的なデータをモデル化する際に根本的により効率的であることを示している。

ABSTRACT

Deep neural networks are surprisingly efficient at solving practical tasks, but the theory behind this phenomenon is only starting to catch up with the practice. Numerous works show that depth is the key to this efficiency. A certain class of deep convolutional networks -- namely those that correspond to the Hierarchical Tucker (HT) tensor decomposition -- has been proven to have exponentially higher expressive power than shallow networks. I.e. a shallow network of exponential width is required to realize the same score function as computed by the deep architecture. In this paper, we prove the expressive power theorem (an exponential lower bound on the width of the equivalent shallow network) for a class of recurrent neural networks -- ones that correspond to the Tensor Train (TT) decomposition. This means that even processing an image patch by patch with an RNN can be exponentially more efficient than a (shallow) convolutional network with one hidden layer. Using theoretical results on the relation between the tensor decompositions we compare expressive powers of the HT- and TT-Networks. We also implement the recurrent TT-Networks and provide numerical evidence of their expressivity.

研究の動機と目的

  • 再帰的ニューラルネットワーク(RNN)の表現力の理論的基盤を、テンソルトレース(TT)分解と結びつけること。
  • 浅いネットワークがTT-RNNを正確に再現するには指数関数的に多くの幅が必要であることを証明し、表現力の定理を確立すること。
  • テンソル分解理論を用いて、TT-RNN、HT畳み込みネットワーク、CP浅いネットワークの表現力を比較すること。
  • 合成データおよび実世界のデータセットを用いた数値実験を通じて、TT-RNNの実証的妥当性を提供すること。

提案手法

  • 入力の順序処理を低ランクテンソルの鎖としてモデル化することで、RNNとTT分解の関係を形式化すること。
  • 特徴テンソルΦ(X)とトレーニング可能な重みテンソルW_yの内積としてスコア関数を定義し、Φ(X)を入力パッチに適用された特徴写像の積によって構築すること。
  • TTランクを複雑さの指標として用い、任意の浅いネットワークがTT-RNNを正確に再現できるための幅に対する指数的下界を証明すること。
  • 共有で低ランクな双線形写像を用いてTT-RNNを実装し、固定されたパッチサイズとReLU活性化関数を用いてトイデータおよび実データ(MNIST、CIFAR-10)で学習すること。
  • ランク構造に基づくパrameterizationを用いてモデルの複雑さを低減しながらも、表現能力を維持すること。
  • 訓練精度を用いて性能を評価し、同一の設定下でTT-RNNとCP分解された浅いネットワークを比較すること。

実験結果

リサーチクエスチョン

  • RQ1再帰的ニューラルネットワークは正式にテンソルトレース分解と結びつけられるか。その結果得られるアーキテクチャ的解釈は何か。
  • RQ2TT分解を用いてモデル化されたRNNの理論的表現力は何か。浅いネットワークと比べてどうなるか。
  • RQ3TT-RNNの表現力は、階層的タッカー(HT)畳み込みネットワークおよびキャノニカル多項式(CP)浅いネットワークと比べてどうか。
  • RQ4数値実験は、TT-RNNの理論的優位性が実際の応用においてどの程度裏付けられるか。

主な発見

  • 本論文は、任意の浅いネットワークがTT-RNNを正確に再現するための幅に対する指数的下界を証明し、その優れた表現力を確立している。
  • MNISTでは、ランクが5未満で98%のテスト精度を達成しており、簡単なタスクにおける強力な表現能力を示している。
  • CIFAR-10では、正則化なしで45%の訓練精度を達成しており、CPネットワーク(20%の精度)を顕著に上回っており、多項式的だが有意義な表現力の向上を示している。
  • TTネットワークとCPネットワークの性能差は、実験全体を通して一貫しており、特に高ランクでの学習安定性においてTT-RNNが優位である。
  • 最適化の問題により、CPネットワークはランクが増加するにつれて性能が低下することが時折見られ、TT構造に基づくパrameterizationの安定性の優位性が浮き彫りになっている。
  • 理論的枠組みにより、TT-RNNが浅いネットワークに比べて指数的に表現力が優れていることが確認されたが、最適化制約のため実際の利得は多項式的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。