Skip to main content
QUICK REVIEW

[論文レビュー] Contracting Implicit Recurrent Neural Networks: Stable Models with Improved Trainability

Max Revay, Ian R. Manchester|arXiv (Cornell University)|Dec 22, 2019
Model Reduction and Neural Networks被引用数 7
ひとこと要約

本稿では、凸収縮に基づく制約を用いることでモデルの安定性を保証する新しいRNNアーキテクチャ、Contracting Implicit Recurrent Neural Networks (ci-RNNs) を提案する。これにより、より高速な学習と向上した一般化性能が実現される。収縮解析と構造化初期化スキームを活用することで、vanilla RNN や安定RNN (s-RNN) より優れた性能を達成し、収束が速く、不安定な学習軌道が少ない。特に、歩行予測のような長時間系列タスクにおいて顕著である。

ABSTRACT

Stability of recurrent models is closely linked with trainability, generalizability and in some applications, safety. Methods that train stable recurrent neural networks, however, do so at a significant cost to expressibility. We propose an implicit model structure that allows for a convex parametrization of stable models using contraction analysis of non-linear systems. Using these stability conditions we propose a new approach to model initialization and then provide a number of empirical results comparing the performance of our proposed model set to previous stable RNNs and vanilla RNNs. By carefully controlling stability in the model, we observe a significant increase in the speed of training and model performance.

研究の動機と目的

  • 安全性が求められるアプリケーションを含め、再帰的ニューラルネットワーク (RNN) の不安定さと学習困難さを解決すること。
  • スペクトルノルム射影などの非凸制約を回避するため、収縮解析を用いた安定RNNの凸パrametrizationを構築すること。
  • 安定性を保ちつつ表現力を維持する初期化スキームを設計することで、学習速度とモデル性能を向上させること。
  • 安定RNNは一般化を損なわず、より効率的に学習可能であることを、システム同定と歩行予測の実証的ベンチマークを通じて示すこと。
  • スペクトルノルム制約とは異なり、収縮に基づく安定性制約は学習を遅くしないこと、すなわち、収束が速くなることを示すこと。

提案手法

  • 隠れ状態のダイナミクスが固定点方程式で定義される暗黙的RNN構造を提案:$ x = \text{ReLU}(E x + W u) $、ここで $ E $ と $ W $ は学習可能な行列。
  • 収縮理論を用いて凸安定性条件を課す:$ \Sigma \succ 0 $、ここで $ \Sigma = \text{diag}(\sigma_i) $ であり、近接する軌道の指数的収束を保証する。
  • 条件 $ \Sigma \succ 0 $ を用いて安定性制約の凸パラメータ化を導出し、効率的な最適化と安定した学習を可能にする。
  • 収縮条件を満たす安定行列として $ E $ を設定する新しい初期化スキームを導入し、$ W $ は適切にスケーリングされたランダム初期値で初期化する。
  • 冗長なパラメータ化を用いることで、より表現力豊かなダイナミクスを可能にしつつ安定性を維持し、スペクトルノルム射影の必要性を回避する。
  • 収縮計測を用いて、平衡点や入力に依存しないインクリメンタル安定性を保証し、入力が有界であれば出力も有界であり、入力摂動に対してロバストであることを保証する。

実験結果

リサーチクエスチョン

  • RQ1収縮解析を用いて、安定RNNの凸パラメータ化を導出可能か? これにより、学習性と一般化性能が向上するか?
  • RQ2凸制約による収縮安定性の強制は、非制約またはスペクトルノルム制約付きRNNと比較して、より高速な学習を実現するか?
  • RQ3提案された初期化スキームは、順序タスクにおけるモデル性能を維持または向上させつつ、著しく学習時間を短縮できるか?
  • RQ4歩行予測タスクにおいて、ci-RNNはvanilla RNNおよびs-RNNと比較して、複数の被験者に対してテスト誤差と安定性の点で優れているか?
  • RQ5収縮制約は学習速度を妨げるのか、それともスペクトルノルム制約と比較して収束を速めるのか?

主な発見

  • シミュレーションデータ上の学習誤差曲線から、ci-RNNはvanilla RNNおよびs-RNNと比較して著しく高速な収束を達成している。
  • 提案された初期化スキームにより、従来の初期化と比較して、暗黙的モデルで学習時間を50%以上短縮でき、安定性や性能に劣化は認められない。
  • 歩行予測タスクにおいて、ci-RNNは全被験者および全モデル深さにおいて、RNNおよびs-RNNを上回り、テストセットでの正規化シミュレーション誤差 (NSE) が低かった。
  • すべてのci-RNNは、対応するs-RNNを上回り、3層モデルの100%がより良いテストNSEを示し、不安定なモデルは観測されなかった。
  • スペクトルノルム制約が学習を著しく遅くするのとは異なり(射影付きRNNで観察されたように)、収縮制約は最適化を妨げず、高速な収束を可能にする。
  • 収縮制約を課えた暗黙的モデル構造は、より良い一般化性能を示しており、歩行予測タスクにおける低いテストNSEと、無限大に発散する誤差軌道の不在によって裏付けられている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。