Skip to main content
QUICK REVIEW

[論文レビュー] Orthogonal Recurrent Neural Networks with Scaled Cayley Transform

Kyle Helfrich, Devin Willmott|arXiv (Cornell University)|Jul 29, 2017
Neural Networks and Applications参考文献 17被引用数 15
ひとこと要約

本論文では、スケーリング・ケイリー変換を用いて歪対称行列によるパrameterizationにより、直交的かつ再帰的重み行列を維持する実数値RNN、scaled Cayley orthogonal recurrent neural network (scoRNN)を提案する。標準ケイリー変換の固有値特異性の問題を克服することで、scoRNNは安定的かつ効率的な学習を可能にし、他のユニタリRNNよりも少ないパラメータで、順序付きタスクにおいて最先端の性能を達成する。

ABSTRACT

Recurrent Neural Networks (RNNs) are designed to handle sequential data but suffer from vanishing or exploding gradients. Recent work on Unitary Recurrent Neural Networks (uRNNs) have been used to address this issue and in some cases, exceed the capabilities of Long Short-Term Memory networks (LSTMs). We propose a simpler and novel update scheme to maintain orthogonal recurrent weight matrices without using complex valued matrices. This is done by parametrizing with a skew-symmetric matrix using the Cayley transform. Such a parametrization is unable to represent matrices with negative one eigenvalues, but this limitation is overcome by scaling the recurrent weight matrix by a diagonal matrix consisting of ones and negative ones. The proposed training scheme involves a straightforward gradient calculation and update step. In several experiments, the proposed scaled Cayley orthogonal recurrent neural network (scoRNN) achieves superior results with fewer trainable parameters than other unitary RNNs.

研究の動機と目的

  • 長期間の依存関係を学習するのを制限する、再帰的ニューラルネットワーク(RNN)における勾配消失および勾配爆発問題に対処すること。
  • 複素数値ユニタリRNNの代替として、より単純で実数値の、直交的再帰的重み行列を維持する手法を開発すること。
  • 標準ケイリー変換では固有値 -1 を表現できないという制限を克服すること。
  • 数値計算下でも直交性を保つシンプルな勾配更新則を用いて、安定的かつ効率的な学習を可能にすること。
  • モデルの複雑さを低減させながら、順序付き学習タスクで最先端の性能を達成すること。

提案手法

  • 再帰的重み行列 W を歪対称行列 A を用いてスケーリング・ケイリー変換によりパrameter化する:W = (I - sA)(I + sA)^{-1}、ここで s は ±1 の要素を持つ対角スケーリング行列である。
  • 標準ケイリー変換で生じる固有値 -1 における特異性を回避するために、スケーリング・ケイリー変換を用いる。
  • 各学習ステップで A から W を再構築しながら、歪対称行列 A に対して直接勾配降下法を適用する。
  • バックプロパゲーション中に A に対して単純な加法的更新則を適用し、学習中でも W が常に直交的であることを保証する。
  • 標準的なRNNアーキテクチャを用い、直交的 W を維持するが、複素数行列や制約付き最適化ではなく、パrameterizationによる方法を採用する。
  • 各フォワードパスで A を用いて W をスケーリング・ケイリー変換で計算し、標準的な時間方向の誤差逆伝播法を用いてモデルをエンドツーエンドで学習する。

実験結果

リサーチクエスチョン

  • RQ1複素数や制限付きパrameter空間を用いずに、実数値RNNが直交的再帰的重み行列を維持できるか?
  • RQ2スケーリング・ケイリー変換は、標準ケイリー変換の固有値 -1 特異性を効果的に回避できるか?
  • RQ3歪対称行列に対する単純な加法的更新則は、数値丸め誤差下でも直交性を維持できるか?
  • RQ4得られた scoRNN は、パラメータ数を減らしたにもかかわらず、既存のユニタリまたは直交的RNNよりも優れた性能を示せるか?
  • RQ5長期間のシーケンスにおいて、scoRNNの勾配フローは、標準RNNやLSTMと比較して、勾配消失/爆発の観点でどのように異なるか?

主な発見

  • scoRNNは、追加問題やアンパーミューテッドMNISTを含む、複数の順序付き学習タスクで、他のユニタリRNNよりも少ないトレーニング可能なパラメータで優れた性能を達成する。
  • T=500 の追加問題において、scoRNNの勾配はシーケンス全体で1桁未満(10^{-3} から 10^{-4})にしか減衰せず、LSTMと比べて著しく大きな減衰を示さない。
  • n=170 の隠れユニットを有する scoRNN は、n=512 の制限付き能力uRNNの1.5倍、n=116 のフル能力uRNNの2倍速く、パラメータ数はほぼ同等である。
  • ~137kパラメータのモデルにおいて、scoRNNは1エポックあたり11.2分を要するが、フル能力uRNNは25.8分を要し、顕著な高速化効果が確認された。
  • すべての実験で滑らかで安定した収束曲線を示し、強固な学習ダイナミクスを示している。
  • 長期間のシーケンスにおいても勾配ノルムが安定しており、勾配消失および勾配爆発を効果的に緩和できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。