[論文レビュー] Compressing Recurrent Neural Networks with Tensor Ring for Action Recognition
本稿では、RNNにおける入力-隠れ層重み行列の圧縮にテンソルリング分解(TRD)を用いるコンactなLSTMであるTR-LSTMを提案する。この手法により、高い精度を維持したままパラメータ数を顕著に削減できる。TR-LSTMはUCF11で34,000以上の圧縮比を達成し、エンドツーエンド学習において標準LSTM、TT-LSTM、BT-LSTMを上回る性能を示した。
Recurrent Neural Networks (RNNs) and their variants, such as Long-Short Term Memory (LSTM) networks, and Gated Recurrent Unit (GRU) networks, have achieved promising performance in sequential data modeling. The hidden layers in RNNs can be regarded as the memory units, which are helpful in storing information in sequential contexts. However, when dealing with high dimensional input data, such as video and text, the input-to-hidden linear transformation in RNNs brings high memory usage and huge computational cost. This makes the training of RNNs unscalable and difficult. To address this challenge, we propose a novel compact LSTM model, named as TR-LSTM, by utilizing the low-rank tensor ring decomposition (TRD) to reformulate the input-to-hidden transformation. Compared with other tensor decomposition methods, TR-LSTM is more stable. In addition, TR-LSTM can complete an end-to-end training and also provide a fundamental building block for RNNs in handling large input data. Experiments on real-world action recognition datasets have demonstrated the promising performance of the proposed TR-LSTM compared with the tensor train LSTM and other state-of-the-art competitors.
研究の動機と目的
- 高次元の動画データを処理する際、RNNにおける入力-隠れ層変換にかかるパラメータ数の多さと計算コストの問題に対処すること。
- テンソルトレイン分解(TTD)の限界、例えばきついランク制約やコアの順序への感受性を克服すること。
- 性能を維持したままモデルサイズを顕著に削減できる安定した低ランクRNNアーキテクチャの開発。
- 微分可能なテンソルリング層をプラグイン部品として用いることで、圧縮されたRNNのエンドツーエンド学習を可能にすること。
- 実世界の行動認識ベンチマークにおいて、最先端の低ランクRNN手法と比較して優れた圧縮性能と精度を示すこと。
提案手法
- 標準LSTMにおける入力-隠れ層重み行列を高次元テンソルに再形状し、テンソルリング分解(TRD)を用いて要因分解する。
- TRDは重みテンソルを低ランクコアテンソルの円環構造に分解することで、効率的なパラメータ共有とパラメータ間相関のモデル化を可能にする。
- TR層は微分可能であり、LSTMの計算グラフにスムーズに統合可能で、エンドツーエンドの誤差逆伝播が可能である。
- 最初と最後のコアテンソル間に円環接続を設けることで、テンソルトレイン分解のきついランク制約を緩和する。
- ハイパーパrameter(TRランクなど)を性能と圧縮比に最適化しながら、動画行動認識データセットでエンドツーエンド学習を実施する。
- 本手法は一般化可能であり、LSTMに限らず、バニラRNNやGRUに対しても適用可能である。
実験結果
リサーチクエスチョン
- RQ1テンソルリング分解は、モデル性能を維持したままRNNの入力-隠れ層重み行列を効果的に圧縮できるか?
- RQ2行動認識タスクにおいて、TR-LSTMはTT-LSTMやBT-LSTMと比較して、圧縮比と精度の点で優れているか?
- RQ3極端なパラメータ圧縮下でも、TR-LSTMモデルは安定性と一般化性能を維持できるか?
- RQ4TR層は、性能の低下を伴わずにRNNのエンドツーエンド学習に効果的に使用できるか?
- RQ5TR-LSTMアーキテクチャは、動画理解における既存のLSTMベースモデルに統合可能なプラグインモジュールとして適しているか?
主な発見
- UCF11データセットにおいて、TR-LSTMは標準LSTMと比較して34,000以上の圧縮比を達成し、TT-LSTMやBT-LSTMを顕著に上回った。
- UCF11において、TR-LSTMはエンドツーエンド学習で86.9%の精度を達成し、標準LSTM(68.1%)、TT-LSTM(80.3%)、BT-LSTM(85.6%)を上回った。
- InceptionV3の特徴量を入力として用いた場合、TR-LSTMはわずか0.7Mパラメータで63.8%の精度を達成し、I3Dの25Mパラメータを上回った。
- TRDの円環コア構造の頑健性のおかげで、極端な圧縮下でもTR-LSTMモデルは高い安定性と一般化性能を維持した。
- TR層は優れた表現力と柔軟性を示し、パラメータ数が少ないにもかかわらず、TT-LSTMを上回る性能を発揮した。
- 本手法は拡張可能であり、2ストリームLSTMのような高度なRNNアーキテクチャに対しても、基本的部品として統合可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。