Skip to main content
QUICK REVIEW

[論文レビュー] Learning Compact Recurrent Neural Networks with Block-Term Tensor Decomposition

Jinmian Ye, Linnan Wang|arXiv (Cornell University)|Dec 14, 2017
Tensor decomposition and applications参考文献 47被引用数 17
ひとこと要約

本稿では、ブロック・テームテンソル分解を用いて、モデルパラメータを著しく削減するとともに、学習効率と性能を向上させる、コンactで効率的な再帰的ニューラルネットワークアーキテクチャであるBlock-Term RNN(BT-RNN)を提案する。密度行列を低ランクテンソル構造に置き換えることで、標準LSTMと比較して17,388倍もパラメータを削減し、UCF11行動認識データセットにおいて15.6%以上の精度向上を達成した。

ABSTRACT

Recurrent Neural Networks (RNNs) are powerful sequence modeling tools. However, when dealing with high dimensional inputs, the training of RNNs becomes computational expensive due to the large number of model parameters. This hinders RNNs from solving many important computer vision tasks, such as Action Recognition in Videos and Image Captioning. To overcome this problem, we propose a compact and flexible structure, namely Block-Term tensor decomposition, which greatly reduces the parameters of RNNs and improves their training efficiency. Compared with alternative low-rank approximations, such as tensor-train RNN (TT-RNN), our method, Block-Term RNN (BT-RNN), is not only more concise (when using the same rank), but also able to attain a better approximation to the original RNNs with much fewer parameters. On three challenging tasks, including Action Recognition in Videos, Image Captioning and Image Generation, BT-RNN outperforms TT-RNN and the standard RNN in terms of both prediction accuracy and convergence rate. Specifically, BT-LSTM utilizes 17,388 times fewer parameters than the standard LSTM to achieve an accuracy improvement over 15.6\% in the Action Recognition task on the UCF11 dataset.

研究の動機と目的

  • 高次元入力を処理する際のRNNの高い計算コストとパラメータの爆発を解消すること、特に動画や画像系列タスクにおいて。
  • 標準LSTMにおける密度的かつ完全接続された演算の非効率性を、構造的で低ランクのテンソル分解に置き換えること。
  • パラメータ効率が高く、シーケンスモデリングタスクにおける性能を維持または向上させる、より優れたRNNアーキテクチャの開発。
  • テンソル分解による冗長な接続の暗黙的プルーニングにより、より速い学習とより良い一般化性能を実現すること。

提案手法

  • LSTMの入力から隠れ層への重み行列(W*)を、低ランクタッカー成分の和に分解するブロック・テームテンソル分解(BTD)を適用し、パラメータ数を削減する。
  • 入力ベクトルxtと重み行列W*を高次元テンソルとして表現し、潜在的な空間的および特徴相関を活用する。
  • 訓練中にパラメータ間の相関関係を学習するBTD層を導入し、冗長な密度的接続を自動的にプルーニングする。
  • BTD層をLSTMセルに統合し、BT-LSTMを構築。標準的な行列-ベクトル乗算W*·xtを、コンactなテンソルベースの演算に置き換える。
  • BTD分解を介して勾配を計算する標準的な誤差逆伝播法を最適化し、エンドツーエンド微分可能を維持する。
  • コア順序(d)、タッカー・ランク(R)、CPランク(N)の3つのハイパーパrameterでモデル容量を制御し、精度と効率の間で柔軟なトレードオフを可能にする。

実験結果

リサーチクエスチョン

  • RQ1ブロック・テームテンソル分解は、性能を損なわせることなく、RNNのパラメータ数を著しく削減できるか?
  • RQ2TT-RNNなどの既存の低ランクRNNと比較して、BT-RNNはパラメータ効率と近似精度の面で優れているか?
  • RQ3提案されたBT-LSTMアーキテクチャは、行動認識や画像キャプションといったシーケンスモデリングタスクで、より速い収束と高い精度を達成できるか?
  • RQ4主なハイパーパrameter(d, R, N)がモデル性能とパラメータ数に与える影響は何か?

主な発見

  • UCF11行動認識データセットにおいて、BT-LSTMは標準LSTMと比較して、パラメータ数を最大17,388倍まで削減した。
  • UCF11データセットにおいて、BT-LSTMは標準LSTMと比較して15.6%以上の精度向上を達成したが、パラメータ数ははるかに少ない。
  • 行動認識、画像キャプション、画像生成の3つのタスクにおいて、BT-LSTMは予測精度と収束速度の両面で、標準LSTMおよびTT-RNNを上回った。
  • 感度分析の結果、タッカー・ランク(R)はモデル性能に指数的影響を及ぼすことが判明したが、Rが小さい場合、CPランク(N)を増やすことでモデルのロバストネスが向上した。
  • コア順序(d)をある閾値を超えて増加させると、空間的情報が失われ、再構成品質が劣化することが示された。これは、dに最適な範囲が存在することを示唆している。
  • BTDに基づくモデルは、画像特徴の局所的相関を標準LSTMよりも効果的に捉えており、画像キャプションの品質向上と可視化された重み行列の結果から裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。