Skip to main content
QUICK REVIEW

[論文レビュー] Towards Extremely Compact RNNs for Video Recognition with Fully Decomposed Hierarchical Tucker Structure

Miao Yin, Siyu Liao|arXiv (Cornell University)|Apr 12, 2021
Tensor decomposition and applications参考文献 27被引用数 5
ひとこと要約

本論文は、入力から隠れ層および隠れ層から隠れ層への重み行列の両方に階層的タッカーtensor分解を適用する、完全分解型階層的タッカー長短期記憶(FDHT-LSTM)という新しいRNNアーキテクチャを提案する。これにより、極めて高いモデル圧縮が可能となる。この手法は、動画認識タスクにおいて、3,132〜8,808パラメータという極めて少ないパラメータ数で最先端の精度を達成し、ベースラインLSTMと比較して最大10,711倍のパラメータ削減を実現するとともに、最大12.7%の精度向上を達成した。

ABSTRACT

Recurrent Neural Networks (RNNs) have been widely used in sequence analysis and modeling. However, when processing high-dimensional data, RNNs typically require very large model sizes, thereby bringing a series of deployment challenges. Although various prior works have been proposed to reduce the RNN model sizes, executing RNN models in resource-restricted environments is still a very challenging problem. In this paper, we propose to develop extremely compact RNN models with fully decomposed hierarchical Tucker (FDHT) structure. The HT decomposition does not only provide much higher storage cost reduction than the other tensor decomposition approaches but also brings better accuracy performance improvement for the compact RNN models. Meanwhile, unlike the existing tensor decomposition-based methods that can only decompose the input-to-hidden layer of RNNs, our proposed fully decomposition approach enables the comprehensive compression for the entire RNN models with maintaining very high accuracy. Our experimental results on several popular video recognition datasets show that our proposed fully decomposed hierarchical tucker-based LSTM (FDHT-LSTM) is extremely compact and highly efficient. To the best of our knowledge, FDHT-LSTM, for the first time, consistently achieves very high accuracy with only few thousand parameters (3,132 to 8,808) on different datasets. Compared with the state-of-the-art compressed RNN models, such as TT-LSTM, TR-LSTM and BT-LSTM, our FDHT-LSTM simultaneously enjoys both order-of-magnitude (3,985x to 10,711x) fewer parameters and significant accuracy improvement (0.6% to 12.7%).

研究の動機と目的

  • リソース制約のある環境への大規模なRNNモデルの導入を課題とするが、特に高次元の動画データに対して有効である。
  • 従来のtensor分解手法が入力から隠れ層の層にのみ圧縮を適用しており、隠れ層から隠れ層の重みは圧縮されていないという制限を克服する。
  • 高い精度を維持しつつ、RNNにおける極めて高いパラメータ削減を実現する圧縮手法を開発する。
  • 階層的タッカー分解が、従来のtensor分解形式(例:TT、TR、BT)よりも、圧縮効率と精度保持の両面で優れているかどうかを検証する。

提案手法

  • FDHT-LSTMモデルは、LSTMの入力から隠れ層および隠れ層から隠れ層への重み行列の両方に階層的タッカー(HT)分解を適用し、完全なモデル圧縮を実現する。
  • 入力および出力の特徴ベクトルは、4次元テンソル(例:8×8×8×8)に再形状され、多次元tensor分解を可能にする。
  • モデルの容量と圧縮率を制御するため、リーフランクをUCF11では9、HMDB51では14と設定し、非リーフランクをそれぞれ6および12とする階層的構造を採用する。
  • 忘却ゲート、入力ゲート、セルゲート、出力ゲートの重みを含む、すべての再帰的重み行列に分解を適用することで、エンドツーエンドの圧縮を保証する。
  • ADAM最適化法を用い、L2正則化(0.0001)とドロップアウト(0.5)を適用し、事前学習済みのInception-V3をフロントエンド特徴抽出器として使用してモデルを訓練する。
  • 階層的タッカー構造により、TT、TR、BT分解と比較して、より高いストレージコスト削減と優れた精度を実現できる。

実験結果

リサーチクエスチョン

  • RQ1RNNの入力から隠れ層および隠れ層から隠れ層への重み行列の両方を完全に分解することで、精度の劣化を伴わず顕著なパラメータ削減が可能になるか?
  • RQ2階層的タッカー分解は、動画認識タスクにおいて、圧縮比と精度保持の両面で、従来のtensor分解手法(例:TT、TR、BT)を上回るか?
  • RQ3動画認識ベンチマークで高い精度を維持しつつ、RNNモデルを10,000パラメータ未満に圧縮できるか?
  • RQ4FDHT-LSTMは、TT-LSTM や TR-LSTM といった最先端の圧縮RNNと比較して、パラメータ数とテスト精度の両面で優れているか?

主な発見

  • UCF11データセットにおいて、FDHT-LSTMは2200万パラメータでトップ-1精度98.4%を達成し、TR-LSTM(93.8%)およびボトムアップLSTM(92.3%)を上回った。
  • UCF11では、ベースラインLSTMと比較して最大10,711倍のパラメータ削減を実現した一方で、最高の先行研究より3.8%の精度向上を達成した。
  • HMDB51では、2200万パラメータで64.2%の精度を達成し、Two-Stream I3D(66.4%)と同等の性能を示したが、はるかに少ないパラメータ数を実現した。
  • 両データセットにおいて、同じ事前学習済みCNNフロントエンドを使用した場合、FDHT-LSTMはTR-LSTMと比較してモデルサイズを2.5倍小さくした。
  • UCF11において、FDHT-LSTMはTR-LSTMと比較して12.7%の精度向上を達成し、極めて高い圧縮率下でも優れた精度保持を示した。
  • 著者らの知る限り、FDHT-LSTMは、動画認識タスクにおいて3,132〜8,808パラメータという極めて少ないパラメータ数で98%を超える高い精度を達成した最初のRNNモデルである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。