Skip to main content
QUICK REVIEW

[論文レビュー] Deep RNN Framework for Visual Sequential Applications

Bo Pang, Kaiwen Zha|arXiv (Cornell University)|Nov 25, 2018
Human Pose and Action Recognition参考文献 53被引用数 5
ひとこと要約

この論文では、視覚的連続的タスクのための非常に深いRNNの有効な学習を可能にするために、コンテキストブリッジモジュール(CBM)とオーバーラップコherェンストレーニング方式を備えた深層RNNフレームワークを提案する。CBMは時系列情報と表現情報の流れを分離し、トレーニング方式により重なり合う短いクリップを用いることで計算コストを低減する。これにより、15層のネットワークを構築でき、Kinetics、UCF-101、HMDB-51の動画分類タスクで11%以上の相対的精度向上を達成する。

ABSTRACT

Extracting temporal and representation features efficiently plays a pivotal role in understanding visual sequence information. To deal with this, we propose a new recurrent neural framework that can be stacked deep effectively. There are mainly two novel designs in our deep RNN framework: one is a new RNN module called Context Bridge Module (CBM) which splits the information flowing along the sequence (temporal direction) and along depth (spatial representation direction), making it easier to train when building deep by balancing these two directions; the other is the Overlap Coherence Training Scheme that reduces the training complexity for long visual sequential tasks on account of the limitation of computing resources. We provide empirical evidence to show that our deep RNN framework is easy to optimize and can gain accuracy from the increased depth on several visual sequence problems. On these tasks, we evaluate our deep RNN framework with 15 layers, 7* than conventional RNN networks, but it is still easy to train. Our deep framework achieves more than 11% relative improvements over shallow RNN models on Kinetics, UCF-101, and HMDB-51 for video classification. For auxiliary annotation, after replacing the shallow RNN part of Polygon-RNN with our 15-layer deep CBM, the performance improves by 14.7%. For video future prediction, our deep RNN improves the state-of-the-art shallow model's performance by 2.4% on PSNR and SSIM. The code and trained models are published accompanied by this paper: https://github.com/BoPang1996/Deep-RNN-Framework.

研究の動機と目的

  • 時系列情報と表現情報の流れが混同しているため、非常に深いRNNを視覚的連続的タスクに学習させるという課題に対処すること。
  • 長時間の動画シーケンスにおける深層RNNの学習に伴う高い計算コストとメモリ消費を低減すること。
  • より深いアーキテクチャを可能にし、動画分類、アクション予測、動画予測タスクの性能を向上させること。
  • トレーニング中にシーケンス長を著しく短縮しつつも、時系列の一貫性を維持するトレーニング方式を設計すること。

提案手法

  • 時系列フローと表現フローを、マージする前に2つの独立した計算ユニットに分離するコンテキストブリッジモジュール(CBM)を導入する。
  • 訓練の初期段階で、時系列情報のバックプロパゲーションを抑制するための時系列ドロップアウト(TD)を採用し、両フロー間の干渉を低減する。
  • 長時間のシーケンスを重なり合う短いクリップに分割することで、メモリと計算コストを削減するオーバーラップコherェンストレーニング方式を提案する。
  • 隣接するクリップ間で予測の一貫性を強制するためのオーバーラップコherェンス損失を用い、厳密なマルコフ仮定を課さずに時系列の一貫性を維持する。
  • 2つのフローのマージに要素ごとの積または加算を用い、アブレーション実験により積がより優れた性能を示す。
  • バックボーンとしてVGG19を採用し、15層のCBMをスタックして深層RNNアーキテクチャを構築する。

実験結果

リサーチクエスチョン

  • RQ1勾配消失と計算コストの問題があるにもかかわらず、10層を超える非常に深いRNNアーキテクチャが視覚的シーケンスモデリングに成功するか。
  • RQ2RNNにおける時系列フローと表現フローの分離が、深層ネットワークにおける学習安定性と性能向上に寄与するか。
  • RQ3重なり合う短いクリップに基づくトレーニング方式が、計算複雑性を低減しつつも、長時間シーケンスの一貫性を保持できるか。
  • RQ4マージ関数の選択(例:積対加算)が、深層RNNにおけるモデル性能に与える影響は何か。
  • RQ5トレーニング中に時系列フローと表現フローのバランスを取るために最適なTDレートは何か。

主な発見

  • 15層のCBMを備えた深層RNNフレームワークは、浅いRNNモデルと比較して、Kinetics、UCF-101、HMDB-51で11%以上の相対的精度向上を達成する。
  • Polygon-RNNにおける浅いRNNを15層のCBMに置き換えることで、CityscapesでのIoUが14.7%向上する。
  • 動画の未来予測タスクにおいて、深層RNNは従来の最先端の浅いモデルと比較して、PSNRとSSIMがそれぞれ2.4%向上する。
  • TDレート0.5が最良の性能を示し、TDレート1.0では層間の時系列フローが完全に分離されるため、性能が著しく低下する。
  • オーバーラップコherェンストレーニング方式により、有効なシーケンス長を短縮しつつも時系列の一貫性を維持できるため、標準的なGPUで深層RNNの学習が可能になる。
  • 要素ごとの積によるマージ関数が加算を上回る性能を示しており、フローの非対称的統合が動画分類の表現学習を強化することが示唆される。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。